基础设施即代码
网络、计算和存储资源在受版本控制的模板中定义,而不是手动搭建,让环境可以像其他代码一样被重建和审查。
迪拜企业往往在应用已经发展到无法靠人手动重启来解决故障的阶段时,才会考虑迪拜聘请云工程师。这一角色偏重云端工作的运维一侧:配置应用所依赖的服务器、网络、存储和流水线,持续监控它们,并在出现故障时负责响应,而不是编写应用本身的功能。这与云开发工程师的区分很重要,因为这两项技能并不总是集中在同一个人身上,尤其是当系统规模大到两个岗位都需要全职投入的时候。
美国国家标准与技术研究院对云计算的说明,将快速、基本自动化的资源配置列为其核心特征之一,而云工程师的工作,正是为您的具体系统构建并运维出能实现这一点的自动化机制,而不是每次都手动配置资源。本页以不特定服务商的方式介绍这一角色;如果基础设施已经运行在某一家指定平台上,我们的AWS 云工程师页面专门针对该技术栈撰写。
云工程师负责的内容
基础设施本身,以及维持其健康运行的各类系统。
网络、计算和存储资源在受版本控制的模板中定义,而不是手动搭建,让环境可以像其他代码一样被重建和审查。
自动完成测试、构建和发布应用变更的流程,省去容易出错的手动部署步骤。
在客户察觉之前发现问题的仪表盘和告警,经过调优,不会因为无关紧要的噪音而打扰团队。
只授予每个人或每个系统实际所需的最小权限,并在项目或角色结束时及时收回。
让开发、预发布和生产环境保持足够一致,使在某个环境中通过测试的变更,在其他环境中表现相同。
关注基础设施的实际花费与实际需求是否匹配,按需调整资源规模,而不是任其不受控制地增长。
多数迪拜团队在聘请云工程师时,需要的是能同时兼顾以上六个领域的人,因为搭建得好但无人监控,或监控得好但全靠手动搭建的基础设施,往往会以同样可预见的方式出问题。
值得关注的技能
运维层面的严谨性,而不只是熟悉某个服务商的控制台。
| 技能或工具 | 合格的表现 | 为何重要 |
|---|---|---|
| 基础设施即代码 | 把从受版本控制的模板构建环境作为标准做法,而不是偶尔为之 | 手动搭建的基础设施难以复现、审查或回滚 |
| CI/CD 流水线工具 | 曾经搭建过、而不只是使用过一条测试和部署应用变更的流水线 | 只能操作、无法调整的流水线会变成瓶颈 |
| 监控与日志 | 能设置有意义的告警和仪表盘,并能讲述一次自己提前发现的真实事故 | 没有可见性的基础设施会悄无声息地失效,直到客户投诉 |
| 身份与访问管理 | 默认应用最小权限原则,并能说明某项权限为何是必要的 | 权限设置过宽是云安全事故最常见的诱因之一 |
| 事故响应 | 面对故障有冷静而结构化的处理方式,包括事故期间如何沟通 | 工程师在事故中的表现,与最终的修复方案同样重要 |
AWS 官方将其Well-Architected 框架描述为一套用于可靠、安全地运行工作负载的设计原则,而无论使用哪家云服务商,一位出色的云工程师即使没有成文规范,也会按照同等标准去工作。
合作方式
专属工程师适合已有基础设施、需要持续关注的场景:新环境、日益复杂的流水线、随时间累积的事故和成本管理。限定范围项目适合为某个明确系统从零搭建基础设施,交付时附带文档并完成交接。招聘支持服务适合希望将这个人长期招入自有团队的企业,由我们负责寻访候选人并主导技术评估。咨询服务适合针对现有配置做一次简短而聚焦的审查,例如在安全审计或扩容问题出现之前。
候选人评估
区分真正运维基础设施的人和只会看控制台的人的考察方式。
您可以自行使用以下考察方式,也可以请我们作为招聘支持服务中技术评估环节的一部分代为运行。
真实的基础设施即代码,展示的是一个人实际的工作方式,而不是对控制台界面的描述。
出了什么问题、如何发现的,以及事后做了哪些改动来避免同样的问题再次发生。
一个资源配置过度、后来又在不破坏任何功能的前提下降低账单的具体例子。这是在迪拜聘请云工程师时值得问的问题,因为悄然增长的云支出,是我们最常听到的遗憾之一。
询问他们会如何在新成员入职第一天设置访问权限,以及该成员离职时又如何收回权限。
迪拜大多数云工程工作,都是接手他人搭建的基础设施,因此可以问问对方如何安全地摸清一个陌生环境。
无论采用哪种考察方式,在迪拜聘请云工程师的目标,都是找到一个能让系统保持”无趣”这一最佳状态的人:可预测、有监控、能快速恢复。
认证
主流云服务商推出的运维方向认证,对这一角色而言是一项合理且可核实的参考信号。
根据 AWS 官方认证页面,AWS 设有 AWS Certified CloudOps Engineer Associate 认证,涵盖监控、安全控制、网络和成本优化。Azure 和 Google Cloud 也都设有类似的运维方向助理级认证。
请候选人用自己的话完整讲述一次事故的始末,再和他们持有的任何证书对照来看。一段冷静而具体的真实故障讲述,比证书本身更能说明问题。
在迪拜聘请云工程师时,证书可以作为初步筛选的合理依据,但绝不应取代上文的事故讲述环节。
阿联酋相关事项
两个在真实迪拜基础设施项目中经常出现的方面。
阿联酋官方对2021 年第 45 号联邦法令的说明,对个人数据的跨境传输设定了规则,因此存储客户或员工数据的基础设施,应有意识地配置在特定区域,而不是沿用默认区域。
根据 AWS 官方公告,其包含三个可用区的中东(阿联酋)区域已上线,可承载生产环境工作负载,这一点值得在阿联酋基础设施简报中明确提出。
直接解答
配置云资源,通常通过代码而不是在控制台里点击操作,搭建用于部署应用变更的流水线,监控故障和成本异常,并负责处理事故中涉及基础设施的部分。这更接近于运维一套系统,而不是编写应用功能。
两者的根本目标相似,都是让系统保持可用,但云工程师主要通过云服务商的 API 和基础设施即代码来工作,而不是逐台登录物理服务器,通常也会把更多常规工作自动化。
非常小型的应用可能只需要偶尔关注,我们的项目制或咨询模式即可覆盖。一旦应用有了真实用户,一旦宕机会带来实际后果,持续的监控和维护就值得投入专职或兼职人力。
可以,这是常见的工作,通常以限定范围项目的形式交付:根据明确的简报搭建账户、网络、各类环境和部署流水线,并附带文档完成交接。
如果您的基础设施已经运行在某一家云服务商上,那么专精是有必要的,因为各家的工具和惯例差异足以造成影响。如果您仍在选择服务商,或者确实需要同时支持多家,不区分服务商的云工程师,或我们的多云架构师角色会更合适。
资料来源
书面固定价格
已收到,我们正在为您撰写报价。
工作时间内您将在 45 分钟内收到。请查收确认邮件。