服务级别跟踪
逐周关注贵产品约定的可用性和性能目标,在趋势走向不对劲、演变成一次故障之前就发出警示。
一旦产品拥有真实用户、停机会带来真实代价,并且可靠性工作一直不均衡地落在同时还要负责开发新功能的开发者身上,企业往往就会考虑在迪拜聘请站点可靠性工程师。这不是一次简短的审计,而是一个加入团队、持续负责服务健康状况的人,月复一月,以产品在生产环境中的实际表现来接受评判。
Google 官方的 SRE 手册说得很直白:站点可靠性工程就是“让软件工程师去设计一支运维团队时会发生的结果”,用自动化系统取代手动运维工作。这种界定对专职聘用尤其重要,因为它描述的是一个会写代码来减少繁琐重复工作的人,而不是一个只盯着仪表盘、被动反应的人。
本页说明一位专职站点可靠性工程师加入迪拜团队后实际做什么、应检查哪些技能,以及这个岗位与建立可靠性实践的较短合作有何不同,后者由我们的 SRE 咨询页面单独涵盖。
专职工程师负责什么
只有作为嵌入团队内的常设岗位才有意义的工作。
逐周关注贵产品约定的可用性和性能目标,在趋势走向不对劲、演变成一次故障之前就发出警示。
在出问题时主导响应、运行轮值安排,并在事后写出复盘,确保同样的故障不会重演。
把团队目前为维持服务运行而手动完成的任务自动化,把开发者的时间解放出来用于构建,而不是救火。
对照增长情况监控资源使用,让产品能在压力下提前扩展,而不是等到繁忙时段才被迫反应。
与开发者协作,采用更安全的发布方式,例如逐步上线,让一次不佳的部署只影响一小部分用户,而不是所有人。
在事件之后进行不追责的复盘,重点关注系统允许发生了什么,而不是当时是谁在值班。
重要技能
要看重真正的责任担当证据,而不只是对监控工具有所耳闻。
| 技能或工具 | 优秀表现的样子 | 为何重要 |
|---|---|---|
| 监控与告警 | 已经把告警调优到只在真正出问题时触发,而不是每个小波动都响 | 告警疲劳会导致真正的事故被漏掉 |
| 编码能力 | 能编写真正的自动化和工具,而不只是凭记忆粘贴的 shell 脚本 | 按 SRE 手册自己的说法,减少重复性人工工作需要真正的软件工程能力 |
| 事件主导能力 | 曾作为响应协调人,在压力下冷静地主导过一次事件 | 混乱的响应会把一次小故障拖成一次长时间的故障 |
| 复盘撰写 | 能展示一份真实的复盘文档,聚焦系统性原因而非追责 | 没有这个习惯,同样的故障往往会重演 |
| 愿意长期主导值班轮换 | 真正愿意承担这份持续责任,而不只是想做一个短期项目 | 专职岗位只有在这个人过了最初几周后仍保持投入时才真正奏效 |
值得直接询问候选人是否读过 Google SRE 手册,以及他们基于真实经验,在哪些地方认同或不认同书中的观点,这比简历上罗列一堆监控工具名称更能说明问题。当客户委托我们通过招聘支持为迪拜团队寻源站点可靠性工程师时,这张表正是我们据以工作的简报。
与我们合作的方式
大多数希望在迪拜聘请专职站点可靠性工程师的企业,都已经过了一次简短合作就能解决问题的阶段。这个岗位需要一个人嵌入您的团队,加入您的值班轮换,周复一周地对同一个产品负责,这正是我们的专职开发工程师模式所提供的。如果企业反而希望先自行设计可靠性实践,目标、错误预算政策和事件流程,再决定是否要永久聘用,那属于一次较短的咨询合作,由我们的 SRE 页面涵盖。如果客户希望把这个人直接聘用到自己的编制内,而不是与我们持续进行专职合作,招聘支持同样可用。
评估候选人
能够揭示真实运维责任担当的问题。
可以委托我们作为招聘支持的一部分来运行这项评估,也可以在确认一次专职合作前自行使用。
出了什么问题、如何被发现、他们做了什么,以及之后做了哪些改动以防止同样的情况重演。
优秀的候选人心里有具体的数字和目标,而不只是模糊地感觉“保持运行”。
取代了某项手动重复任务的东西,以及它上线后团队的工作量发生了什么变化。
他们如何调节节奏、避免倦怠,并随时间改进轮值安排,因为这本应是一个持续的岗位,而不是一次冲刺。
真正拦下过一次有风险部署、并能说明原因的候选人,才真正理解这个岗位的实际权限。
认证
目前没有单一机构为“站点可靠性工程”本身颁发认证。
云服务商提供在其自身平台内触及可靠性实践的认证,例如 Google Cloud 的 Professional Cloud DevOps Engineer 资质,专门涵盖在 Google Cloud 上的监控、事件响应和服务级别目标。
Google SRE 手册是这个领域被引用最广的资料来源,而不是一个认证机构,因此不妨直接请候选人谈谈它。一份真实的复盘文档和一次真实的事件经历,比在迪拜聘请站点可靠性工程师时的任何徽章都更有分量。
阿联酋相关要点
当事件响应涉及客户数据时会出现的一个方面。
排查一次正式事件,常常意味着要调取包含客户数据的日志或数据库记录。《2021 年第 45 号联邦法令》,即阿联酋的联邦数据保护法,在事件发生期间同样适用,这一点值得在迪拜聘请站点可靠性工程师时提前提出,而不是等第一次停机发生时才想起来。
对大多数迪拜客户而言,一条清晰、坦诚、用通俗语言写就的事件更新,比技术细节本身更重要。提前建立一套简单的状态更新模板,是值得与一位专职工程师尽早商定的一个小而实际的步骤。
直接解答
一个或多个正式上线服务的健康状况:是否正常运行、响应速度如何、事件如何处理,以及能减少重复性人工工作的自动化。这与构建新功能是不同的关注重点。
咨询适合搭建实践方法、SLO 和流程。专职聘用则适合一个已经上线、拥有真实用户的产品,需要有人每周持续负责正常运行时间和值班,而不只是设计一次方案。
它可以减少日常事件对开发者的依赖,但一个健康的值班轮换通常仍会包含最了解代码的人。专职工程师通常是带领并改进轮换机制,而不是把其他所有人都排除在外。
在运作良好的体系中,大部分时间用于自动化、监控和预防,事件响应只占较小比例。如果事件每周都占主导,这本身就是一个信号,说明这个岗位或系统需要关注。
通常是拥有真实客户在使用的正式上线产品,停机会带来直接成本,并且目前可靠性工作不均衡地落在本就忙于功能开发的开发者身上的企业。
资料来源
书面固定价格
已收到,我们正在为您撰写报价。
工作时间内您将在 45 分钟内收到。请查收确认邮件。