针对 AI 行为的自动化测试
一套测试体系,依据一组具有代表性的输入和明确的标准检验 AI 功能的输出,在任何修改上线前自动运行。
一个能正常运行的演示和一项生产环境中的功能是两回事,这中间的差距,正是迪拜企业最终需要在迪拜招聘 AI 软件工程师的原因。一个在小范围内部演示中能很好地回答问题的概念验证,一旦真实客户输入真正古怪的内容,一旦使用量超出任何人测试过的范围,或者一旦某个失控的进程悄悄推高了 AI 厂商的账单,表现可能会大不相同。AI 软件工程师把 AI 功能当作软件来对待,认为它需要和其他任何生产系统一样的工程严谨性,经过测试、监控和控制,而不只是依赖 AI 本身在做什么。
这与 AI 本身的工作重点不同。AI 开发工程师或 AI 工程师主要被评判的标准,是这项功能是否把任务完成得好。AI 软件工程师被评判的标准,则是它能否在真实规模下持续可靠地完成任务,在模型出错时能否安全失效,以及是否不会变成一项没人规划过、不断攀升的运行成本。正是这种对可靠性的关注,让迪拜企业在一项功能从演示走向生产环境时,会招聘 AI 软件工程师。
这个角色能交付什么
这是您在迪拜招聘 AI 软件工程师后实际获得的成果,围绕功能本身的严谨性,而不是底层模型本身。
一套测试体系,依据一组具有代表性的输入和明确的标准检验 AI 功能的输出,在任何修改上线前自动运行。
在实际使用模型返回的内容之前先对其进行检查的代码,拦截格式错误或异常的响应,而不是直接传递给用户。
速率限制和用量上限,防止单个用户或某个失控进程意外推高 AI 厂商的账单。
当模型不可用、响应过慢或明显出错时,一套明确且经过测试的应对方案,让功能优雅降级,而不是直接崩溃。
追踪延迟、错误率和每次请求成本的仪表盘,让问题在数小时内就能被发现,而不是等客户投诉后才知道。
输入过滤和输出检查,降低用户操纵 AI 功能去做不该做之事的风险。
值得关注的技能
生产环境软件的严谨性,专门应用于 AI 特有的失效模式。
| 技能或领域 | 良好水平的表现 | 为什么重要 |
|---|---|---|
| 测试 AI 行为 | 针对具有代表性的输入搭建自动化测试,而不仅是发布前的人工抽查 | 未经测试的 AI 行为,会随着底层模型或提示词的变化悄悄漂移而不被察觉 |
| 成本意识 | 在搭建之前,就能大致说明某种设计方案的运行成本会如何随使用量增长而变化 | 一项在试点阶段看起来没问题的 AI 功能,一旦成功推广,成本可能迅速攀升 |
| 专门针对 AI 的安全意识 | 理解 AI 功能特有的风险,例如用户试图通过精心构造的输入操纵模型 | 仅靠标准的网络安全检查,无法发现 AI 特有的失效模式 |
| 可靠性工程 | 为响应缓慢、不可用或明显出错的模型响应,设计明确的回退机制 | 没有回退机制的 AI 功能,会在真实用户面前以明显且不可预测的方式失效 |
| 可观测性 | 把延迟、错误率和成本的监控作为搭建工作的常规组成部分,而不是事后附加 | 没有监控,质量的缓慢下滑或成本的骤增可能数周都不会被察觉 |
OWASP 基金会的 大型语言模型应用十大风险 列举了 AI 功能特有的安全和可靠性风险,从提示词操纵到资源过度消耗。在迪拜招聘 AI 软件工程师并将功能交由其加固之前,逐条核对这份清单是明智的一步。
合作方式
随着使用量增长,需要持续开展可靠性工作的多项 AI 功能,往往会让企业把这个角色作为专职开发人员长期留用。需要把一项能正常运行的演示提升到生产标准的单一功能,适合作为限定项目,交付并移交时附带完善的测试和监控机制。希望把这种严谨性长期沉淀进自己团队的企业,应当考虑招聘支持。已上线 AI 功能、希望在进一步扩大规模前获得关于可靠性和成本风险的独立评审的企业,更适合咨询服务。
评估候选人
核查的重点在于生产环境的严谨性,而不是演示表现得有多好。
曾经眼见一项 AI 功能的运行成本意外飙升并将其解决的候选人,具备真实的生产环境经验。没有这类经历的候选人,可能从未在真实规模下运行过某项功能。
能具体描述一套针对 AI 行为的自动化测试体系,而不仅是发布前的人工检查,是一个有力的信号。
候选人应当能用自己的话,说出至少一种用户可能试图操纵 AI 功能的方式,以及他们是如何防范的。
一个清晰、已经搭建好的回退方案,说明对方具备真正的可靠性工程能力。一句耸肩式的回答,则说明这项功能可能从未在对方手中真正出过故障。
请对方展示(即便是经过脱敏处理的)为某项 AI 功能搭建的仪表盘。如果什么都没有,就问问对方要如何得知质量正在悄悄下滑,这往往是判断谁适合为一个真实规模运行 AI 的迪拜团队担任 AI 软件工程师的最清晰信号。
认证
这里真正相关的信号,是通用软件和云平台认证,而不是某个 AI 专属的徽章。
担任这一角色的候选人,往往持有的是通用软件工程或云平台认证,而不是任何 AI 专属的证书,因为核心技能是把生产环境工程应用到 AI 功能上。这些认证可以在对应厂商的认证页面上核实。
最有力的信号,是一项您能亲自检查的功能:它的测试、它的监控,以及它如何处理一次糟糕的模型响应。我们团队本身不持有任何认证,并且如果您希望核实某项具名认证,我们很乐意将其列为筛选候选人的要求之一。
阿联酋相关事项
当一项 AI 功能被为阿联酋真实生产环境使用而工程化搭建时,会遇到的两个方面。
一旦某项功能为测试和监控目的记录了请求和响应,《2021 年第 45 号联邦法令》,即阿联酋的联邦数据保护法,就同样适用于这些被记录的数据,如同适用于原始客户记录一样,而这一点在快速搭建监控系统时很容易被忽略。
当一项功能同时服务英语和阿拉伯语客户时,其自动化测试和监控应分别覆盖两种语言,因为一项功能可能在一种语言中可靠,在另一种语言中却明显较弱,而在客户投诉之前没人会察觉。在为面向客户的功能在迪拜招聘 AI 软件工程师之前,请确认这种双语覆盖。
直接解答
AI 开发工程师专注于 AI 功能做了什么,以及它完成任务的水平如何。AI 软件工程师专注于围绕它展开的软件工程工作,自动化测试、监控、错误处理和成本控制,让这项功能在真实用户和真实流量到来后依然经得起考验,而不只是在演示中表现良好。
因为它的输出不像普通函数的返回值那样完全可预测。良好地测试一项 AI 功能,意味着针对一套具有代表性的输入进行测试,并依据明确的标准判断输出,而不是核对某一个精确的预期答案。
会,这是我们经常见到的一种意外情况。一项在试点阶段成本极低的功能,一旦真实使用量到来,成本可能迅速上升,尤其是在没有任何限制单个用户能触发多少次调用的情况下。AI 软件工程师从一开始就会为此设计限额和监控机制。
两种都可以。有些项目从零开始,也有些项目是接手企业已有的 AI 功能,也许是作为概念验证快速搭建的,把它提升到可以在生产环境中信赖的水准。
一项设计得当的功能会预先考虑到这种情况并加以处理:在采取行动之前先校验模型的输出,在出现异常时回退到安全的默认方案,并记录该情况以供复查。这应当在搭建阶段就规划好,而不是等客户看到奇怪的结果之后才被发现。
资料来源
书面固定价格
已收到,我们正在为您撰写报价。
工作时间内您将在 45 分钟内收到。请查收确认邮件。