生成式AI工程师负责的检索
对您自己的内容进行分块、索引和检索,让模型回答的依据是正确的来源,而不是听起来最接近的那个。
有些企业在迪拜招聘生成式AI工程师时,有意思的那部分工作其实已经完成了。一项功能已经做出原型,在演示中能跑通,现在需要经受真实用户的考验:更大的使用量、更奇怪的问题,以及一家期望持续得到稳定答案、而不是偶尔惊艳一次的企业。这个角色关心的正是这道差距,也就是从一个能跑通的演示,到一套企业能真正依赖的系统之间的工程工作。
具体来说,这意味着能真正找到正确段落的检索、能在客户发现问题之前先拦下性能回退的评估集、能在不破坏正常输出的前提下减少不良输出的防护机制,以及对系统运行成本和真实负载下响应速度的清晰认识。Anthropic 自己的工程指南在操作顺序上讲得很直白:先从简单方案开始,只有在证明确实能提升效果之后,才增加复杂度,这个原则值得直接拿来要求生成式AI工程师遵循。在迪拜招聘生成式AI工程师做这项工作的企业,通常已经过了演示阶段,需要系统能经得起真实使用的考验。
这个角色承担的工作
系统层面的工作,通常从已经存在的原型开始。
对您自己的内容进行分块、索引和检索,让模型回答的依据是正确的来源,而不是听起来最接近的那个。
一批固定的真实问题,配有分级的预期答案,自动运行,让提示词或模型的改动被衡量,而不是被猜测。
对请求和回答进行一次独立、更轻量的检查,在有害、偏离主题或违反政策的输出到达用户之前先行拦截。
追踪每次回答的成本和耗时,并根据真实预算调整模型选择、缓存和提示词长度。
记录足够的信息,随时间发现回答质量下滑,无论原因是来源内容变化,还是模型厂商更新了模型。
根据使用量、延迟需求和成本,在托管 API 和自托管模型之间做出决定,而不是凭习惯或偏好。
关键技能
让系统变得可靠的技能,不同于搭建原型的技能。
| 技能或工具 | 达标标准 | 重要原因 |
|---|---|---|
| 检索设计 | 在真实文档集上调优过分块和检索方式,而不只是用过默认配置 | 糟糕的检索,是系统给出自信但错误答案的最常见原因 |
| 搭建和运行评估 | 曾搭建过分级评估集,并能说明它发现了什么问题 | 没有它,质量只能凭感觉判断,性能回退会在无人察觉的情况下上线 |
| 防护机制设计 | 把筛查理解为一个独立、更轻量的步骤,而不是让一次模型调用包揽一切 | Anthropic 自己的工程指南建议采用这种拆分方式,因为它表现更可靠 |
| 成本与延迟调优 | 能指出一个具体改动,比如缩短提示词或在更简单的步骤上换用更小的模型,切实降低了成本或延迟 | 一个无人监控的系统,运行成本往往随使用量悄悄增长 |
| 托管与自托管之间的判断力 | 能说明什么时候自托管值得承担额外的运维负担,什么时候明显不值得 | 没有明确理由的自托管,通常只会增加成本和风险,却没有真正的收益 |
Anthropic 关于搭建高效智能体的工程博文,值得在为这个角色定范围之前先读一读,因为它清楚说明了为什么只应在更简单的方法被证明效果不够之后,才增加复杂度。
合作方式
专属工程师适合运行一个或多个生成式 AI 系统、且需要随使用量增长持续评估、监控和调优的企业。限定范围项目适合把一个具体原型打磨到可靠、可衡量的状态,并在结束时交付一套评估工具和防护机制。咨询服务适合已经有工程师、但希望在投入更多预算前,对检索质量、成本或架构决策获得独立复核的团队。招聘支持适合正在自建这方面长期能力的企业。
评估候选人
用来区分真实生产经验和只会搭建原型的核实方法。
之前的结果哪里有问题,他们改了什么,又是如何确认确实改善了。一个含糊的答案,说明他们没在真实文档集上做过这件事,这也是选择另一位生成式AI工程师的合理理由。
里面有哪些问题、答案是怎么分级的,以及它在上线前发现了什么。如果没有,问问为什么没有,因为一位没有评估集的生成式AI工程师,是在靠猜测而不是靠衡量做事。
它筛查的是什么、漏掉了什么,以及他们如何测试它能否抵御绕过尝试。
一套类似系统每千次请求的运行成本是多少,如果有的话,是什么改动让这个数字降下来的。
一个有说服力的答案会指出一个具体的触发条件,比如使用量或数据本地化要求,而不是把它当成永远更好或永远没必要的事。
认证
目前没有任何认证覆盖这一组具体技能,应审查真实系统工作。
检索设计、评估和防护机制这些实践,来自 Anthropic 等模型厂商发布的工程指南(如上文所引),而不是一场认证考试。任何声称专门为这个角色拥有认证的说法,都应谨慎看待。
他们搭建过的一套评估集、能详细讲解的一次检索修复,以及他们改善过的一个真实成本或延迟数字,都比任何证书更能说明问题。请生成式AI工程师完整讲述一套系统从原型到生产的全过程,并依据细节做出判断。
阿联酋相关事项
当系统在阿联酋从原型走向生产时,会遇到的两个方面。
检索、评估日志和监控往往会存储真实用户查询和文档片段。阿联酋的联邦数据保护法《2021 年第 45 号联邦法令》(Federal Decree Law No. 45 of 2021)适用于这些数据无论在哪里被处理,因此保留期限和访问权限需要作为设计的一部分提前确定。
托管模型厂商或服务基础设施在哪里处理数据,是一个值得及早提出的合理问题,尤其是对处理客户记录的系统而言,应该写进简报,而不是等上线之后才被发现,这正是为什么生成式AI工程师应该在评估范围阶段就提出这一点。
直接解答
一个在测试中表现良好的原型,往往在真实用户、真实使用量和边界情况出现之后就撑不住了。生成式AI工程师会审视检索准确率、回答一致性、每次请求的成本和负载下的延迟,而这些,恰恰是原型在上线前很少经过测试的方面。
它是指在模型回答之前,先从您自己的文档中提取相关内容,让回答立足于可核实的东西,而不只是模型的通用训练知识。检索质量做得好不好,通常是决定一套系统回答是否可信的最大因素。
通过一套评估集:一批固定的真实或有代表性的问题,配有分级的预期答案,在提示词、模型或检索步骤发生变化时自动运行。没有这个,团队往往只能靠抽查来判断质量,容易漏掉性能回退。
它们能降低系统产出有害、偏离主题或违反政策内容的可能性,常见做法是在请求或回答到达用户之前,用一个独立、更轻量的检查进行筛查。没有任何防护机制能完全消除风险,我们会在评估范围时如实说明这一点。
可以,适合有具体原因的团队,比如数据本地化要求,或在极高使用量下的成本考量,不过自托管会带来真实的运维工作:服务基础设施、监控和自身的评估体系。我们只会在有明确理由排除托管方案之后,才建议这样做。
资料来源
书面固定价格
已收到,我们正在为您撰写报价。
工作时间内您将在 45 分钟内收到。请查收确认邮件。