生产环境使用的提示词本身
发送给模型的指令,针对具体任务撰写和组织,无论任务是回答问题、对工单分类,还是起草回复。
大多数在迪拜招聘提示词工程师的企业,已经有一个上线的 AI 功能,一个聊天机器人、一个文档摘要工具或一个分类工具,并且已经注意到它的输出并不稳定:在某些输入上表现良好,在另一些输入上却出现奇怪的错误或措辞。提示词工程是这样一门学科:撰写、测试和不断改进发送给语言模型的指令,让其输出在人们实际输入的各种真实情况下都保持准确和一致,而不仅仅是在功能最初搭建时使用的那几个示例上表现良好。
这项工作看起来像是在写作,但真正的核心其实是测试。一段读起来通顺的提示词,和一段已经针对数十种真实、有时颇为棘手的输入进行过检验,并依据清晰的优质答案标准打分的提示词,完全是两回事。提示词工程师的价值,很大程度上体现在这种测试的严谨性上,而不只是措辞本身,而这正是您在迪拜招聘提示词工程师而非自己撰写提示词时所付费购买的东西。
这个角色能交付什么
经过测试、有版本记录的模型指令,这才是您在迪拜招聘提示词工程师时实际获得的成果,而不是一次性的巧妙措辞。
发送给模型的指令,针对具体任务撰写和组织,无论任务是回答问题、对工单分类,还是起草回复。
一份固定的真实输入清单,包括棘手或不常见的情况,附带对优质回复标准的共识,用于在任何修改上线前进行测试。
记录各版本提示词之间的变化以及原因,让输出质量的倒退能追溯到具体的某次修改,而不是靠猜测。
让模型保持在预定任务范围内的指令,对超出范围的请求予以拒绝或标记,而不是勉强给出一个不该给出的答案。
当一项功能同时服务阿拉伯语和英语用户时,分别进行测试和调优,因为在一种语言中表现出色,并不能说明在另一种语言中的表现。
说明提示词在评估集上表现如何的书面记录,用非技术背景的相关人员也能读懂并判断的通俗语言撰写。
值得关注的技能
测试的严谨性放在第一位,巧妙的措辞放在第二位。
| 技能或领域 | 良好水平的表现 | 为什么重要 |
|---|---|---|
| 结构化提示词 | 使用统一的、有文档记录的结构,例如清晰的角色设定和示例,而不是每次临时拼凑措辞 | 缺乏结构的提示词一旦输出出错,很难调试 |
| 先评估后下判断 | 坚持在判断某次修改是否有帮助之前,先建立一份书面评估集,而不是凭第一印象 | 少数几个看起来不错的例子,可能掩盖了一次让大多数其他情况变差的修改 |
| 对失败模式的了解 | 能具体描述提示词可能出错的方式,例如模型编造答案,以及如何察觉这类问题 | 一位从未见过模型出错的提示词工程师,还没有经受过真实使用场景的考验 |
| 对模型差异的了解 | 理解不同模型对同一段提示词的反应会不同,并据此进行测试,而不是假设一种措辞在所有情况下都适用 | 为某个模型调优的提示词,在另一个模型上可能表现明显更差 |
| 清晰的书面沟通能力 | 用非技术背景的相关人员能理解的语言,解释提示词的作用及原因 | 关于 AI 功能的决策,往往由那些永远不会阅读提示词本身的人做出 |
Anthropic 官方的 提示词工程指南 明确指出,这项工作应从清晰定义成功标准、以及一种能对其进行实证测试的方法开始,然后才修改任何措辞。这正是您在迪拜招聘提示词工程师之前,应该核实对方是否具备的严谨态度,而不能只看几个读起来流畅的示例。
合作方式
专职开发人员适合运行多个 AI 功能的企业,随着使用量增长和边界情况不断出现,提示词质量是持续需要关注的问题。限定项目适合单一 AI 功能,其输出需要一套完善的评估集和经过调优、测试的提示词,交付并移交完成。招聘支持适合希望将这项技能长期留在自己团队内的企业。咨询服务适合已经上线 AI 功能、希望在投入更大规模的重建之前,先获得对输出不稳定原因的独立评审的企业。
评估候选人
在您自己的面试中使用这些核查方式,或者委托我们在招聘支持服务中为您完成。
请对方展示他们过去是如何测试提示词的,而不仅是最终的措辞。如果不存在评估集,就问问他们当初是如何判断这段提示词确实有效的。
分享一个来自您自身业务场景中真正棘手的例子,观察对方如何思考并处理它,而不只是给出一个听起来漂亮的答案。
一位候选人如果曾经上线过一次导致输出质量倒退的修改,并且及时发现了,说明他具备真正的测试严谨性。而声称每次修改都奏效的候选人,则是一个警示信号。
如果您的业务需要阿拉伯语,这个问题能很快区分出真正做过双语提示词工作的人,和只做过英语工作的人。
询问过去的提示词修改是否有跟踪和记录,还是仅凭某人对上次尝试的记忆。这一个问题往往就足以帮您决定,是否为一个承担不起丢失修改记录的迪拜团队,招聘这位提示词工程师。
认证
目前不存在任何值得视为权威标准的独立厂商颁发的提示词工程认证。
提示词工程是一项发展迅速的实践性技能,而不是一项经过正式考核的技能,目前没有任何主要 AI 厂商专门为此开设认证。请将任何课程结业徽章视为学习时长的证明,而非能力的证明。
一份来自过往项目的书面评估集、一份有记录的提示词版本历史,以及对一次被及时发现的失败的清晰解释,能告诉您的信息远比一纸证书更多。我们团队中没有人声称拥有提示词工程认证,因为根本不存在这样的认证可以拥有,这也是为什么在迪拜招聘提示词工程师时,更应依据已证明的实际成果,而不是一枚徽章。
阿联酋相关事项
对于需要用不止一种语言测试提示词的迪拜企业来说,值得关注的两个方面。
阿联酋各地使用的阿拉伯语涵盖标准现代阿拉伯语和地区方言,一段只用英语或只用正式的标准现代阿拉伯语测试过的提示词,在客户实际输入的非正式阿拉伯语上,表现可能明显更差。这一点应当直接测试,而不能想当然地假设。
一旦客户姓名、订单详情或员工信息作为上下文被粘贴进提示词,它就和其他任何记录一样,成为《2021 年第 45 号联邦法令》所定义的个人数据,包括为测试目的而保存在评估日志中的副本。
直接解答
在小团队里很少见。它通常是 AI 开发工程师或 AI 工程师工作的一部分。当一家企业运行着多个 AI 功能,其输出质量确实取决于精心撰写并经过测试的提示词,而且措辞的细微变化会明显影响结果时,才值得设立专职岗位。
AI 开发工程师负责搭建整个功能:界面、所依赖的数据,以及围绕模型的逻辑。提示词工程师专注于发送给模型的内容以及如何评判其输出,往往是在 AI 开发工程师已经搭建好的功能内部开展工作。
有时可以,有时不行。设计良好的提示词能有效减少某些类型的错误,但提示词工程师应当坦率说明,真正的问题有时其实出在模型选择、底层数据,或某项任务本身确实不适合这项技术,而不是承诺提示词能解决一切。
会。对迪拜企业来说,这是一项常见且真实的需求,并且需要单独测试,因为一段在英语中表现良好的提示词,并不会自动在阿拉伯语中表现相同。
通过一份书面的评估集:一份固定的、具有代表性的真实输入清单,附带对优质答案的共识标准,在任何提示词修改前后都用其测试。没有这一步,所谓的改善只是猜测。
资料来源
书面固定价格
已收到,我们正在为您撰写报价。
工作时间内您将在 45 分钟内收到。请查收确认邮件。