一个微调后的模型
使用参数高效方法针对您的任务调整的开源权重模型,其训练数据、配置和最终权重都作为可复现的成果保留下来。
当托管 API 本身已不足以满足需求时,企业往往会开始在迪拜招聘 LLM 工程师:模型需要了解您业务中的一些具体信息,而这些信息是通用训练从未教过它的;请求量已经增长到 API 成本成为一项实实在在的预算支出;或者数据驻留规则要求工作负载必须运行在您能够掌控的地方。应用层之下的这部分工作,正是 LLM 工程师负责的领域。
日常工作分为三个相互关联的部分。微调是使用您自己的数据,通常通过一种参数高效技术,让现有的开源权重模型适应特定任务。部署是让这个模型,或者一个托管模型,在真实流量下可靠地运行。评估把这两者联系起来,用真实数据集证明某项改动确实让模型变得更好,而不只是变得不同,这正是 Hugging Face 自家的 Evaluate 库要以可重复方式支持的目标。
这个角色搭建的内容
在迪拜招聘 LLM 工程师,您实际获得的是基础设施和流程层面的工作,而不仅仅是一次 API 接入。
使用参数高效方法针对您的任务调整的开源权重模型,其训练数据、配置和最终权重都作为可复现的成果保留下来。
模型运行在自己的 API 之后,基础设施规模按您预期的流量配置,无论是云端 GPU 实例还是托管平台。
由真实示例和预期结果组成的数据集,自动针对模型运行测试,让每一次改动都是被衡量出来的,而不是凭猜测判断。
批处理、缓存和量化方面的工作,目的是在使用量增长的同时,把响应时间和基础设施支出控制在合理范围内。
在明显错误或不安全的输出到达用户之前将其拦截的检查机制,独立于模型本身运行。
一个约定好的时间点,届时会用最新数据重新评估模型,避免性能随着业务变化悄然下滑。
值得关注的技能
基础设施与评估方面的能力,而不只是熟悉训练脚本。
| 技能或工具 | 良好水平的表现 | 为什么重要 |
|---|---|---|
| 参数高效微调 | 确实在真实数据集上运行过诸如 LoRA 之类的技术,并能说明改动了什么、为什么这样改 | 对大模型进行完整重训练很少有必要,也很少是预算的明智用法 |
| 模型部署 | 习惯将模型部署在专为推理构建的服务器之后,而不是运行在单台机器上的脚本 | 为一个演示用户搭建的部署层,在真实流量下会崩溃 |
| 搭建评估集 | 已用真实任务示例搭建过数据集,并有明确的方式衡量正确性,而不只是凭肉眼看几条输出 | 没有评估集,就没人能说清某项改动是否真的有帮助 |
| 量化与硬件认知 | 理解模型规模、精度与可用硬件之间的权衡 | 硬件选型不当,会让自托管模型比它原本要替代的 API 更慢、更贵 |
| 许可协议意识 | 在任何开源权重模型投入生产前,都会核实其具体许可协议 | 开源权重模型的许可条款各不相同,部分会限制大规模商业使用 |
Hugging Face 自家的 PEFT 文档 描述的是只微调少量额外参数,而不是整个模型,这让训练在不产生完整重训练成本的情况下依然可行,在迪拜招聘 LLM 工程师时,值得请候选人用自己的话说明这种权衡。
与我们合作的方式
对于持续开展微调、部署和评估工作的企业,专职工程师是合适的选择,加入您的团队并按月计费。限定项目适合一个明确的目标,例如微调并部署单个模型,附带文档和交接。招聘支持适合希望将 LLM 工程师直接招入自己团队的企业,由我们负责寻访和技术评估。咨询适合尚未投入任何基础设施预算、正在判断自托管是否值得的团队。
评估候选人
能区分真实基础设施经验和只是熟悉训练教程的检验方式。
数据集、使用的方法,以及前后对比的评估分数。如果候选人拿不出“之后”这个数字,就说明他并未真正证明微调有效。
经过深思熟虑的答案会权衡成本、流量和控制力,对比托管 API 的简便性。如果对方没有做这种比较就直接跳到自托管,这是一个警示信号。
询问示例来自哪里、评分方式是什么。真正优秀的候选人会像对待模型训练本身一样认真对待这一点。
高负载下的延迟、内存压力,或者流量真实上线后模型表现异常。对任何真正在生产环境中运行过模型的人来说,这是常见情况,而不是边缘案例。
询问他们部署过哪些开源权重模型,是否在部署前核实过许可条款。不知道这一点,风险比乍看之下更大。
无论您通过哪种方式在迪拜招聘 LLM 工程师,专职、项目、招聘支持还是咨询,这些检验方式同样适用,无论是您自己来做,还是委托我们完成技术评估。
认证
对于这个角色,看一个真实的微调和部署项目,比看一张证书更有意义。
微调和部署工作依赖多个项目的工具,包括 Hugging Face 的各类库,以及上文提到的 vLLM 等部署引擎,目前没有一个项目为这类工程工作开设认证考试。这意味着想在迪拜招聘 LLM 工程师的企业,需要评判真实项目,而不是一枚徽章。
一次带有真实前后数据的微调记录、一套他们能在高负载下清楚描述的部署方案,以及一个关于如何选择许可协议的明确答案,在迪拜招聘 LLM 工程师从事基础设施层面的工作时,比一张证书能说明更多问题。
阿联酋相关事项
两个会影响自托管或微调部署方式的要点。
如果训练或评估数据中包含客户或员工信息,阿联酋《2021 年第 45 号联邦法令》(阿联酋联邦数据保护法)规定,在未经同意的情况下处理个人数据属禁止行为,仅有限例外情况除外,无论模型运行在什么基础设施上。请在训练开始前而不是之后对数据集进行筛查。
大规模自托管或微调通常需要具备 GPU 能力的云区域,Amazon Web Services 在阿联酋境内实体运营着一个区域,即中东(阿联酋),已于 2022 年 8 月开放。在敲定基础设施投入之前,值得将这一点与区域化部署方案一并权衡。
直接解答
LLM 开发工程师在托管模型的 API 之上搭建应用功能,例如 OpenAI 或 Anthropic 的 API。LLM 工程师则在这一层之下工作:使用您自己的数据对模型进行微调,将其部署在您自己的基础设施上,并搭建能证明效果真正提升的评估体系。
大多数项目使用托管 API 效果更好,因为它彻底免去了基础设施和维护负担。只有在有明确理由时,例如数据驻留要求、请求量非常大,或者需要托管服务商未提供的微调模型,自托管才值得投入这份成本。
按当前主流做法,通常是在现有开源权重模型之上,使用诸如 LoRA 之类的技术调整少量额外参数,而不是从零开始重新训练整个模型。这需要一份干净、具有代表性的数据集,以及一种能够衡量结果是否真正更好、而不只是不同的方法。
可以,这本身就是一个常见的独立项目。我们会用您实际任务中的真实示例搭建评估集,用它测试您的模型和一个合理的基线模型,并在您进一步投入部署之前,报告模型实际存在的不足之处。
模型权重、训练代码和部署配置的归属,会在开工前的提案中以书面形式约定清楚。对于自托管模型,您还需要在将其用于商业部署前,核实基础模型自身的许可协议。
资料来源
书面固定价格
已收到,我们正在为您撰写报价。
工作时间内您将在 45 分钟内收到。请查收确认邮件。