预测模型
基于历史规律搭建的需求、营收或人员配置预测,附带明确的置信水平,而不是把一个数字当成确定无疑的结论呈现。
企业在迪拜招聘数据科学家,是为了回答表格或标准报表无法解答的问题,例如哪些客户下个月很可能流失、旺季前该订购多少库存,或一次价格调整是否真的改变了需求。这些问题的共同点在于都关乎未来,或涉及某种凭肉眼难以察觉的复杂规律,而它们所依据的数据,企业其实早已在收集,只是尚未以这种方式加以利用。
这是一份比职位名称听起来更聚焦的工作。数据科学家的核心工具是统计学和机器学习,通过 Python 或 R 实现,在正式接触生产环境之前,先在 Jupyter 这类笔记本环境中探索数据。这项工作的大部分价值在于提出正确的问题,以及判断何时模型并非正确答案,而不仅仅在于建模本身。
在迪拜招聘数据科学家之前,请先写下这项工作意图改善的具体业务决策。一个在统计学上无懈可击、却无法连接到任何人会据此行动的决策的模型,往往赚不回搭建它所花费的时间。
数据科学家会搭建什么
在迪拜为一个真实项目招聘数据科学家时,您应当期待的是可以直接指出的具体成果,而不是一份算法名称清单。
基于历史规律搭建的需求、营收或人员配置预测,附带明确的置信水平,而不是把一个数字当成确定无疑的结论呈现。
按流失、转化或增加消费的可能性对客户或潜在客户进行排序的模型,直接支撑团队的日常工作优先级。
结构化的测试,例如针对定价或文案的 A/B 测试,其设置能确保结果在统计学上真正有意义,而不只是巧合。
深入挖掘数据集,发现尚无人留意过的规律,为是否值得投入一个更完整的建模项目提供决策依据。
核查一个已投入使用的模型,在真实世界数据不断变化的情况下是否依然准确,而不是任由其在无人察觉的情况下悄然失准。
为某项 AI 产品功能提前完成的数据准备和评估工作,区别于将其上线交付的工程工作。
值得关注的技能
如何区分真正有效的统计判断力和一份堆满关键词的简历。
| 技能或工具 | 良好水平的表现 | 为什么重要 |
|---|---|---|
| 统计学基础 | 能用通俗的语言解释结果,包括其不确定性,而不只是给出一个数字 | 一个自信满满却错误的预测,比一个诚实但不确定的预测更糟糕 |
| Python 或 R | 熟练使用标准的数据科学库,并能展示真实可运行的笔记本 | 缺乏结构的临时脚本难以核查或移交 |
| SQL | 能自行提取和整理所需数据,而不是总要等别人处理 | 一个真实项目的大部分工作在于把数据准备正确,而不是建模本身 |
| 模型评估 | 用模型未见过的数据测试模型,并在结果不佳时坦率说明 | 一个只在自身训练数据上表现良好的模型,投入生产后往往令人失望 |
| 业务视角 | 能把模型的输出与某个真正会被采纳的决策联系起来 | 一个技术上正确、却无人据此行动的模型没有任何业务价值 |
在迪拜招聘数据科学家时,请要求查看对方的笔记本,而不只是简历。这项工作的大部分是在交互式笔记本中完成的,而 Project Jupyter,这个支撑 Jupyter 笔记本的开源非营利项目,将其工具描述为面向跨语言的交互式计算和探索性数据分析而搭建,这正是在作品集中值得留意的工作方式。
合作方式
限定项目适合一个界定清晰的问题,例如一个预测模型或一次实验,有明确的移交节点。专职开发人员适合预计随着新数据不断到来,会持续产生建模问题的企业。招聘支持适合正在搭建自身长期数据科学团队的团队,由我们负责寻访和筛选,最终直接向您汇报的候选人。咨询服务适合已经运行着某个模型、希望获得经验丰富的外部核查,判断该模型是否依然有效,或一个新可用的数据源该如何接入的企业。
评估候选人
五个能区分完整项目经验和课程作业的问题。
您可以自行使用这些问题,也可以要求我们在通过招聘支持迪拜招聘数据科学家时,将其纳入技术评估环节。
而不是一个课程练习。询问它支撑了哪项业务决策、实际改变了什么结果,以及现在他们会做出哪些不同的选择。
提供一个接近您实际情况的小型、不完美的数据集,观察对方在开始建模前如何处理缺失值和异常值。
一位真正有实力的候选人会给出具体的衡量指标和具体的基准,而不是笼统地说模型表现不错。
询问一个未能奏效的项目,以及他们从中得出的结论。真实的经验里既有成功,也包括失败的实验。
请对方向一位非技术背景的相关人员解释某个模型的结果。如果无法用简单的语言说明,这个模型往往会被闲置不用。
认证
数据科学并不像某些平台那样,存在一个统一的厂商认证,因此对任何声称通用的证书都应保持谨慎。
在迪拜招聘数据科学家时,没有一项考试可供核查,因此对任何声称通用的徽章都应保持谨慎。统计学、Python 和机器学习是广泛的领域,没有唯一的颁发机构,这与 Databricks 或 Snowflake 这类特定平台不同,后者设有自己的数据工程师认证,我们在相应的平台专属页面中有所介绍。
一份能看到推理过程的真实项目作品集、公开发布的笔记本,或在一家从事可辨识数据科学工作的公司担任过相应角色,比任何一场考试都更能说明问题。如果这个职位更接近生产环境的机器学习工程,而不是分析工作,请专门就这一区别提出询问。
阿联酋相关事项
在真实的迪拜项目中经常出现的一个方面。
阿联酋政府门户网站 确认,只要模型是基于客户或员工信息训练的,《2021 年第 45 号联邦法令》就适用于个人数据的处理方式。请尽早与数据科学家商定,是否需要在建模开始前对数据进行匿名化或聚合处理。
如果面向客户的数据中除英语外还包含阿拉伯语文本,请在确定项目范围时确认模型或报表将如何处理这两种语言,而不要想当然地认为一条仅面向英语的管道就能覆盖它们。
直接解答
如果问题是描述性的,例如上个季度发生了什么,或哪款产品卖得最好,数据分析师就能解答。如果问题具有预测性或需要建立模型,例如预测需求,或判断哪些潜在客户更可能转化,那就是数据科学家的工作。
需要足够的历史数据以看出真实规律,具体多少因问题而异。一次有用的首次沟通会明确业务问题以及现有哪些数据,数据科学家很快就能告诉您现有数据是否足以建模,还是需要先延长数据收集时间。
在小规模场景下通常可以,因为大多数数据科学家都能写扎实的 Python 和 SQL 代码。但对于需要为多个模型大规模供数的生产管道,让数据科学家与数据工程师搭档合作,通常比让一个人同时把两项工作都做好更高效。
不是。一个搭建得当的仪表盘,或一条简单的统计规则,往往能以远低于模型所需的成本和风险解决许多业务问题。一位优秀数据科学家的部分职责,正是判断什么时候机器学习不是合适的工具,而不是默认使用它。
Python 和统计学与 AI 开发有所重叠,但一项生产环境的 AI 功能或基于大型语言模型的产品,通常需要具备相应特定背景的人员。请告诉我们工作的具体形态,我们会据此匹配合适的角色,必要时也包括我们的 AI 开发工程师角色。
资料来源
书面固定价格
已收到,我们正在为您撰写报价。
工作时间内您将在 45 分钟内收到。请查收确认邮件。