大数据工程师的存储设计
选择并规划分布式文件系统或云对象存储,进行分区,让任务只读取自己需要的数据,而不是扫描全部数据。
想要在迪拜招聘大数据工程师的企业,通常已经先尝试过常规路线:一个数据库、一个数据仓库、一个按计划运行的任务,以及一个小团队阅读输出结果。大数据工程师这个角色,正是从这条路线不再奏效的地方开始的:当记录的数据量、到达速度,或来自不同系统的格式混合程度,已经超出单台机器能在合理时间内处理的范围时。解决方案是一个分布在多台机器上的分布式平台,以及一位懂得如何设计、运行和排查这类平台的人。
在实际操作中,这意味着运行 Apache Hadoop、Apache Spark 或云服务商托管的等效方案的集群,把数据保存在分布式文件系统或云对象存储中,而不是单块磁盘上,并且并行处理数据,而不是逐条记录处理。一家阿联酋企业通常是因为点击流或应用事件日志、来自运营或零售设备的物联网或传感器读数、电信或交易记录,或是需要把多个源系统合并到一处、且规模已超出普通管道承受能力,才会走到这一步。
由于”大数据”涵盖了非常广泛的一系列工具,工程师实际的生产经验背景,比这个标签本身更重要。在迪拜招聘大数据工程师之前,请先说明您的数据目前所在的平台,或者您计划迁移到的平台,并使用下面的核查方式,确认面前这位候选人是真的操作过集群,而不只是读过相关资料。
大数据工程师会搭建什么
只有在单台服务器已经不够用时才会出现的工作。
选择并规划分布式文件系统或云对象存储,进行分区,让任务只读取自己需要的数据,而不是扫描全部数据。
同时在多台机器上运行的批处理和近实时任务,编写时确保某个节点中途失效也不会丢失或重复数据。
接收持续事件流的管道,例如应用活动或传感器读数,而不是等待每夜的批处理窗口。
调整分区大小、文件格式和集群规模,让任务按时完成,同时计算费用的增长速度不会超过数据本身。
原始、清洗和整理三个区域各自有明确的责任归属,让下游团队清楚哪一层可以放心用来搭建报表。
谁可以读取哪些数据集,以及原始数据保留多久,这些都作为既定策略设置,而不是留给个人习惯决定。
重要技能
平台实际操作经验,而不只是一份框架名称清单。
| 技能或工具 | 良好水平的表现 | 为什么重要 |
|---|---|---|
| 分布式处理引擎 | 在 Apache Spark 或同类引擎上有生产环境运行任务的经验,而不只是单机教程 | 百节点集群的故障模式,与笔记本电脑上的 notebook 完全不同 |
| 分布式与湖仓存储 | 既了解分布式文件系统,也熟悉现代云存储和开放表格式 | 在这个规模下,存储布局同时决定查询速度和每月成本 |
| 资源与任务调度 | 熟悉集群资源管理器或托管任务调度器,在断定任务缓慢之前会先查看其执行计划 | 缺乏管理的集群会让一个任务拖垮排在它后面的所有其他任务 |
| 流处理(如适用) | 确实在生产环境中运行过消息队列或流处理引擎,并有应对消费者落后时的方案 | 流式管道的故障方式与批处理任务不同,通常也更不易察觉 |
| 成本意识 | 会主动谈及集群支出和任务运行时长,而不是等账单出现才提起 | 分布式平台的成本增长速度和承载能力的增长速度一样快 |
Apache 软件基金会将 Apache Spark 描述为一个用于大规模数据处理的统一分析引擎,正因为它的覆盖范围如此广泛,候选人在其上实际的生产经验,才比只是在简历上写出这个名字重要得多。
合作方式
专职大数据工程师适合已经运行一个成熟平台、且该平台持续增长、需要持续调优、搭建新管道和维护集群的企业。限定搭建适合一项界定清晰的工作,例如把某个批处理任务迁移到分布式引擎,或搭建一个新的数据湖,并在结束时完成明确的移交。招聘支持适合希望长期把一位大数据工程师纳入自身编制的企业,由我们负责寻访、筛选并开展技术评估。咨询适合已拥有现有平台、希望在投入更多预算前,对其架构、集群成本或一次停滞的迁移获得独立评审的企业。无论选择哪条路线,在迪拜招聘大数据工程师的意义,在于移交之后平台依然能持续可靠地运行,而不只是交付当天看起来不错。
评估候选人
针对真实集群经验的核查方式,而不是词汇量。
无论您通过哪种方式在迪拜招聘大数据工程师,无论是自己主持面试,还是交给我们作为招聘支持的一部分来完成,这些核查方式都同样适用。
节点数量、数据量和任务频率。含糊的回答往往说明那段经历更接近课程项目,而不是生产环境的实际工作。
在生产环境运行过分布式任务的候选人,会描述一次真实的事故:一个倾斜的分区、一个失效的节点、一次导致数据重复的重试,以及他们是如何修复的。
请他们逐步说明会如何诊断一个缓慢的任务,而不是猜测单一的原因。
留意他们是否在速度和成本之间给出有依据的权衡,而不是简单地回答”越大越安全”。
询问他们会如何针对某个具体的访问模式对一个大型数据集进行分区,以及原因。好的回答会参照数据实际会被查询的方式。
认证
在迪拜为云平台相关工作招聘大数据工程师时,有两项当前的厂商认证值得核查。
阿联酋相关事项
规模的扩大会改变数据保护义务在实践中的具体含义。
《2021 年第 45 号联邦法令》是阿联酋关于个人数据保护的联邦法律,适用于任何与阿联酋相关的控制者或处理者所进行的个人数据处理,一个保存大量客户或员工记录的分布式平台,会提高处理不当所带来的风险,而不是改变这项义务本身。
如果出于合同或监管原因,数据必须留在某个特定区域,请在确定项目范围时确认集群运行在哪个云区域或本地设施,并在存储布局决策做出之前而不是之后确认。在迪拜招聘大数据工程师之前提出这个问题,是正常且明智的做法,并不意味着客户难以合作。
本页属于我们 数据 类别,是更广泛的 迪拜招聘开发人员 板块的一部分。如果您的平台具体是 Apache Hadoop 或 Apache Spark,我们专门的 Hadoop 开发工程师 和 Spark 开发工程师 页面会针对各自的引擎做更深入的介绍。如果您已经选定了一个托管云平台,请查看我们的 Snowflake 开发工程师 或 Databricks 工程师 页面;如果您当前的实际需求是一条通用管道,而不是分布式基础设施,我们的 数据工程师 页面可能是更简单的起点。对于围绕数据的更广泛平台需求,我们的 云服务 团队同样可以提供帮助,无论您在迪拜招聘大数据工程师时选择哪种合作模式。
直接解答
数据工程师负责搭建和运行的是一个调优良好的数据库或数据仓库仍能承受的数据管道。大数据工程师所处理的,是数据量、到达速度或格式种类已经超出这个范围的情况,此时工作重心变成分布式系统:集群、分区和资源争用,而不是单台服务器。
往往还不像厂商所暗示的那么早。如果一个基于标准数据库或数据仓库的每夜任务仍能在合理时间内完成,而一个小团队也能读懂结果,通常聘请数据工程师才是正确的选择。等到这个任务开始失败、运行超时,或单台机器已经装不下工作集时,大数据工程师才真正能发挥价值。
两者都能提供,此外还有云原生的等效方案,例如托管的 Spark 服务。请告诉我们您的数据目前所在的平台,或您正准备迁移到的平台,我们会据此匹配工程师的背景,而不是把大数据当作一种可以互相替代的单一技能。
有时可以,但核心技能是不同的。大数据工程师的强项在于可靠地存储、处理并迁移大量数据。至于上层的报表环节,基于该平台工作的 BI 开发工程师或数据分析师通常更合适,我们也可以同时为您配置这两个角色。
在 AWS、Google Cloud 和 Azure 的数据服务上拥有生产经验的工程师,以及在主流云平台之外运行的开源平台,例如 Apache Hadoop 和 Apache Spark。请在确定项目范围时告诉我们您当前或目标使用的平台。
资料来源
书面固定价格
已收到,我们正在为您撰写报价。
工作时间内您将在 45 分钟内收到。请查收确认邮件。