Databricks · Primly 社区

上个月走完 Databricks 的完整 DE 面试流程。这是我的真实复盘。

hardware_hugo (Primly starter) · 5 条回复

终于从一场 Databricks data engineering 面试里爬出来了。分享下笔记,因为我准备时找不到近期好写得很细的复盘。

第 1 轮: Recruiter screen,30 分钟。常规问题。他们会问你为什么是 Databricks,含糊的回答不行。我聊了 Delta Lake 和 lakehouse pattern,明显对上了。

第 2 轮: Hiring manager,45 分钟。一半技术背景,一半是「讲一个你负责的很难的 pipeline 问题」。不是 behavioral 套话,他们要你讲架构决策和取舍。

第 3 轮: Coding,1 小时,两题。第一题是中等难度的图遍历。第二题是 Python 的数据处理场景,输入是分块的,不能一次放进内存。第二题才是真考点。

第 4 轮: System design,1 小时。设计一个带 exactly-once 保证的 streaming ingestion 系统。他们在容错和 offset 管理上挖得很深。Kafka 和 Spark Structured Streaming 要熟。

第 5 轮: Values/behavioral,对接一个跨职能。没那么紧张,但在评估高压下的协作和沟通。

从 recruiter screen 到 offer 一共 5 周。最终轮后 4 天出决定。我第一次(拒了那次)拿到的反馈其实还挺有用,这很少见。

由 AI 翻译,查看原文

5 条回复

analyst_ana (Primly starter)

这太有帮助了,谢谢你。我一直在内存受限的数据处理这块比较薄弱。他们有给你一个具体的数据集大小限制吗,还是更偏概念性的?

由 AI 翻译,查看原文

de_derek (Primly starter)

他们大概会说「10TB file, 8GB RAM, design your approach.」(「10TB 文件,8GB 内存,设计你的方案。」)你不用把整套都写出来,你要讲你的分块策略以及怎么处理 state。关键是解释你为什么用 streaming 而不是 batch,以及你在防哪些 failure modes。语法不是重点,推理才是。

由 AI 翻译,查看原文

sre_sol (Primly starter)

system design 面试里聊 exactly-once semantics,如果你没把 idempotency 这一层想透,就是个坑。你能提前点出来很好。大多数人只会说「用 kafka」然后就停了,好像这就算答案。

由 AI 翻译,查看原文

ml_mike (Primly starter)

你看到的 ML/DE 职位面试流程有区别吗,还是这套结构在两条 track 上都一致?我问是因为我在看那边的 MLE 角色。

由 AI 翻译,查看原文

de_derek (Primly starter)

我只走过 DE track,所以不敢确定,但一个做了 MLE 的朋友说有第 4 轮 technical,会在标准 coding 之外加 ML system design(training pipelines、feature stores)。他们自己有 MLflow,所以预计会更深入问。

由 AI 翻译,查看原文