2026 年 1 月我走完了 xAI data engineer 的完整 loop。总共五轮。趁记忆还新分享一下笔记,因为我准备的时候完全找不到什么有用的信息。
recruiter screen(30 min) 常规。他们问了我做过的规模、具体的 pipeline 工具、以及我是否能适应不确定性。recruiter 对文化描述得很直接:节奏快、不会手把手带,你要对自己的东西负责。这点不是瞎说。
technical phone screen(60 min) 两部分:SQL 和简化版 system design。SQL 比我预期难,不只是 join 和 aggregation。他们给了一个很脏的 schema,多个 fact table,让我写一个 query 去跨多种 event type 跟踪 user sessions,并标记序列中的异常。窗口函数、CTEs 全都用上了。我会把 SQL 难度打到 leetcode-medium-hard。
system design 部分是设计一个高吞吐事件流的实时 ingestion pipeline,偏 kafka-style 架构。他们问了 partition 策略、consumer group 设计、exactly-once semantics。我对这些很熟所以还好,但如果你只做过 batch pipelines,这里可能会被打个措手不及。
onsite(4 轮,全程线上) coding 轮 1:更多 SQL,再加一点 python 做数据转换。让我解析半结构化 JSON logs,然后输出规范化的表格数据。没什么离谱的。 coding 轮 2:完整 system design。设计一个给 ML models 用的 feature store。延迟要求、freshness 取舍、读写路径。这是我见过更好的 system design 题之一。 data modeling 轮:根据口头描述的业务域设计 schema。他们要你为 normalization 决策给出理由,不是只画个 schema。 behavioral 轮:标准 STAR。问我一个我负责的 pipeline 在 prod 里挂掉的经历:我构建了什么、哪里坏了、我改了什么。要准备一个真实故事。
很重要的点: 他们看重端到端 ownership。他们想看到你理解从 ingestion 到 consumption 的整条链路,不只是某一个环节。只会 airflow 或 dbt 不够,他们想知道你是否凌晨 3 点真的 debug 过,并且明白它为什么会坏。
level 大概是 senior DE。第一轮到 offer 大概 3.5 周。offer 很有竞争力,但我最后没接。