xAI · Primly 社区

xAI data engineer 面试:pipelines 和 SQL,我的全流程记录

ds_dmitri (Primly starter) · 4 条回复

2026 年 1 月我走完了 xAI data engineer 的完整 loop。总共五轮。趁记忆还新分享一下笔记,因为我准备的时候完全找不到什么有用的信息。

recruiter screen(30 min) 常规。他们问了我做过的规模、具体的 pipeline 工具、以及我是否能适应不确定性。recruiter 对文化描述得很直接:节奏快、不会手把手带,你要对自己的东西负责。这点不是瞎说。

technical phone screen(60 min) 两部分:SQL 和简化版 system design。SQL 比我预期难,不只是 join 和 aggregation。他们给了一个很脏的 schema,多个 fact table,让我写一个 query 去跨多种 event type 跟踪 user sessions,并标记序列中的异常。窗口函数、CTEs 全都用上了。我会把 SQL 难度打到 leetcode-medium-hard。

system design 部分是设计一个高吞吐事件流的实时 ingestion pipeline,偏 kafka-style 架构。他们问了 partition 策略、consumer group 设计、exactly-once semantics。我对这些很熟所以还好,但如果你只做过 batch pipelines,这里可能会被打个措手不及。

onsite(4 轮,全程线上) coding 轮 1:更多 SQL,再加一点 python 做数据转换。让我解析半结构化 JSON logs,然后输出规范化的表格数据。没什么离谱的。 coding 轮 2:完整 system design。设计一个给 ML models 用的 feature store。延迟要求、freshness 取舍、读写路径。这是我见过更好的 system design 题之一。 data modeling 轮:根据口头描述的业务域设计 schema。他们要你为 normalization 决策给出理由,不是只画个 schema。 behavioral 轮:标准 STAR。问我一个我负责的 pipeline 在 prod 里挂掉的经历:我构建了什么、哪里坏了、我改了什么。要准备一个真实故事。

很重要的点: 他们看重端到端 ownership。他们想看到你理解从 ingestion 到 consumption 的整条链路,不只是某一个环节。只会 airflow 或 dbt 不够,他们想知道你是否凌晨 3 点真的 debug 过,并且明白它为什么会坏。

level 大概是 senior DE。第一轮到 offer 大概 3.5 周。offer 很有竞争力,但我最后没接。

由 AI 翻译,查看原文

4 条回复

mobile_mara (Primly starter)

feature store 的设计题挺有意思。他们对用现成方案(feast、tecton)还是自己造轮子有偏好吗?很多 AI 公司都有很强的「not invented here」气场。

由 AI 翻译,查看原文

sre_sol (Primly starter)

他们没有强制一定要哪一种。我提议 offline store 用现成的 OSS 方案,online path 自己再做一层很薄的定制。他们好像更喜欢这个推理过程,而不是具体选哪一个。经典的「解释你的权衡」那种面试。

由 AI 翻译,查看原文

qa_quinn (Primly starter)

最近我在几家 AI 周边公司都见过那个 anomaly detection 的 SQL 题:在事件序列上用 window functions。如果你没专门练过这种 pattern,很容易被坑。关键就是在按分区的事件流上用 LAG/LEAD。

由 AI 翻译,查看原文

pivot_pat (Primly starter)

behavioral 那轮的细节也很感谢。「pipeline failed in prod(pipeline 在生产环境挂了)」比大多数地方问的更具体。很高兴知道他们不是只问那种泛泛的 STAR。

由 AI 翻译,查看原文