OpenAI · Primly 社区

OpenAI data engineer 面试:pipelines 和 SQL,他们到底考了什么

analyst_ana (Primly starter) · 4 条回复

上个月刚结束 OpenAI 的 data engineer 全流程。趁还新鲜分享一下,因为我准备时完全找不到具体信息。

流程是:recruiter screen,然后 45 分钟技术电话面试,然后 4 小时 onsite(3 轮 technical + 1 轮 values/culture)。从第一次联系到口头 offer 大概 5 周。

Phone screen: 重点是 SQL 和基础数据建模。他们给了我一个 schema,描述一个业务问题,让我写 query。题本身不算变态难,但会追边界情况:null 怎么办、timezone 差异怎么处理、这条 query 数据量变 10 倍还能不能扛。如果你很久没想过 query performance,建议这通电话前补一下。

Onsite 第 1 轮(data pipelines): 这是最硬的一轮。他们描述了一个很真实的数据摄取场景、规模化的 model training data,然后让我讲怎么搭 pipeline。他们追问的点包括:fault tolerance、idempotency、exactly-once 语义、monitoring。提到了 Airflow,也讨论了不同环节用 streaming 还是 batch。非常实用,没有冷知识。

Onsite 第 2 轮(coding + data structures): 相对标准的 coding。两道 LeetCode 风格的题,中等难度。一道明显跟 graph 有点关系。他们不执着 hard 题,但想看代码干净、沟通清楚。写之前先把思路说出来。

Onsite 第 3 轮(system design,数据口味): 设计 feature store 或类似方向的东西。我拿到的 prompt 大概是:怎么建一个系统,为模型推理提供实时 features。不只看 happy path,他们希望你讨论一致性、延迟取舍、schema evolution。

Values 轮: Behavioral,且非常 mission-focused。比如为什么 AI safety 对你重要、在 AI 场景下负责任的数据实践是什么样。这轮在 OpenAI 真的很重要,不是走过场。

Comp 备注:我拿到的一个 mid-senior DE offer,大致在我对顶级 SF 市场的预期区间内,跟 Meta/Google 差不多,但考虑公司阶段股权上行空间更大。别接第一个数字。

评论里愿意回答更具体的问题。

由 AI 翻译,查看原文

4 条回复

ux_uma (Primly starter)

谢谢拆解。system design 里给 feature store 这个 prompt,结合他们在做的东西确实很合理。他们期待你知道具体的开源工具吗(比如 Feast 或 Tecton),还是更偏架构无关?

由 AI 翻译,查看原文

de_derek (Primly starter)

整体更偏架构无关,但提到一些工具并且知道它们的取舍会加分。我提了线上 serving 用 Redis,离线用 columnar storage,还简单提了一下 Feast。他们看起来更在意你的推理过程,而不是你有没有用过他们完全一样的技术栈。

由 AI 翻译,查看原文

firsttime_mgr (Primly starter)

values 那轮不简单,这点很符合。我有几个在那里工作的朋友说,AI safety alignment 这题在各种岗位里都会反复出现,不只是 research。如果你确实没有一个经过思考的观点,面试前先花时间形成一个。

由 AI 翻译,查看原文

analyst_ana (Primly starter)

他们在整个 loop 里有区分 MLE 和 DE 吗?还是基本上是同一套 rounds?

由 AI 翻译,查看原文