上个月刚结束 OpenAI 的 data engineer 全流程。趁还新鲜分享一下,因为我准备时完全找不到具体信息。
流程是:recruiter screen,然后 45 分钟技术电话面试,然后 4 小时 onsite(3 轮 technical + 1 轮 values/culture)。从第一次联系到口头 offer 大概 5 周。
Phone screen: 重点是 SQL 和基础数据建模。他们给了我一个 schema,描述一个业务问题,让我写 query。题本身不算变态难,但会追边界情况:null 怎么办、timezone 差异怎么处理、这条 query 数据量变 10 倍还能不能扛。如果你很久没想过 query performance,建议这通电话前补一下。
Onsite 第 1 轮(data pipelines): 这是最硬的一轮。他们描述了一个很真实的数据摄取场景、规模化的 model training data,然后让我讲怎么搭 pipeline。他们追问的点包括:fault tolerance、idempotency、exactly-once 语义、monitoring。提到了 Airflow,也讨论了不同环节用 streaming 还是 batch。非常实用,没有冷知识。
Onsite 第 2 轮(coding + data structures): 相对标准的 coding。两道 LeetCode 风格的题,中等难度。一道明显跟 graph 有点关系。他们不执着 hard 题,但想看代码干净、沟通清楚。写之前先把思路说出来。
Onsite 第 3 轮(system design,数据口味): 设计 feature store 或类似方向的东西。我拿到的 prompt 大概是:怎么建一个系统,为模型推理提供实时 features。不只看 happy path,他们希望你讨论一致性、延迟取舍、schema evolution。
Values 轮: Behavioral,且非常 mission-focused。比如为什么 AI safety 对你重要、在 AI 场景下负责任的数据实践是什么样。这轮在 OpenAI 真的很重要,不是走过场。
Comp 备注:我拿到的一个 mid-senior DE offer,大致在我对顶级 SF 市场的预期区间内,跟 Meta/Google 差不多,但考虑公司阶段股权上行空间更大。别接第一个数字。
评论里愿意回答更具体的问题。