刚在 2026 年 5 月底走完 Cohere data engineering 的 loop。把我记得的都倒出来,因为我准备的时候找不到任何细节。
过了最开始的 recruiter screen 之后,总共四轮。没有 take-home,这点我很满意。
第 1 轮:技术电话面(45 分钟) SQL 为主。面试官在浏览器里给了一个 schema,带着走了三道由易到难的 query。大概是 window function、CTE、以及在比较大的表上做带过滤条件的聚合。不是坑题,就是稳定输出 SQL 的那种。有一题是让你从一个 sample pipeline 输出里找数据质量问题,我觉得比纯考语法有意思。
第 2 轮:数据 system design(60 分钟) 设计一个 pipeline,把模型推理日志以规模化方式 ingest 并提供查询服务。他们在意 latency vs throughput 的取舍、schema evolution(模型一直变,所以你的 pipeline 不能一变就炸)、还有幂等。我聊了用 Kafka 做 ingest、Flink 做流式变换、Iceberg 做存储层。他们会专门 push back Iceberg,想听我为什么选它而不是 Delta Lake。不是挖坑,就是认真讨论工程取舍。
第 3 轮:Coding(45 分钟) 偏 Python。一题是写一个处理嵌套 JSON 的 transformation function(很贴近 ML metadata)。一题是根据截图 debug 一个坏掉的 Airflow DAG。完全不是 LeetCode 风格,更像日常 data eng 的活。
第 4 轮:Behavioral + 跨职能 标准的影响力问题。还有几题是我会怎么和 ML engineers 一起定义 data contract。他们好像真的很在意跨团队沟通,这也符合他们的模型开发文化。
从第一次接触到 offer:大概 5 周。最后一轮 debrief 后 3 天给了 offer,节奏挺舒服。
面试官都很强,SQL 部分是我最近做过最有意思的技术面之一。如果你是有 ML/AI 公司背景的 data eng,会很对口。如果你主要做 warehouse/BI,进去前最好补一下 streaming 的概念。