Cohere · Primly 社区

Cohere data engineer 面试:Pipeline 和 SQL,我上个月的经历

de_derek (Primly starter) · 6 条回复

刚在 2026 年 5 月底走完 Cohere data engineering 的 loop。把我记得的都倒出来,因为我准备的时候找不到任何细节。

过了最开始的 recruiter screen 之后,总共四轮。没有 take-home,这点我很满意。

第 1 轮:技术电话面(45 分钟) SQL 为主。面试官在浏览器里给了一个 schema,带着走了三道由易到难的 query。大概是 window function、CTE、以及在比较大的表上做带过滤条件的聚合。不是坑题,就是稳定输出 SQL 的那种。有一题是让你从一个 sample pipeline 输出里找数据质量问题,我觉得比纯考语法有意思。

第 2 轮:数据 system design(60 分钟) 设计一个 pipeline,把模型推理日志以规模化方式 ingest 并提供查询服务。他们在意 latency vs throughput 的取舍、schema evolution(模型一直变,所以你的 pipeline 不能一变就炸)、还有幂等。我聊了用 Kafka 做 ingest、Flink 做流式变换、Iceberg 做存储层。他们会专门 push back Iceberg,想听我为什么选它而不是 Delta Lake。不是挖坑,就是认真讨论工程取舍。

第 3 轮:Coding(45 分钟) 偏 Python。一题是写一个处理嵌套 JSON 的 transformation function(很贴近 ML metadata)。一题是根据截图 debug 一个坏掉的 Airflow DAG。完全不是 LeetCode 风格,更像日常 data eng 的活。

第 4 轮:Behavioral + 跨职能 标准的影响力问题。还有几题是我会怎么和 ML engineers 一起定义 data contract。他们好像真的很在意跨团队沟通,这也符合他们的模型开发文化。

从第一次接触到 offer:大概 5 周。最后一轮 debrief 后 3 天给了 offer,节奏挺舒服。

面试官都很强,SQL 部分是我最近做过最有意思的技术面之一。如果你是有 ML/AI 公司背景的 data eng,会很对口。如果你主要做 warehouse/BI,进去前最好补一下 streaming 的概念。

由 AI 翻译,查看原文

6 条回复

analyst_ana (Primly starter)

这正是我需要的。你还记得 SQL schema 是 Postgres 风格还是 Spark SQL 吗?我主要做 BigQuery,不太知道怎么校准。

由 AI 翻译,查看原文

de_derek (Primly starter)

浏览器里的工具用的是 Postgres 语法,不过面试官说只是示意,不是在考 engine-specific 的怪癖。标准 SQL 你熟就没问题。window functions 肯定会考到,所以一定要把这块练扎实。

由 AI 翻译,查看原文

ds_dmitri (Primly starter)

system design 里问 idempotency 这个点在 AI infra 公司确实是个固定主题。Cohere 发新模型版本足够频繁,pipeline 能不能重启、能不能恢复真的是实打实的工程问题,不只是课本知识。你把这个点标出来很到位。

由 AI 翻译,查看原文

sre_sol (Primly starter)

总共 5 周大致符合我在这个领域看到的节奏。他们更关注 observability,还是主要看 pipeline design 本身?

由 AI 翻译,查看原文

de_derek (Primly starter)

正式轮次里对 observability 涉及不多,但我在系统设计里提到监控 inference lag 时,它就很自然地聊到了。我提了对数据新鲜度 SLA 做告警,他们好像挺喜欢,但没有深挖。

由 AI 翻译,查看原文

market_realist (Primly starter)

四轮还没有 take-home 其实挺清爽的。大多数公司都会塞个 6 小时项目在某个环节。感谢写这份分享。

由 AI 翻译,查看原文