Scale AI · Primly 社区

Scale AI data engineer 面试:2026 年的 pipeline 和 SQL 轮实际长什么样

analyst_ana (Primly starter) · 6 条回复

最近走完了 Scale AI data engineer 的面试 loop。发这个是因为网上信息很少,而且大多是 ML/SWE 岗。

背景:我面的是 senior DE,7 年经验,主要做 Spark、Airflow,以及在 fintech 用 Redshift/BigQuery。整个 loop 四轮,全部技术面。

SQL 轮。 比我预期更重。他们不只想看 select 和 group by。场景是围绕时间序列的标注数据建模的:给你一张 task completion 表,包含时间戳和 worker ID,让你写 query 找出按小时的吞吐下降,并标记那些最近一周 error rate 相对历史基线突然飙升的 worker。历史基线那部分需要 self-join 加子查询或 CTE。我们选了 CTE,因为可读性更好。然后他们问如果这张表有 5 亿行,你怎么优化。按日期分区、按 worker_id 聚簇、用 materialized view 做基线计算。答案都挺标准,但他们会追问取舍。

Pipeline 设计轮。 最贴近现实的一轮。题目是:设计一个 pipeline,摄入多种 task type 的 annotation events,把它们标准化成一个 canonical schema,并路由到下游的质量检查和计费系统。我讲了 Kafka 做 event bus、用 schema registry 处理不同 task type 的 schema 演进、Spark Streaming 或 Flink 做 transform 层,以及写入路径同时落到 Delta Lake 表(分析)和 Postgres sink(计费)。他们特别问了 late-arriving events 和你怎么做去重。我讲了 watermarks 和幂等写入。讨论很好。

Coding 轮。 一道 Python 题:写个函数,输入是一组 annotation events,输出聚合后的质量指标。不复杂,主要看代码整洁和边界情况处理。注意输入里可能有 None。他们很在意你能优雅处理。

Behavioral 轮。 一轮 hiring manager behavioral。问题标准但追问很深:讲一次生产环境 pipeline 挂了,你会怎么做、下次会怎么不同。他们听的是 ownership 和 postmortem 思维,不是「我们修好了」就结束。

从第一次 screen 到 offer 大概 3 周。给的 base 大概是 SF 的 senior DE 级别 $185k。我 push back 了一次,base 多了 $10k,RSU 没动。值得试一下。

由 AI 翻译,查看原文

6 条回复

sec_sasha (Primly starter)

这个 pipeline 设计轮听起来很靠谱。他们问了 failure mode,还是只问了 happy path?按我的经验,好的面试官总是想知道最先会在哪里坏掉。

由 AI 翻译,查看原文

de_derek (Primly starter)

他们绝对会问 failure modes。我把 happy path 讲完之后,面试官说:“那现在 schema registry 挂了,会发生什么?”然后我们一路推演 graceful degradation。我觉得你如果只讲 happy path,会丢不少分。

由 AI 翻译,查看原文

sre_sol (Primly starter)

2026 年,Kafka + schema registry 基本就是 90% pipeline design 题的标准答案。挺好他们追问了 late-arriving events,真正的复杂度就在那里。他们对 watermarks 满意吗,还是想要更具体的方案?

由 AI 翻译,查看原文

de_derek (Primly starter)

他们让我量化 watermark window。我说「it depends on SLA」他们又逼我给具体例子。我说对一个 SLA 4 小时的任务类型,用 2 小时的 watermark 能留出空间吃掉大多数 stragglers。他们看起来挺接受这个表述的。

由 AI 翻译,查看原文

jp_newgrad (Primly starter)

他们在 Python 轮问的是 Leetcode 风格的 coding,还是更偏实用的数据处理?我在准备 new grad DE 角色,想搞清楚该把重心放在哪。

由 AI 翻译,查看原文

de_derek (Primly starter)

更偏实用。我写的那个函数基本是 groupby 然后 aggregate 的逻辑,不是算法题。我还是会复习一下时间复杂度,因为他们可能会问「这个复杂度是多少」,但不是 LeetCode hard。new grad 的话我预计差不多,或者稍微简单一点。

由 AI 翻译,查看原文