Scale AI · Primly 社区

Scale AI data scientist 面试:SQL、case study 和统计。到底该准备什么。

de_derek (Primly starter) · 6 条回复

三周前刚结束 Scale AI data scientist 的面试 loop。分享下拆解,因为我当时搜的时候几乎找不到什么信息。

总共四轮。先 recruiter screen,然后三轮分开不同天、背靠背安排。

SQL 轮。 比一般 DS 的 SQL screen 难。不是只考基础聚合。他们给了我一个 schema,大概模拟了他们的 tasker 标注 Pipeline,让我找质量异常值。比如:哪些 tasker 的通过率低于某个阈值,并且过去 30 天做过超过 N 个任务。考到了 window functions。我一开始在一个 PARTITION BY 的问题上卡了一下,他们让我继续把思路拉回来,这点挺加分。期望水平:你要熟练 CTE、window functions,并且能解释为什么要用某种 join。

Case study。 这是最有意思的一轮。他们给了个场景:某一种任务类型(我的是 image segmentation)的标注质量在下降。你怎么发现、怎么量化、怎么修。希望你从 data pipelines 的角度思考,而不只是 notebook 分析。我把回答框在:发现(statistical control charts、用 p-chart 看缺陷率)、诊断(按 tasker 的工龄、设备类型、一天中的时间分 cohort)、干预(定向 review 队列、用 hold-out gold sets 做校准)。他们对我的校准想法提出质疑,我们来回辩了一阵。感觉是他们刻意想看你怎么应对 pushback。

统计和实验设计。 比较标准的 A/B testing,但有个小转折:样本量很小。问题基本是:当总体很小的时候,你什么时候应该提前停实验。我讲了 Bayesian 方法 vs. sequential testing,他们看起来挺喜欢我两个都懂。他们还问了一个概率题,更像脑筋急转弯,不太像实用统计。别想太多。

总体。 这个 loop 挺有内容,不是走流程。我聊到的人都很懂这个领域。SF 一个 mid-senior DS 角色的 comp 大概是 $195k base,另外还有 equity,2026。我在接受前没拿到很细的 equity 拆分,所以有点后悔没更早追问。

欢迎提问。

由 AI 翻译,查看原文

6 条回复

analyst_ana (Primly starter)

这个真的很有帮助。他们会提前告诉你 SQL 是 live coding,还是更偏讨论?我每次看不到我的 query 到底能不能跑就会很慌。

由 AI 翻译,查看原文

consultant_cam (Primly starter)

在共享编辑器里 live coding。后面没有真实数据库,所以跑不了,只能写出来并讲思路。他们不介意一些小的语法问题,只要逻辑对就行。我把一个 window function 的 alias 写错了,就说「在真实环境里我会修掉」,然后继续往下。

由 AI 翻译,查看原文

alex_design (Primly starter)

2026 年,SF mid-senior DS base $195k。Equity:他们有给具体数字吗,还是只说「equity TBD」?我在给这家公司攒 comp 数据。

由 AI 翻译,查看原文

ux_uma (Primly starter)

他们在 recruiter call 里给了一个范围,说 base 大概 $180-220k,取决于 level。Equity 是按 4 年 RSU grant 的美元总额来讲的,但直到 offer letter 才把 vesting cliff 的细节拆开。就是标准的 1 年 cliff,然后按月 vest。

由 AI 翻译,查看原文

returner_ren (Primly starter)

写得很好。那个关于标注质量的 case 其实很符合 Scale 的风格。他们内部非常重视数据质量。问这个很合理。这个 case 你觉得需要 Scale 特有的知识吗,还是用通用的 DS 背景也能答?

由 AI 翻译,查看原文

firsttime_mgr (Primly starter)

主要是比较通用的 DS 背景。你需要大致了解 RLHF pipelines 长什么样,以及为什么在那个阶段数据质量很重要,不过他们在题目里也给了足够的背景。我会建议在 loop 之前读一下他们的博客,先把术语熟悉起来。

由 AI 翻译,查看原文