Anthropic · Primly 社区

Anthropic data scientist 面试(SQL + case + stats),我的 loop 拆解

ds_dmitri (Primly starter) · 5 条回复

AI labs 的 DS 职位挺有意思,因为面试通常会把标准 DS 组件和一些专门针对 AI 系统评估的问题混在一起。Anthropic 也不例外。我的 loop 大概是这样。

Role: 做 model evaluation / applied measurement 的团队里的 Data Scientist。不是纯 ML research,也不是纯 analytics。

SQL 轮: 在共享编辑器里 live coding。两道题。第一题中等:多表 join、聚合、一个 window function。第二题更难:涉及在子组之间做 ranking,并且有个条件会让朴素解法是错的。我日常用 SQL,所以还好。如果你生疏了,真的要练从零写 query,而不是只会读。

统计 / 实验设计: 这是最有意思的一轮。他们让我设计一个实验来评估某个模型改动是否提升了用户结果。难点是:结果变量很难定义和衡量。所以很大一部分时间都在聊我会怎么把 metric 操作化、坏 metric 的风险是什么、以及怎么处理模型输出之间相关性导致标准 A/B 测试假设被破坏的问题。

基础统计是默认门槛,但真正的考点是对 measurement 的应用判断,不是教科书式的假设检验。

Case / DS 的 product sense: 给了一个关于模型规模化行为的场景,我怎么优先级排序去查什么。他们想看结构化思考,以及快速产出假设的能力。

我的 loop 没有 take-home。 听说有的候选人会有,有的不会。不清楚取决于什么。

总体难度: 比偏 analytics 的公司标准 DS loop 更难;比完整的 ML research loop 更轻。实验设计那轮是分水岭;我会把至少一半准备时间花在那儿。

Comp: 我没拿到 offer,所以没有最终数字。recruiter 提到 senior level 的 DS band 在 $280k-$360k TC。

由 AI 翻译,查看原文

5 条回复

analyst_ana (Primly starter)

你提到模型输出相关、从而违反 A/B 假设这一点很真实,而且大多数常规 DS 面试准备完全忽略。这个提醒很到位。

由 AI 翻译,查看原文

de_derek (Primly starter)

「How would you operationalize a hard-to-define outcome(你会如何把一个难以定义的结果指标落地成可执行、可衡量的东西)」基本就是一半的数据科学实际工作,但多数面试准备把它当脚注。听起来 Anthropic 真的是在考工作本身。

由 AI 翻译,查看原文

finance_faye (Primly starter)

senior 的 DS 给 $280k-$360k TC,和我看到 OpenAI、Cohere 类似级别的公开信息是一个区间。比同公司的 SWE 低一些,但差得不夸张。

由 AI 翻译,查看原文

ds_dmitri (Primly starter)

还有一点我忘了:SQL 轮面试官在我答对之后,还追问了查询优化相关的问题。比如,为什么这种方案在规模变大时会很慢,你会怎么修。至少要在概念层面理解 explain plan。

由 AI 翻译,查看原文

Primly Team

在这种 DS 面试流程里,有一关经常被低估:在分布漂移下做指标定义。当面试官说“用户结果很难定义”时,他们往往在测试你能否把一个模糊目标变成可衡量的 target,同时不制造会把系统搞坏的激励。

一个好用的结构是: 从你要支持的决策开始(上线改动、回滚、分流)。 定义一个主指标,再加 2 到 3 个 guardrail(安全、延迟、成本、用户信任),并说明“更好”是什么意思。 点出故障模式:代理指标被刷、分组后的 Simpson’s paradox、观测值相关、新鲜感效应。 提出验证方案:离线人工评估校准、切片分析、敏感性检查,以及当指标相互矛盾时的处理计划。

在你评估模型改动时,哪些 guardrail 最有效,能防住那种“看起来显然”的指标被轻易刷爆?

由 AI 翻译,查看原文