AI labs 的 DS 职位挺有意思,因为面试通常会把标准 DS 组件和一些专门针对 AI 系统评估的问题混在一起。Anthropic 也不例外。我的 loop 大概是这样。
Role: 做 model evaluation / applied measurement 的团队里的 Data Scientist。不是纯 ML research,也不是纯 analytics。
SQL 轮: 在共享编辑器里 live coding。两道题。第一题中等:多表 join、聚合、一个 window function。第二题更难:涉及在子组之间做 ranking,并且有个条件会让朴素解法是错的。我日常用 SQL,所以还好。如果你生疏了,真的要练从零写 query,而不是只会读。
统计 / 实验设计: 这是最有意思的一轮。他们让我设计一个实验来评估某个模型改动是否提升了用户结果。难点是:结果变量很难定义和衡量。所以很大一部分时间都在聊我会怎么把 metric 操作化、坏 metric 的风险是什么、以及怎么处理模型输出之间相关性导致标准 A/B 测试假设被破坏的问题。
基础统计是默认门槛,但真正的考点是对 measurement 的应用判断,不是教科书式的假设检验。
Case / DS 的 product sense: 给了一个关于模型规模化行为的场景,我怎么优先级排序去查什么。他们想看结构化思考,以及快速产出假设的能力。
我的 loop 没有 take-home。 听说有的候选人会有,有的不会。不清楚取决于什么。
总体难度: 比偏 analytics 的公司标准 DS loop 更难;比完整的 ML research loop 更轻。实验设计那轮是分水岭;我会把至少一半准备时间花在那儿。
Comp: 我没拿到 offer,所以没有最终数字。recruiter 提到 senior level 的 DS band 在 $280k-$360k TC。
5 条回复
analyst_ana (Primly starter)
你提到模型输出相关、从而违反 A/B 假设这一点很真实,而且大多数常规 DS 面试准备完全忽略。这个提醒很到位。
由 AI 翻译,查看原文
de_derek (Primly starter)
「How would you operationalize a hard-to-define outcome(你会如何把一个难以定义的结果指标落地成可执行、可衡量的东西)」基本就是一半的数据科学实际工作,但多数面试准备把它当脚注。听起来 Anthropic 真的是在考工作本身。
由 AI 翻译,查看原文
finance_faye (Primly starter)
senior 的 DS 给 $280k-$360k TC,和我看到 OpenAI、Cohere 类似级别的公开信息是一个区间。比同公司的 SWE 低一些,但差得不夸张。
由 AI 翻译,查看原文
ds_dmitri (Primly starter)
还有一点我忘了:SQL 轮面试官在我答对之后,还追问了查询优化相关的问题。比如,为什么这种方案在规模变大时会很慢,你会怎么修。至少要在概念层面理解 explain plan。
由 AI 翻译,查看原文
Primly Team
在这种 DS 面试流程里,有一关经常被低估:在分布漂移下做指标定义。当面试官说“用户结果很难定义”时,他们往往在测试你能否把一个模糊目标变成可衡量的 target,同时不制造会把系统搞坏的激励。
一个好用的结构是: 从你要支持的决策开始(上线改动、回滚、分流)。 定义一个主指标,再加 2 到 3 个 guardrail(安全、延迟、成本、用户信任),并说明“更好”是什么意思。 点出故障模式:代理指标被刷、分组后的 Simpson’s paradox、观测值相关、新鲜感效应。 提出验证方案:离线人工评估校准、切片分析、敏感性检查,以及当指标相互矛盾时的处理计划。
在你评估模型改动时,哪些 guardrail 最有效,能防住那种“看起来显然”的指标被轻易刷爆?
由 AI 翻译,查看原文