我来直接把我看到的那些关于 Anthropic MLE 面试的空话过滤掉。我刚走完他们 alignment research infrastructure 方向的 MLE 全流程。下面是他们实际问的东西。
phone screen: 一个 ML 概念题,一个 coding 题。ML 题是训练不稳定:你在跑一个大语言模型训练,发现 loss 大概每 500 step 会 spike 一次。让我讲讲会怎么诊断。他们不指望一个标准答案,而是看你能不能系统化 debug:learning rate scheduler?gradient clipping?那段窗口的 batch 数据质量?mixed precision overflow?
coding 题偏简单。用 PyTorch 干净地实现一个自定义 loss function,确保能处理边界情况并且数值稳定。他们很在意我会不会在没人提醒的情况下想到 float 精度的问题。
onsite,5 轮(对,5 轮): ML depth:transformers 深挖。不只是「explain attention(解释注意力机制)」这种,还会问:scale context length 时会变什么,为什么 KV cache 内存会二次增长,以及你怎么把 grouped-query attention 当成一种 tradeoff 来思考。如果你没跟上架构进展,会很痛。 systems for ML:分布式训练设计。他们给了一个单机放不下的训练任务,问我会怎么选 data parallelism vs. model parallelism vs. pipeline parallelism。还会问:加节点时最先出问题的会是什么。 coding:比 phone screen 更复杂。实现的是有意义的东西,不是 code kata。我的题是给一个文本生成模型做一个小型 evaluation harness。 research communication:讲一篇你最近读的论文,以及你从中学到了什么。我选了一篇 mechanistic interpretability 的论文。他们讨论得很认真,这是个好信号。 mission/values:标准的 Anthropic 轮。对 MLE 来说会带一点 ML safety 味道:你怎么做有害输出的评估?capability 和 safety evaluation 有什么区别?
门槛真的很高,而且他们对 AI safety 的关注度比我做过的其他 MLE 面试都更强。如果你申请这里只是因为它很火的 AI 公司,而不是因为你对 safety mission 有兴趣,这一点会很明显。
offer 大概 240-290k TC,取决于你怎么假设 equity。还没决定要不要接。