这就是我当时准备时希望有人写出来的帖子。我在 2026 年 2 月通过了 HF MLE loop 并接受了 offer,分享一些细节。
岗位背景: 团队做 model evaluation infrastructure,具体是搭建系统,在 hub 上以规模化方式跑 benchmark suites。所以不是纯研究,是有真实工程约束的 applied ML。
round 1:ML fundamentals(60 分钟) 这更像 senior 的 ML screen,而不是 research screen。他们考的是广度,不是深度。问题覆盖: 解释 autoregressive 和 masked language models 在不同 downstream tasks 上的取舍。 你在跑一个 eval suite,看到 model A 在 MMLU 上胜过 model B,但 B 在 human preference 上胜过 A。你怎么解读? 一个 fine-tuned model 在 RLHF 之后在 base task 上退化了。可能原因是什么,你怎么 debug?
没有那种「implement backprop from scratch(从零实现反向传播)」类型的问题。他们想看你能清晰地思考真实问题。
round 2:coding(90 分钟) 两道题。第一道是算法题(tree traversal 变体),中等难度。第二道更偏 ML:实现一个简单的 evaluation harness,可以在 dataset 上跑 model 并计算多个指标,同时能处理单个样本出错而不让整个 eval 停掉。第二题非常 HF 风格,值得提前想清楚。
round 3:ML system design(60 分钟) 设计一个系统:当新的 model versions 上传到 hub 时,持续跑 model benchmarks。约束很有意思:compute 很贵,有些 benchmarks 很慢,model 尺寸差异巨大,而且要处理 community models(不可信代码)。scheduling 沙箱化、优先级队列、缓存部分结果、以及如何把结果展示给用户,都是我们聊到的点。我听说这一轮把同批候选人拉开差距。
round 4:behavioral(45 分钟) 和一位 principal engineer。主要聊 research-to-production 的张力,以及当「正确」的方案要花「够用」方案 3 倍时间时我怎么处理。他们还问了我对 eval metrics 的理念,我觉得这对 behavioral 来说是个挺有洞察的问题。
offer:$205k base + performance bonus,remote US。equity 很少。如果你真认同 open-source ML ecosystem 的使命,这份工作是值得的。