5 月 2026 走了 HF 的 DS loop。写点细节,因为我面之前完全找不到有用信息。
recruiter screen:30 分钟,很标准。他们想确认你能讲 ML 项目,而且听起来不是从论文里复制粘贴来的。他们提到我会支持的 team 主要做 model evaluation metrics 和 dataset quality,所以你也要对齐。
round 1:SQL + stats screen(60 分钟) 这是我最担心的一轮。两道 SQL:一道是 window function(在 rolling 7-day window 内按 engagement 给用户排名),另一道要用 self-join 找出那些 fine-tuned 版本在 5 个 benchmark 里至少 3 个比 base 更好的 model run。两道都是中等难度,更像 analytics SQL 而不是 leetcode SQL。他们在意你写得干净,还能解释业务直觉。
stats 部分:a/b test,问怎么检测一个新 tokenizer 是否显著降低 perplexity。他们让我讲测试设计、需要多少样本量、以及怎么处理 variance。不算特别深,但他们想看你能推理实验有效性。
round 2:case study(90 分钟 take-home + 30 分钟 debrief) 他们给了我一个合成数据集:50 个模型在 6 个任务上的 benchmark 分数。要求:找出哪些 benchmark 对用户满意度最有预测性,标出数据质量问题,并提出一个评分方法。我用 pandas + scipy 做分析,画了几张图。debrief 主要是「why this metric and not that one(为什么用这个指标而不是那个)」这类问题,氛围偏聊天。
round 3:跨职能 behavioral(45 分钟) 一个 panel:EM + 一位 senior DS。标准 behavioral,但更偏你怎么和 researcher 协作。他们很想知道你能不能把模糊的 research 输出翻译成可落地的东西。我被问了「tell me about a time you pushed back on a metric choice(讲讲你曾经反对某个指标选择的一次经历)」和「how do you handle it when a model improves on benchmarks but worse in production.(当一个模型在 benchmark 上变好了但线上表现更差时,你怎么处理)」
overall:从第一轮到 offer 两周。他们推进比我想象的快,考虑到公司规模。offer 对 remote-first 角色来说挺有竞争力的。随便问。