Hugging Face · Primly 社区

Hugging Face data scientist 面试(SQL + case + stats):我上个月的 loop 全拆解

ds_dmitri (Primly starter) · 4 条回复

5 月 2026 走了 HF 的 DS loop。写点细节,因为我面之前完全找不到有用信息。

recruiter screen:30 分钟,很标准。他们想确认你能讲 ML 项目,而且听起来不是从论文里复制粘贴来的。他们提到我会支持的 team 主要做 model evaluation metrics 和 dataset quality,所以你也要对齐。

round 1:SQL + stats screen(60 分钟) 这是我最担心的一轮。两道 SQL:一道是 window function(在 rolling 7-day window 内按 engagement 给用户排名),另一道要用 self-join 找出那些 fine-tuned 版本在 5 个 benchmark 里至少 3 个比 base 更好的 model run。两道都是中等难度,更像 analytics SQL 而不是 leetcode SQL。他们在意你写得干净,还能解释业务直觉。

stats 部分:a/b test,问怎么检测一个新 tokenizer 是否显著降低 perplexity。他们让我讲测试设计、需要多少样本量、以及怎么处理 variance。不算特别深,但他们想看你能推理实验有效性。

round 2:case study(90 分钟 take-home + 30 分钟 debrief) 他们给了我一个合成数据集:50 个模型在 6 个任务上的 benchmark 分数。要求:找出哪些 benchmark 对用户满意度最有预测性,标出数据质量问题,并提出一个评分方法。我用 pandas + scipy 做分析,画了几张图。debrief 主要是「why this metric and not that one(为什么用这个指标而不是那个)」这类问题,氛围偏聊天。

round 3:跨职能 behavioral(45 分钟) 一个 panel:EM + 一位 senior DS。标准 behavioral,但更偏你怎么和 researcher 协作。他们很想知道你能不能把模糊的 research 输出翻译成可落地的东西。我被问了「tell me about a time you pushed back on a metric choice(讲讲你曾经反对某个指标选择的一次经历)」和「how do you handle it when a model improves on benchmarks but worse in production.(当一个模型在 benchmark 上变好了但线上表现更差时,你怎么处理)」

overall:从第一轮到 offer 两周。他们推进比我想象的快,考虑到公司规模。offer 对 remote-first 角色来说挺有竞争力的。随便问。

由 AI 翻译,查看原文

4 条回复

analyst_ana (Primly starter)

这也太有帮助了,谢谢。dataset 是提前给你的还是通话时才给?take-home 给了你多长时间?

由 AI 翻译,查看原文

ds_dmitri (Primly starter)

他们在 debrief 前 48 小时发的。时间很充裕,但别低估 write-up,他们看得很认真。我大概花了 6 小时做分析,2 小时写 writeup,感觉差不多刚好。

由 AI 翻译,查看原文

ml_mike (Primly starter)

tokenizer perplexity 的 a/b test 那个问题挺有意思的,这其实是个不简单的 experiment design 问题。他们有追问 multiple comparisons,还是只问了最基础的 test setup?

由 AI 翻译,查看原文

market_realist (Primly starter)

两周从开始到 offer 很快了。我在另一家 AI 公司的 loop 花了 6 周,他们最后还是 ghost 了。感谢你把细节发出来。

由 AI 翻译,查看原文