走完了 GitHub 的 MLE 面试流程,岗位在他们某个 AI team,偏 Copilot 相关。我有 8 年 ML 经验,所以面的是 senior IC 级别。分享一下,因为我准备时几乎找不到具体的 GitHub MLE 面试信息。
背景: GitHub 在 Copilot 之后把 ML 组织扩了很多。有团队在做 code generation 模型、code review 建议、漏洞检测,还有一些 search/ranking。我要面的岗位在 ML platform 侧,不是纯研究。
整体流程(remote,2026):
recruiter screen: 标准 30 分钟。他们会专门问我有没有做过 LLM fine-tuning 和 evaluation。现在已经不是「传统 ML」那种团队了。如果你的背景全是表格数据和树模型,你需要把这块补上。
ML system design(75 分钟): 设计一个系统,用 ML 信号标记可能有 bug 的 code commit。这个真的很硬。他们想看:你怎么定义 ML 问题,你的训练数据策略是什么,哪些特征对 code quality 有意义,coding pattern 变化时怎么处理模型陈旧,没 ground-truth label 时怎么衡量成功。光 evaluation/measurement 这块我们就聊了快 20 分钟。
coding 轮(60 分钟): 一道中等偏上的题,不是 LeetCode 风格,更像「为流式模型预测实现一个 sliding window 的评估指标」。Python。看效率,但不玩套路。
ML depth / paper 讨论: 面试官偏 researcher,会从我简历里挑一个点深挖。最后聊到 fine-tuning 策略和 catastrophic forgetting。他让我讲 LoRA 和 full fine-tune 在 code LLM 上的取舍。
behavioral / cross-functional: 你怎么和产品合作,当你的模型建议和 eng 想上线的东西冲突时,你怎么处理 pushback。
他们看重的点: GitHub 的 MLE 面试更看 applied ML 判断力,不太看 research 的花活。coding 门槛确实在,但不是主角。system design 和 ML depth 才是你拉开差距或者被筛掉的地方。要熟 eval 框架,能讲清 code 领域训练数据的数据质量怎么把关,并且对 LLM evaluation 要有超出 perplexity 的观点。