Apple · Primly 社区

Apple machine learning engineer 面试:2026 年到底该期待什么

ml_mike (Primly starter) · 6 条回复

我 2 月走完了 Apple MLE 的完整 loop,团队是 Siri/Foundation Models。ICT5 level。分享一下,因为网上的 ML 面试准备建议太杂了,而 Apple 的风格确实和 Google/Meta 不太一样。

Loop 结构。 总共六轮:recruiter screen,ML phone screen,然后四轮 onsite。onsite 分别是:ML theory/fundamentals,ML system design,coding,behavioral。

ML phone screen。 和一个 senior MLE 面 1 小时。一半概率/统计(Bayes theorem、bias-variance tradeoff、过度正则化会怎样),一半 ML 概念(gradient descent 到底怎么工作、从第一性原理解释 attention)。不是抓细碎知识点。他们想看你能不能推理。我被要求手推 softmax gradient。这可能是团队特化的,所以别慌,你的可能不一样。

ML theory 轮。 很深。我们花了 25 分钟聊 transformer 架构(attention 机制、positional encoding、为什么 layer norm 放在 attention 前 vs 后)。然后是一道概率题:给一串有偏硬币的投掷序列,推导 bias 的 maximum likelihood estimate。他们明确说可以用计算器,他们想看推理过程。

ML system design。 "Design a personalized notification ranking system for Apple devices."(为 Apple 设备设计一个个性化通知排序系统)这一轮核心是取舍:on-device inference vs server-side、隐私约束(Apple 对这点很执念)、延迟预算、以及怎么处理新用户 cold-start。隐私不是装饰。他们会追问你用什么数据、数据会不会离开设备。你要对 federated learning 或 differential privacy 有能落地的回答。

Coding 轮。 中等偏难 LC。我拿到的是一道图题。不是 ML 专项,就是标准 DS&A。别低估这轮。

和我做过的其他 MLE 面试相比,最大的不同: 隐私是绝对核心,不是打勾项。他们也非常在意你怎么在生产环境评估模型,而不仅是离线。online A/B test 设计、处理分布漂移、在用户投诉前发现模型退化。这些话题在两轮里都出现了。

从第一次联系到 verbal offer 总共 11 周。

由 AI 翻译,查看原文

6 条回复

ds_dmitri (Primly starter)

11 周太久了。他们中途有 ghost 你过吗,还是全程沟通都挺到位?

由 AI 翻译,查看原文

ml_mike (Primly starter)

沟通挺到位,但很慢。recruiter 大概每 10 天跟进一次,但 onsite 后的 debrief 花了将近 3 周。我还得同时处理一个竞对 offer。我跟他们说了之后,他们确实加快了。

由 AI 翻译,查看原文

infra_ines (Primly starter)

on-device vs server-side 的 tradeoff 这个问题太 Apple 了。那基本是他们看一切的视角。提得好。

由 AI 翻译,查看原文

brand_ben (Primly starter)

稍微跑题问下:你的几轮里有 design 或 PM 参与吗,还是全是 MLE/research 的人?

由 AI 翻译,查看原文

ml_mike (Primly starter)

都是 MLE,还有一个 research scientist。没有 PM 或 design 参与我走的这轮。我的 recruiter 说 cross-functional 轮次在 manager/senior-staff 级别更常见。

由 AI 翻译,查看原文

Primly Team

在 senior 的 ML loops 里,有个环节经常被低估:在约束下做评估和调试。就算这一轮被标成「theory」或「system design」,面试官也经常会追问:你怎么知道模型变好了,哪个指标真的匹配产品目标,以及 offline 和 online 不一致时你怎么处理。

一个好用的结构是:(1) 定义成功与护栏(主指标、延迟、公平性、隐私),(2) 建立基线和数据切分策略,(3) 规划 ablation 来归因收益,(4) 分切片做失败分析,(5) 部署计划含监控与回滚。常见翻车点是先跳到「更大的模型」,却没证明瓶颈其实是数据质量、label noise、或评估不匹配。

面试 Apple 的 MLE(2026)时,大家最常看到哪类「debugging」prompt:指标设计、数据问题、训练不稳定,还是生产回归?

由 AI 翻译,查看原文