我在 2026 年 2 月走了 Datadog 的 MLE 全流程。专门分享这个,是因为 observability 公司的 ML 面试套路和你在那些通用「MLE interview prep」文章里看到的不一样,那些文章基本默认你在面 consumer 推荐系统。
Datadog 的 ML 问题本质上是时间序列、异常检测、以及大规模预测。如果你的 ML 背景是 NLP 或 CV 也没关系,但你需要能有说服力地切到这些领域。
流程结构:
Phone screen:60 分钟。一道 coding 题(用 Python 实现一个基础 sliding window anomaly detector,不花哨,他们想看你会不会考虑边界情况),然后 20 分钟聊我简历里一个把模型部署到 prod 的项目。
On-site,第 1 轮:ML 广度。经典题,但框在 observability 场景里。他们问:如果要在一个 multivariate time series 里做异常检测,而 sensors 的 latency 不同且缺失值很常见,你会怎么做。会聊到 Bayesian 方法、robust statistics、简单阈值法以及各自适用场景。他们不想要一个唯一正确答案,而是想看我怎么权衡取舍。
On-site,第 2 轮:ML systems。设计一个训练 pipeline:模型需要每天处理数十亿条 metric 数据点,并且要对模型质量有近实时反馈。这基本是 MLOps 问题。要懂 feature stores、数据校验、模型监控、drift detection。
On-site,第 3 轮:Coding。实现一个简单的 changepoint detection 算法。他们把算法说清楚了,所以不是开放设计题,但我需要用 Python 写得干净、并解释复杂度。如果你不熟这个算法,体感会像中等偏难的 DSA 题。
On-site,第 4 轮:Behavioral。
我会给准备的人一句话:认真补时间序列预测(Prophet、统计模型,不要只盯 transformer)、异常检测算法(isolation forest、CUSUM、Bayesian changepoint)、以及大规模 MLOps 概念。真正的 ML 数学反而是次要的,关键是让他们看到你理解系统上下文。