Datadog · Primly 社区

Datadog machine learning engineer 面试:少点 hype,多点落地系统

ml_mike (Primly starter) · 4 条回复

我在 2026 年 2 月走了 Datadog 的 MLE 全流程。专门分享这个,是因为 observability 公司的 ML 面试套路和你在那些通用「MLE interview prep」文章里看到的不一样,那些文章基本默认你在面 consumer 推荐系统。

Datadog 的 ML 问题本质上是时间序列、异常检测、以及大规模预测。如果你的 ML 背景是 NLP 或 CV 也没关系,但你需要能有说服力地切到这些领域。

流程结构:

Phone screen:60 分钟。一道 coding 题(用 Python 实现一个基础 sliding window anomaly detector,不花哨,他们想看你会不会考虑边界情况),然后 20 分钟聊我简历里一个把模型部署到 prod 的项目。

On-site,第 1 轮:ML 广度。经典题,但框在 observability 场景里。他们问:如果要在一个 multivariate time series 里做异常检测,而 sensors 的 latency 不同且缺失值很常见,你会怎么做。会聊到 Bayesian 方法、robust statistics、简单阈值法以及各自适用场景。他们不想要一个唯一正确答案,而是想看我怎么权衡取舍。

On-site,第 2 轮:ML systems。设计一个训练 pipeline:模型需要每天处理数十亿条 metric 数据点,并且要对模型质量有近实时反馈。这基本是 MLOps 问题。要懂 feature stores、数据校验、模型监控、drift detection。

On-site,第 3 轮:Coding。实现一个简单的 changepoint detection 算法。他们把算法说清楚了,所以不是开放设计题,但我需要用 Python 写得干净、并解释复杂度。如果你不熟这个算法,体感会像中等偏难的 DSA 题。

On-site,第 4 轮:Behavioral。

我会给准备的人一句话:认真补时间序列预测(Prophet、统计模型,不要只盯 transformer)、异常检测算法(isolation forest、CUSUM、Bayesian changepoint)、以及大规模 MLOps 概念。真正的 ML 数学反而是次要的,关键是让他们看到你理解系统上下文。

由 AI 翻译,查看原文

4 条回复

ds_dmitri (Primly starter)

用 changepoint detection 做 coding round 对 Datadog 来说太 on-brand 了。CUSUM 或 PELT 可能就是他们期望的实现。他们有指定算法吗,还是会选一些更奇怪的?

由 AI 翻译,查看原文

ml_mike (Primly starter)

他们说是 PELT(Pruned Exact Linear Time)。我概念上懂,但没从零写过代码。我大概写出了 70% 的干净实现,剩下时间在讨论动态规划结构。他们说不期待完美实现,只想看我的解题过程。但我还是走出来觉得那轮我发挥一般。

由 AI 翻译,查看原文

infra_ines (Primly starter)

ML systems design 轮听起来几乎就像分布式系统设计轮,只是里面放了一些像模型一样的对象。说实话这很合理。如果模型在那个规模上跑,90% 的难题都是基础设施难题。

由 AI 翻译,查看原文

sdr_sky (Primly starter)

MLE comp 在 Datadog,senior level,2026:我的 offer 是 base 约 $210k,RSU grant 约 $380k(4 年),15% bonus target。假设股价不变,第 1 年总包约 $330k。这个是 Staff 的 MLE 角色,NYC。Senior(低一级)base 大概率会低 $30-40k。

由 AI 翻译,查看原文