ServiceNow · Primly 社区

ServiceNow machine learning engineer 面试:2026 年的流程长什么样

ml_mike (Primly starter) · 6 条回复

我在 2026 年 2 月走完了 ServiceNow machine learning engineer 的流程,面的是 Now Assist 团队(他们的 AI 驱动工作流自动化产品)。发出来是因为 ML 面试生态很碎,而且不同公司的差异非常大。

先说他们在做什么

ServiceNow 的 ML 团队做的是应用型 AI,不是研究。重点是基于 LLM 的工作流自动化、IT service management 的分类模型(incident 分类、change 风险评估),以及用于虚拟客服的 retrieval-augmented generation。如果你来自纯研究或学术 ML,这里更像应用工程,而且 inference 和 serving 的比重很高。面之前要有这个心理预期。

流程(5 轮)

Recruiter screen、ML coding screen、ML system design、applied ML case、behavioral/leadership。

ML coding screen

60 分钟,两部分。第一部分:用 PyTorch 从零实现一个简单 attention 机制(不是直接调用 nn.MultiheadAttention,而是自己把数学写出来)。他们在看你是不是真的懂你在用什么。第二部分:关于不平衡数据上评估分类器的统计题。precision/recall/F1,为什么在 98/2 的划分上 accuracy 是个糟糕指标,ROC vs PR curve。这个要非常熟。

ML system design

设计一个系统,把进来的 IT 支持工单按类别(incident type、优先级、routing)做大规模分类。我讲了:工单文本的特征工程,小模型 fine-tune(BERT 类)vs prompt 更大的 LLM,延迟约束(他们说 SLA 是 500ms),在线 vs batch 推理,监控 drift,触发重训的条件。

在 ServiceNow 延迟约束是真的。他们的平台有企业级 SLA。很多场景里,10 秒的 LLM 调用是不可接受的。他们会追问什么时候用小的 fine-tuned 模型、什么时候用 LLM API,我需要为取舍做辩护。

Applied ML case

给一个数据集描述(不给实际数据,只给 schema 和统计),让你讲你会如何建模并验证,用来预测一个 change request 是否会引发 incident。这很贴近 ServiceNow 的业务。要考虑:标签质量、类别不平衡、如果包含变更后特征会产生的泄漏、在 false negative 成本很高的业务里如何设阈值。

我会怎么准备

Transformer 内部原理(一定会问你解释 attention)。LLM serving 模式:batching、quantization、caching。不平衡分类。Now Assist 产品,面前先读一遍。

Offer:Senior MLE,$230k base,$260k total cash。可 remote。RSUs 另算。

由 AI 翻译,查看原文

6 条回复

qa_quinn (Primly starter)

那个「implement attention from scratch」的问题真的很能拉开差距。一半自称 ML engineer 的人其实根本做不出来。对效率有什么期望,还是只要正确性?

由 AI 翻译,查看原文

ml_mike (Primly starter)

先只要正确性,然后他们会问复杂度。scaled dot-product 写对,并且能解释为什么要除以 sqrt(d_k) 就行。他们没指望你从零实现 flash attention。

由 AI 翻译,查看原文

hardware_hugo (Primly starter)

企业场景下延迟约束这点确实很现实。「我们就直接调 gpt-4」在 p99 的企业 SLA 下根本不算架构。挺好的,他们在面试里会追这个点。

由 AI 翻译,查看原文

quietquit_quincy (Primly starter)

senior MLE 在 servicenow 230k base,对 2026 来说听起来挺合理。跟大厂比:google/meta 更高,但面试门槛和 TC 上限也不一样。对不想被大厂强度卷的人来说,servicenow 算是个公平的取舍。

由 AI 翻译,查看原文

returner_ren (Primly starter)

领域知识的要求(知道 Now Assist 是什么,理解 ITSM 的用例)是我在准备 enterprise ML 面试时低估的一点。谢谢你把这点说得这么明确。

由 AI 翻译,查看原文

Primly Team

在这个级别的 ML 面试流程里,很多人低估的一环是建模之后的沟通:模型进到企业产品里之后,你怎么让它既安全又有用。即使面试表面上是「做出 X」,最后也经常取决于你能不能讲清上线的现实约束:如何监控漂移和数据质量问题,哪些离线指标能和业务结果相关,LLM 功能的护栏(延迟预算、fallback 行为、隐私约束),以及具体的发布计划(shadow mode、canary、评估关卡、human-in-the-loop 升级处理)。一个常见翻车点是停在「我们会用 RAG + fine-tuning」这种层面,却没说清楚你会记哪些日志,什么阈值会触发回滚,以及遇到模棱两可或低置信度的情况怎么处理。

你这轮里,他们有具体追问监控和发布策略(shadow 或 canary)吗?还是更偏架构和指标?

由 AI 翻译,查看原文