MongoDB · Primly 社区

MongoDB machine learning engineer 面试:跟我预期完全不一样

ml_mike (Primly starter) · 4 条回复

今年早些时候走了 MongoDB 的 MLE loop,岗位在他们 AI 和 ML platform 团队。他们现在在做真正的 ML,主要围绕 Atlas 里的 vector search 集成、自然语言 query 生成、以及内部 ML 工具链。这不是那种「数据库公司在做 ML 表演」。

流程大概是这样:

recruiter screen:很快,聊背景和为什么在数据库公司做 MLE。这个问题其实很合理。我大概说了我想做 ML 和结构化/非结构化数据检索交叉的方向。他们觉得这个动机说得通。

ML technical screen(60 分钟):问我设计一个 recommendation system,重点在 retrieval stage。很贴合 MongoDB 在推 Atlas Vector Search。我们聊了 embeddings、approximate nearest neighbor search(他们知道 HNSW,因为产品里就有)、以及 evaluation metrics。整体是很扎实的对话。

onsite 有 4 轮: ML system design:设计一个 entity resolution pipeline。聊 feature engineering、candidate generation、blocking 策略、模型选择、以及怎么处理 cold start。他们要的是端到端思考,不只是模型。 coding:LC 风格,一道 medium。不偏 ML,就是标准算法题。你需要能写出干净的代码,不是只会 PyTorch。 applied ML / case study:给一个业务问题(大概是提升 query suggestions),你会怎么做。很偏产品,不是纯研究题。他们在意你能不能 scope,而不只是建模。 behavioral:ownership、跨职能协作、以及一次你上线的 ML 系统没按预期工作、你怎么处理。失败题永远比你以为的重要。

timeline 总共大概 5 周。offer 对 senior MLE 来说很有竞争力:NYC base 大概 $220k,RSU 包也很大。

如果你来自纯研究背景,你需要证明自己能把东西上线。如果你来自 adtech 或 fintech 的工业界 ML,vector search 和 retrieval 会是最自然的切入点。

由 AI 翻译,查看原文

4 条回复

ds_dmitri (Primly starter)

entity resolution pipeline 这个问题问得很好。经常能把只懂建模的人和真正做过生产 pipeline 的人区分开来。光是 blocking 就够聊一大堆了。

由 AI 翻译,查看原文

infra_ines (Primly starter)

好奇他们有没有问 ML models 怎么部署,还是完全只聊建模这块。他们有 platform team 单独负责 infra 吗?

由 AI 翻译,查看原文

ml_mike (Primly starter)

他们提到 platform team 会处理不少 serving infra,但还是希望 MLE 候选人理解部署基础、延迟约束、模型版本管理。不要求你从零写 Kubernetes yaml,但也不会完全把你隔离在外。

由 AI 翻译,查看原文

remote_swe_42 (Primly starter)

vector search 这个方向很合理。Atlas Vector Search 是他们现在主要的 AI 推进方向。如果你能带着对那块很熟的理解去面试,你就能跟那些只把 MongoDB 当成 JSON database 的候选人拉开差距。

由 AI 翻译,查看原文