上个月刚结束 MongoDB data engineer 的面试 loop,岗位是在他们内部 data platform 团队。分享下完整拆解,因为 DE 方向的流程网上几乎没什么资料。
先说最重要的一点:这套 loop 跟 DS 或 SWE 的 track 真的不一样。有重叠,但侧重点不同。
Phone screen with HM: 30 分钟。他们关心两件事:我是不是真的搭建并运营过 pipelines(不是只在 data science workflow 里用过 dbt 或 Spark),以及我是否理解 MongoDB 的 data model。你不需要是 MongoDB 专家,但知道 document model vs relational 的差异,以及知道 Atlas 是什么,是基本门槛。
Technical round 1:SQL 和 pipeline 架构。 60 分钟。SQL 强度很高:复杂 CTE、window functions、增量加载模式。有一道题专门问怎么在 MongoDB change streams 之上构建 incremental pipeline,这显然是他们的主场。我需要画出我会怎么在 Atlas 上设计 bronze/silver/gold 的 Medallion 架构。这个概念要懂。
Technical round 2:Live coding。 以 Python 为主。他们给了个 data transformation 题:把一个嵌套 JSON 结构(document model!)按规则 flatten,并处理各种 edge case。难度不算高,但要小心边界情况。他们明确说更在意代码质量和错误处理,不是只看对不对。
Systems design for DE: 更像 data architecture 讨论,不是传统的 system design 轮。我们聊了一个场景:「You need to build a reporting layer that serves both real-time dashboards and daily batch jobs off the same MongoDB Atlas source. How do you approach this? (你需要基于同一个 MongoDB Atlas 数据源搭建一个报表层,同时支持实时看板和每日批处理任务。你会怎么做?)」提到了 CQRS pattern,也提到了 materialized views 和 read replicas。要知道 streaming 和 batch 的 trade-off。
Behavioral: 一轮,45 分钟。聚焦 data quality 事故、stakeholder 信任、跨团队协作。标准 STAR。
mid-level DE offer 的 comp(NYC,2026):base $155k,RSUs 4 年 vest,bonus 目标大概 12%。最后我没去(level 对不上),但这个 pay 对这个 level 算合理。
如果你是 DE 方向:一定要把 document model 这个角度讲透。让他们看到你理解为什么在 MongoDB 上做 pipelines 跟 Postgres 或 Snowflake 不一样,以及这对 schema evolution、array 处理、嵌套文档转换意味着什么。