Mercury · Primly 社区

Mercury machine learning engineer 面试:loop 长什么样,值不值得做

ml_mike (Primly starter) · 4 条回复

刚走完 mercury 的 ML engineering loop,最后拒了他们的 offer。写下来是因为 fintech 的 ML 岗和大厂不太一样,我想分享下我学到的东西。

先说:mercury 的 ML 组织不大,是个小而专注的团队,在 dashboard 里做会影响到反欺诈、信用风险信号、产品推荐的模型。你不会是为了 LLM 本身去做 LLM。如果你想要那个,去别的地方。

recruiter screen: 30 分钟,作为第一通电话算问得很细。她真的会问你具体的模型经验(表格数据 vs NLP vs CV),也很直接地说团队大量用 tabular models。我主要是 NLP 背景,她也点出来了。这种坦诚我挺感激,哪怕也意味着路会比较难。

technical phone screen(60 分钟): 两部分。前半是 ML 基础聊天:过拟合、正则化、你会怎么处理反欺诈数据集里的类别不平衡(剧透:这是刻意的)。后半是 python coding,不是算法谜题,更像是给你一个 dataframe,让你写 feature engineering 代码。偏 pandas/polars 那种操作。

virtual onsite(4 轮): ML system design。我拿到一个反欺诈场景,需要把全流程 pipeline 走一遍:feature engineering、模型选择、服务架构、线上监控。他们特别在意监控这块。反欺诈里的 model drift 是很真实的运维问题,他们想知道你有没有想过。coding(更多 feature engineering + 一些 sklearn)。product/stakeholder(你怎么跟非技术的人解释模型决策,要具体例子)。behavioral。

他们真正想找什么: 金融场景里的实用 ML。你如果能聊清楚类别不平衡、时间序列切分里的 data leakage、可解释性(我聊天里自然提到 shap values),以及线上监控,你就很有优势。研究背景没那么重要,更看重落地能力。

comp offer 大概是 200-220k TC。我拒了是因为团队规模对我目前职业阶段来说太小,不是流程有什么负面。

由 AI 翻译,查看原文

4 条回复

ds_dmitri (Primly starter)

时间序列的数据泄露这一点太常被忽略了。他们有直接问吗,还是在你讲 system design walkthrough 的时候带出来的?

由 AI 翻译,查看原文

ml_mike (Primly starter)

是在 system design 里我描述 train/test split 的时候提到的。我主动说了 leakage,面试官眼睛都亮了一下。我感觉这是他们在找的一个信号。如果你做的是 fraud detection ML,却不知道为什么时间上的 train/test split 很重要,那面试会很难受。

由 AI 翻译,查看原文

de_derek (Primly starter)

在这种公司里,DE 和 MLE 工作的重叠确实很真实。线上环境里的 feature engineering pipelines,本质上就是数据管道再加一些额外步骤。两边的 loop 在实际数据处理这块重叠也很合理。

由 AI 翻译,查看原文

infra_ines (Primly starter)

我对 serving architecture 这个问题有点好奇。他们是想要你完整深挖一遍 MLflow/SageMaker,还是更高层的那种「这个模型在生产环境里是怎么被调用的」?

由 AI 翻译,查看原文