EY · Primly 社区

EY machine learning engineer 面试:他们实际考什么,和职位描述有什么差别

ml_mike (Primly starter) · 4 条回复

几个月前面了 EY 的一个 ML engineer 岗位(Technology Consulting 里 AI practice 方向)。职位描述里是那种常见的 buzzword 清单。下面是面试实际考的内容。

背景: 团队做的是面向金融服务客户的 ML 解决方案。比如 fraud detection、credit risk modeling,还有一些文档处理相关的 NLP。不是研究型,是应用型 ML。

流程: Recruiter screen 跟 ML engineer 的 technical screen(60 分钟) Case study:提前几天发给你,面向 3 人 panel 做展示 Partner/managing director conversation

Technical screen 拆解。 面试官很靠谱。主要聊了: 解释 gradient boosting vs random forest。对于 fraud detection 的场景你什么时候选哪个。 你在处理高度类别不平衡(fraud 只有 0.3% 交易)时会怎么做。 SQL:写一个 query,从交易表里按特定条件拉 training dataset。是真实 SQL,不是玩具题。 System design:有个 batch fraud scoring job 要跑 6 小时,但业务需要 near-realtime 分数。你会怎么做。

没有 leetcode。没有算法类 coding puzzle。如果你一直在刷那套,需要调整方向。他们要的是应用 ML 的思维,不是大 N DSA 备考。

Case study 是最难的部分。给了一个虚构客户场景:零售银行想做一个 document classification system 来自动化贷款流程。我需要讲清楚问题定义、数据需求、模型选择的理由、评估方式,以及怎么把 tradeoff 讲给非技术的客户方 stakeholder 听。

最后这点在 EY 很重要。如果你没法给一个不懂 confusion matrix 的 VP 解释 precision vs recall 的取舍,在咨询环境里会很吃力。

他们不考什么: 研究级的深度内容。Transformers、自定义架构、RLHF。他们更在意的是「你能不能把一个可靠的模型上生产给客户用」,而不是「你知道论文上的 SOTA 吗」。

由 AI 翻译,查看原文

4 条回复

ds_dmitri (Primly starter)

class imbalance 这个问题很值得准备。我常用的回答结构是:oversampling/undersampling、loss 里加 class weights、推理时做 threshold calibration,然后确保不要用 accuracy 当指标。他们会对这些点 push back 吗,还是在找某一种特定方法?

由 AI 翻译,查看原文

sec_sasha (Primly starter)

我对那个近实时 fraud scoring 的问题很好奇。他们是希望你对 streaming vs micro-batch 有很强的立场,还是你把取舍讲清楚,再根据延迟要求问一些澄清问题就可以?

由 AI 翻译,查看原文

ml_mike (Primly starter)

他们希望我先问澄清问题,我也照做了。“这里的 near-realtime 是指 1 秒内还是 5 分钟内?”这真的是个关键问题,因为答案会把架构完全改掉。在我得到“每笔交易 2 秒以内”这个信息后,我就讲了用轻量 API 提供预训练模型服务 vs 用 streaming pipeline。他们看起来更重视我这个问题本身,而不是我最终落在哪个具体架构上。

由 AI 翻译,查看原文

pivot_pat (Primly starter)

我想稍微反驳一下“no leetcode”这个说法。你描述的那道 SQL 题,如果你没练过,确实很难。复杂 join、window function、subquery 和 CTE 的取舍:这本身就是一项需要练习的技能。说成“不是 leetcode”会让人产生不该有的自信。

由 AI 翻译,查看原文