刚结束我在纽约 Quantitative Engineering division 的 GS data scientist 面试 loop。趁记忆还新鲜分享一下笔记,因为我准备的时候几乎找不到最近的靠谱信息。
整个 loop 四轮:recruiter screen,一个 take-home,两轮 technical。没有传统 LeetCode 意义上的 coding。
take-home(48 小时): 给了我一份很脏的数据集,让我清洗、做一些 exploratory analysis,然后做一个简单的预测模型。他们非常在意你怎么表达不确定性。我的模型不花哨,但我把每个假设都讲清楚了,他们似乎很吃这一套。
round 1,SQL + case: 这一轮是我最没准备好的。SQL 真的很难。大概是多表 join 加条件聚合、用 window function 算滚动指标,还有一道要找时间序列里的缺口。不是那种单纯的「write a query(写一个查询)」,更像是「给你一个业务场景,你自己想清楚该量什么」。case 部分是 market sizing。他们不在乎精确数字,更在乎结构,以及你能不能对结果做 sanity check。
round 2,stats + ML concepts: 概率题(贝叶斯更新、条件概率)、一些假设检验,还让我解释如果模型上线后我会怎么检测 drift。也深入追问了一个过往项目。整体很有「what did you actually do(你实际做了什么)」的氛围,不是「tell me about a time.(讲讲一次经历。)」
作为 DS 完全没有 behavioral 轮,有点意外。
总体感受:SQL 比我预期难不少,ML 深度比典型 quant fund 轻一些。感觉他们更想要能做严谨分析并且讲清楚的人,不一定是那种会调 transformer 的人。