参加了 NVIDIA data scientist 面试 loop,岗位在 cloud analytics 团队(支持 DGX Cloud adoption metrics)。我会拆一下 SQL、case、stats 这几块,因为这是我当时最想搜但找不到的内容。
我的流程结构: Recruiter screen(30 分钟) DS manager 技术电话面(45 分钟:SQL + 一个统计概念) Virtual onsite:总共 5 轮
电话面 SQL:一道中等 SQL。窗口函数。类似“找出每个 region 每个月 revenue 第二高的客户”。窗口函数和 CTE 是基本功,要非常熟。DS manager 还让我从性能角度解释 correlated subquery 和 join 的区别。这种问题很快就能筛人。
Onsite 拆解:
SQL 轮(60 分钟):两道 SQL。第一道中等(rolling averages,标准窗口函数)。第二道更难:递归 CTE,处理层级数据。我练过递归 CTE,但不够多。做出来了,但不算干净。递归 CTE 要会。
Stats / ML 轮(60 分钟):先从概率基础开始(经典条件概率题),然后转到实验设计。“我们想跑一个 A/B test,看新的 onboarding flow 是否提升 DGX Cloud trial activation。你测什么,怎么定样本量,power 和显著性阈值怎么设。”我大部分时间都花在这题。他们要我把 sample size 计算过程口述出来。把 power analysis 的数学补起来,不要只懂概念。
Case / product sense 轮(60 分钟):这是最像 PM 面试的一轮。“DGX Cloud 的用户 activation 过去一个月下降了 15%。你怎么诊断?”标准产品分析框架,但他们希望你每一步都给出量化细节:看哪些指标,写哪些查询,预期 baseline 是什么。
Behavioral + HM(45 分钟):常规故事,重点是数据驱动的影响。至少准备一个故事:你的分析改变了某个产品决策,并且你能给出前后对比的数字。
总体来说,NVIDIA 的 DS 难度:比中端市场科技公司更难,和严格的 Google 或 Meta DS loop 差不多。他们是真的在看统计深度,不只是 SQL 熟练度。递归 CTE 不一定每次都有,但还是建议会。