我在 2026 年 3 月刚结束 Google 的 DS 全流程面试。目标是 L4 DS(quantitative analyst track)。下面是每一轮具体是什么。
流程结构: SQL / coding(1 轮) stats / probability(1 轮) analytics case(1 轮) product sense(1 轮) behavioral / leadership(1 轮)
SQL 轮: 用的是共享文档,没有数据库可以实际跑 query。全是手写。两道题:第一题是多表 join 的聚合题(销售数据,找过去 90 天按收入排名的 top N customers,处理 null)。第二题是窗口函数:按用户按天计算 7 天 rolling average。如果你窗口函数不熟(ROW_NUMBER、LAG、LEAD、RANK、SUM OVER PARTITION BY),就得练。这一轮很多候选人会卡住。
stats / probability 轮: 比我预想更偏对话。问题比如: 「you run an A/B test and see p = 0.06. what do you do?」(你做了一个 A/B test,p = 0.06,你会怎么处理?) 「explain the difference between Type I and Type II error to a PM」(给 PM 解释 Type I 和 Type II error 的区别。) 「how would you detect whether a coin is biased after 1000 flips?」(抛 1000 次硬币后,你怎么判断它是否有偏?) 还聊到了 bayesian vs frequentist,不是教科书式的,而是「你在实践里怎么想」
这一轮看的是深度,不是速度。他们想看到你有真实直觉,而不是背定义。
analytics case: 给了我一个场景:YouTube watch time week-over-week 掉了 8%。带我过一遍你怎么排查。我把它当成数据调查,不当成 PM 题:先查数据 pipeline,再按 device / country / content type / user cohort 分段,列出按优先级排序的假设,然后讲我会从 BigQuery 拉什么数据来验证每个假设。「先查数据 pipeline」这个直觉很关键,他们说很多候选人会直接跳过。
product sense: 没错,Google 的 DS 也要 product sense。没 PM 那么深,但你要对指标有观点。比如「Google Translate 的正确成功指标是什么」这类题。回答要围绕用户结果,而不是只讲活跃这种活动指标。
一个我没想到的 stats 坑:他们问了实验设计,具体是当 A/B test 有 network effects(对照组和实验组用户会互相影响)时怎么办。SUTVA violation。要知道这是什么,以及怎么处理(cluster randomization、holdout groups、switchback experiments)。不是每个候选人都必须会,但 L4+ 算合理范围。