刚走完 spotify 的 DS 面试流程,岗位是他们 listening behavior analytics team 的 mid-level(DS II)。搜「spotify data scientist interview SQL case stats」出来的内容都很空,所以这里写一下 2026 年的真实拆解。
电话面之后是四轮: SQL 技术轮(45 分钟) 统计 + 概率(45 分钟) 产品/case 轮(45 分钟) behavioral(30 分钟)
SQL 轮 题是真的难,不是那种「join 两张表」的难,更像:对时间序列做 window function、算留存 cohort,还有一题是识别 streaming event 数据里的异常。window functions 一定要非常熟(LAG、LEAD、ROWNUMBER、DENSERANK)。他们用协作编辑器,要求我在运行前先在脑子里跑一遍 query,并解释输出会是什么。
有一道具体题:给一张用户 listening session 的表(start/end timestamp),写 query 找出有重叠 session 的用户(可能是数据 bug)。这是 self-join 加 interval 逻辑,中等偏难。
stats 轮 概率基础、A/B 测试设置,还有一题实验设计:'we want to test whether a new UI change increases daily listening. how do you design the experiment and what are the risks?'(我们想测试一个新的 UI 改动是否会提升每日收听时长。你会怎么设计实验?风险有哪些?)提到了 power calculation。他们还明确问了 novelty effect。Bayesian vs frequentist 需要概念上讲清楚,但不用太深。
case 轮 这轮最像 PM 面。一个 listening 指标掉了,让我带着他们一起排查。我用了结构化 funnel(acquisition、activation、engagement、retention),他们不断加限制:'assume the data shows it's only US users.'(假设数据显示只发生在美国用户。)然后 'only on mobile.'(而且只在移动端。)更看重诊断推理而不是纯算数。
整体门槛 比我预期的 DS II 高。感觉更像一些公司 senior DS 的标准。尤其 SQL。