Spotify · Primly 社区

Spotify data scientist 面试:SQL、统计、case 轮分别长什么样

de_derek (Primly starter) · 4 条回复

刚走完 spotify 的 DS 面试流程,岗位是他们 listening behavior analytics team 的 mid-level(DS II)。搜「spotify data scientist interview SQL case stats」出来的内容都很空,所以这里写一下 2026 年的真实拆解。

电话面之后是四轮: SQL 技术轮(45 分钟) 统计 + 概率(45 分钟) 产品/case 轮(45 分钟) behavioral(30 分钟)

SQL 轮 题是真的难,不是那种「join 两张表」的难,更像:对时间序列做 window function、算留存 cohort,还有一题是识别 streaming event 数据里的异常。window functions 一定要非常熟(LAG、LEAD、ROWNUMBER、DENSERANK)。他们用协作编辑器,要求我在运行前先在脑子里跑一遍 query,并解释输出会是什么。

有一道具体题:给一张用户 listening session 的表(start/end timestamp),写 query 找出有重叠 session 的用户(可能是数据 bug)。这是 self-join 加 interval 逻辑,中等偏难。

stats 轮 概率基础、A/B 测试设置,还有一题实验设计:'we want to test whether a new UI change increases daily listening. how do you design the experiment and what are the risks?'(我们想测试一个新的 UI 改动是否会提升每日收听时长。你会怎么设计实验?风险有哪些?)提到了 power calculation。他们还明确问了 novelty effect。Bayesian vs frequentist 需要概念上讲清楚,但不用太深。

case 轮 这轮最像 PM 面。一个 listening 指标掉了,让我带着他们一起排查。我用了结构化 funnel(acquisition、activation、engagement、retention),他们不断加限制:'assume the data shows it's only US users.'(假设数据显示只发生在美国用户。)然后 'only on mobile.'(而且只在移动端。)更看重诊断推理而不是纯算数。

整体门槛 比我预期的 DS II 高。感觉更像一些公司 senior DS 的标准。尤其 SQL。

由 AI 翻译,查看原文

4 条回复

analyst_ana (Primly starter)

overlapping sessions 的 SQL 题属于那种我面到一半大脑直接空白的类型。你有什么建议的练习思路吗?

由 AI 翻译,查看原文

hardware_hugo (Primly starter)

self-join:找同一用户的任意两行,其中一个 session 的开始时间早于另一个 session 的结束时间。难点是要排除 self-match(同一个 session ID)。多练几种 interval overlap 的模式,这类题在媒体/流媒体公司的 DS loops 里很常见,因为 session 真的是他们的核心事件类型。

由 AI 翻译,查看原文

ml_mike (Primly starter)

关于 novelty effect 的问题被低估了。很多 DS 候选人会跑 A/B test 框架,但没真正想过:用户可能只是因为东西是新的才表现不一样。spotify 可能很在意这个,毕竟他们经常在数亿用户上测试 UI 改动。

由 AI 翻译,查看原文

finance_faye (Primly starter)

好奇:他们有问 data pipelines 或 data quality 吗,还是纯 analytics/stats?想搞清楚在 Spotify DS/DE 的边界在哪。

由 AI 翻译,查看原文