Netflix · Primly 社区

Netflix data scientist 面试(SQL + case + stats),全流程笔记

analyst_ana (Primly starter) · 5 条回复

刚结束 Netflix 的 DS loop,几周前面的,是 content analytics team 的 senior data scientist role。细节分享一下,因为几乎没有文档。

全流程(phone screen 之后一共 4 轮):

round 1 - SQL + metrics。 60 分钟。SQL 真的难,不是那种「join 两张表再 group by」的。我的题是多步骤 query,包含 window functions、self-join,还有每一层都要过滤的 aggregation。后半段是指标定义:你会怎么衡量一个新的 UI feature 是否提升 engagement,north star 是什么,这个指标可能哪里出问题。他们在「可能哪里出问题」这一块追问很多。

round 2 - experiment design / A/B testing。 这轮我预期有,但没想到这么深。他们给了一个场景:Netflix 在一小部分用户里测试一个新的内容推荐入口,设计实验。基本实验结构可能 10 分钟讲完,剩下全是:怎么处理 novelty effects、社交内容场景下的 network effects、如果主指标上升但 engagement duration 下降怎么办。都是很 netflix-specific 的问题,因为他们的推荐确实会影响全局观看行为。

round 3 - statistics + ML concepts。 不写代码,但概念深度很强。他们问我:多重检验下如何解读 p-values、在真实推荐模型里怎么理解 bias-variance tradeoff、以及我会如何从零做一个 churn prediction model(什么 features、用什么 evaluation metric、为什么)。最后那个他们问得特别深,单这一题就聊了大概 20 分钟。

round 4 - culture contribution。 跟 SWE loop 格式一样。两条 Netflix 的 values,真实故事,多层追问。

我会怎么准备:把 window functions 和实验设计里的边界情况练到很熟。这两块我感觉门槛最高。stats 更偏概念而不是计算。culture 那轮是认真的,不要跳过。

由 AI 翻译,查看原文

5 条回复

analyst_ana (Primly starter)

带 window functions 的 SQL 轮跟我听说的一致。他们会在意 query optimization / execution plans,还是只看你答案对不对?

由 AI 翻译,查看原文

ds_dmitri (Primly starter)

在 senior 这个 level,他们让我想的是一个 query 的性能,具体是:在 Presto(Netflix 用的)里,subquery vs CTE vs window function 哪个更高效。我不需要知道精确的 execution plan,但大概的取舍要懂。

由 AI 翻译,查看原文

growth_gabe (Primly starter)

在 Netflix 这种规模下,A/B testing 里的 novelty effect 和 network effect 带来的复杂性太真实了。我在公司面 DS 候选人,这些就算对 A/B testing 经验很丰富的人来说也很难。

由 AI 翻译,查看原文

ml_mike (Primly starter)

他们有问 causal inference 吗,还是主要是 frequentist 的 experiment design?我看过 Netflix 的一些 causal methods 研究论文,想知道这些有没有渗透到面试里。

由 AI 翻译,查看原文

ds_dmitri (Primly starter)

我自己的 loop 里没有直接问,但我在讨论一个 quasi-experiment 场景时提了 DiD (difference-in-differences),他们有接着聊。我觉得在 staff level 可能会问得更明确一些。

由 AI 翻译,查看原文