Shopify · Primly 社区

Shopify data scientist 面试(SQL + case + stats):我被问到的全部内容

analyst_ana (Primly starter) · 5 条回复

参加了 Shopify 的 DS 面试 loop,岗位是 mid-senior data scientist,方向是 merchant analytics。下面按轮拆解。

SQL 轮(60 分钟,live coding): 三道 SQL。第一道比较直接:GROUP BY 聚合 + 窗口函数。第二道更复杂:一个商家 cohort 的月度留存(month-over-month retention)。第三道是开放题:给你面试时提供的 schema,写一个 query 找出可能有流失风险的商家。第三道没有唯一正确答案,他们想看你如何基于现有数据定义风险信号。

他们不是在考语法,而是在考你能不能把业务问题翻译成 query,以及你能不能边做边把推理讲清楚。

Case / product sense 轮(60 分钟): 给一个场景:Shopify 某个 segment 的 merchant GMV 环比下降 8% QoQ。讲讲你怎么诊断。这是标准 DS case,但因为是 Shopify 语境,你要考虑 merchant-level、transaction-level、platform-level 的原因。我用结构化方式拆:先看是不是单一 segment、单一地区、单一商家规模层级的问题,还是平台整体;再提出假设;再说我要拉哪些数据。

他们会追问:“如果你来不及拿到那些数据,你的 fallback 是什么?”这个追问很能说明他们在意务实落地。

Stats / experimentation 轮(45 分钟): 概念题,不是 coding。问了 A/B test 设计、样本量计算、怎么处理 novelty effects,还有一个专门关于 switchback experiments 的问题(相关,因为他们有些实验不能在用户层随机)。如果你没看过 switchback 或 cluster-level 实验设计,建议补一下。

总体:比我做过的大多数 DS loop 都难,主要是因为 SQL 是 live 的,而且 case 需要你对商家领域有真实直觉。stats 轮高于平均,但也不是博士级。对同时在投其他 commerce 或 marketplace 公司的同学来说,这种准备很通用。

由 AI 翻译,查看原文

5 条回复

de_derek (Primly starter)

switchback experiment 这个问题很能说明他们在问真实业务里的真问题。这类平台没法把用户组干净地隔离开来,所以才会用它。谢谢你点出来。

由 AI 翻译,查看原文

analyst_ana (Primly starter)

SQL 是在特定编辑器里做还是用纯 HackerRank?另外他们在意 query optimization / indexes,还是只要答案对就行?

由 AI 翻译,查看原文

hardware_hugo (Primly starter)

现场 SQL 用的是共享的 Google doc,不是 HackerRank。他们没有明确在意 indexes,但我在 retention query 里顺带提了一个 indexing 的考虑点,引出了一个简短但挺有意思的讨论。除非他们把话题打开,不然我不会深入讲这个。

由 AI 翻译,查看原文

contractor_kai (Primly starter)

hiring manager 在面试流程里有多 technical?我经历过一些 DS 面试里 HM 是没有统计背景的业务 stakeholder,校准完全乱套。

由 AI 翻译,查看原文

consultant_cam (Primly starter)

我的 HM 数据背景很强,之前做过 DS,后来转管理。整轮面试的校准感觉非常一致。不过我觉得这在所有 Shopify 的 DS 团队里不一定都一样。

由 AI 翻译,查看原文