Lyft · Primly 社区

Lyft data scientist 面试(SQL + case + stats),完整拆解

ds_dmitri (Primly starter) · 6 条回复

我在 2 月面了 Lyft 的 DS 流程,职位是 mid-level(他们相当于 L4)。我会拆得细一点,因为 DS 流程和 SWE 不一样,我准备时也找不到一篇清晰的总结。

DS 的流程结构: SQL 轮(45 分钟) Product/case 轮(45 分钟) Stats/probability 轮(45 分钟) Behavioral(45 分钟) HM intro(30 分钟)

这个岗位没有(Python/ML)coding。Lyft 其他更偏 ML 的 DS 岗会有 modeling 轮。

SQL 轮: 真的很难。不是「写个 SELECT 加个 JOIN」那种难。我遇到的是:多步骤窗口函数 + self-join,计算某个 driver 维度的滚动窗口指标。大概是:对每个 driver 算 7 天滚动完成率,然后找出哪些 driver 在某个事件后掉到阈值以下。

他们会先给 schema,让你 5 分钟读。数据模型包含 rides、drivers、timestamps、statuses。很 Lyft 领域,但能理解。用的是共享 SQL 编辑器。

Tip:动手写之前先把思路说出来。他们评估的是你怎么拆解问题,不只是 query 能不能跑。我用 CTE 一步步拆开,效果很好。

Product/case 轮: 给一个和 Lyft 指标相关的场景。我的是:'driver utilization 在三个市场月环比下降了 8%。你会怎么排查。' 经典诊断框架:是否真实还是数据假象,是供给还是需求,是特定 cohort 还是全市场,leading indicator 是什么。

他们会追问你的假设。我说「我会先查数据 pipeline 有没有变」,他们就问我具体怎么查、看哪些信号。每一步都要准备被追问到下一层。

Stats 轮: A/B testing 设计 + 一点概率。我遇到的问题包括:如何设计一个实验来测试 driver 激励结构的变化(难点在于 driver 不是 IID,行为相关),一个 Bayesian updating 题,还有一题是怎么判断指标变化是 composition shift 造成的还是实际变化。

如果你做过双边市场的 A/B testing,会很顺。如果你只会最基础的 two-sample t-test,你可能会在 interference 和 spillover 上吃亏。

整体来说,Lyft 的 DS 面试很硬。这个级别下 stats 深度比多数公司更深。准备好窗口函数、产品诊断框架、双边市场的实验设计。

由 AI 翻译,查看原文

6 条回复

analyst_ana (Primly starter)

这也太有帮助了。我在准备一个 Lyft 的 data analyst 岗位(不是 DS),你知道 analyst 的面试流程会类似还是统计会更轻一些吗?

由 AI 翻译,查看原文

ds_dmitri (Primly starter)

我听说 analyst 的面试在 SQL 上差不多(还是很难),但统计会轻一些。更强调产品直觉,可能还有一个 SQL take-home。不管怎样,window functions 还是要认真准备。

由 AI 翻译,查看原文

analyst_ana (Primly starter)

行,那就准备 window functions。谢谢你说得这么具体

由 AI 翻译,查看原文

ml_mike (Primly starter)

DS 面试里「marketplace interference」这个点被低估了。太多候选人能把一个基础 A/B test 做得很好,但你一说「这些用户彼此会互相影响」,就直接崩了。Lyft 是双边 marketplace,这个问题经常会出现。

由 AI 翻译,查看原文

de_derek (Primly starter)

你说的那个 rolling window + self-join 的 SQL 题确实很难。我会把它算作更偏 senior analyst 或 junior DS level 的题。挺好,至少在测真本事。

由 AI 翻译,查看原文

Primly Team

在 Lyft 的 DS 流程里,很多人低估的一环是 case 和统计部分里你怎么表达不确定性。根据一些调研笔记,有些团队会偏向动态定价和双边市场的动态,而面试通常更奖励能把这三件事拆开讲清楚的人:(1) 你能测到什么,(2) 你能做因果推断的是什么,(3) 你下一步会怎么验证。

一个比较容易被认可的结构: 先给出清晰的指标树(rider、driver、市场健康)。 提 2 到 3 个竞争性假设,然后说哪些数据能区分它们。 如果涉及干预,给出识别方案(DiD、IV、synthetic control),并明确指出可能的混杂因素和溢出效应。

常见翻车点:在市场型场景里,不先检查干扰(interference),就直接跳到 A/B test。

做过 Lyft DS 面试的同学:你遇到的最大 pushback 在哪里:选对指标、因果识别,还是在时间压力下讲清假设?

由 AI 翻译,查看原文