PayPal · Primly 社区

PayPal data scientist 面试(SQL + case + stats):流程长什么样

ds_dmitri (Primly starter) · 5 条回复

2026 年初走了 PayPal 的 DS 面试,岗位是在他们风控/反欺诈分析团队的 mid-senior data scientist。这套流程的信息更难找,所以我写一下。

总轮数:4 轮,从 OA 到 offer 大概 3.5 周。

OA(take-home,2 小时):SQL 为主。大概 5-6 道 SQL 题,难度不一。考点:window functions、self-joins、CASE statements、聚合、处理 NULL。还有一道偏数据清洗。平台是 HackerRank。如果你做过 SQL 面试准备,平均大概中等难度,有一两题更难。

第 1 轮:SQL 深挖(45 分钟)。这轮让我挺意外。他们给了一个支付交易表的 schema,让我现场写 query。一道很直观(monthly active users),一道很刁钻(找出在同一个 session 内,用户先成功付款,然后又发生一次失败的用户)。window functions 要非常熟:LAG、LEAD、RANK、PARTITION BY。他们很在意你能不能写出性能好的 query,不只是对。

第 2 轮:分析 case study(60 分钟)。不写 SQL。一个业务问题:"PayPal is seeing a drop in repeat payment rates among a specific merchant segment. how would you approach this?(PayPal 看到某个商户细分的复购支付率在下降。你会怎么分析和推进?)"(PayPal 看到某个商户细分的复购支付率下降。你会怎么做?)纯看分析思维:怎么结构化问题、定义指标、思考可能原因、你会看哪些数据。有点像 PM 的分析轮,但更强调统计和分群。

第 3 轮:统计 + ML(45 分钟)。A/B testing 是核心。比如:你怎么设计实验来测试新的 fraud alert 功能?怎么处理 novelty effects?什么是 statistical power,为什么 sample size 很重要?还问了一个模型评估:一个反欺诈模型 precision 很高但 recall 很低,你怎么权衡?要有真实观点,不要只背书。

第 4 轮:behavioral(30 分钟)。比 SWE 的 behavioral 轻。两道 STAR,重点在和利益相关方合作、以及把数据结论讲给非技术受众。

comp:mid-senior DS,San Jose,offer 是 $155k base + 一些 equity。比我希望的低一点,不过风控/反欺诈分析岗有时候 equity 还能谈。

由 AI 翻译,查看原文

5 条回复

analyst_ana (Primly starter)

live 轮问 window functions 在 fintech 的 DS 面试里很常见。用 LAG 看每个用户的上一笔交易,正是做 fraud 和 churn analysis 需要的模式。挺好,知道 PayPal 会重点考这个。

由 AI 翻译,查看原文

ml_mike (Primly starter)

欺诈模型里 precision/recall 取舍这个问题确实挺有意思。在欺诈场景里你几乎总是更想要更高的 recall(把欺诈抓出来,即使会有 false positives),但 false positives 的成本也很真实:误拒正常交易、客户来电、商户流失。他们是想让你量化业务成本,还是只要解释概念?

由 AI 翻译,查看原文

brand_ben (Primly starter)

他们要我把它和业务影响挂钩。要量化:如果我们把 recall 提高 X%,能多拦截多少欺诈交易,价值是多少?反过来:会多误拒多少正常交易,这在 churn 或客服工单上会带来多少成本?他们挺认可我在回答前先问了「false positive 到底会给业务带来什么成本」。

由 AI 翻译,查看原文

de_derek (Primly starter)

PayPal 的 DS 角色需要写 Python 代码吗,还是主要是 SQL?我更多做 data engineering 的工作,但好奇重叠度有多大。

由 AI 翻译,查看原文

ae_andre (Primly starter)

我经历的现场面试里没有 Python 现场写代码。他们在职位描述里提了 Python/pandas,但面试题全是 SQL 或概念类。不过不同 team 可能不一样,risk/fraud 天生就很偏 SQL-heavy。

由 AI 翻译,查看原文