PayPal · Primly 社区

PayPal data engineer 面试:Pipeline 和 SQL,他们真正看重什么

de_derek (Primly starter) · 4 条回复

上个月刚结束 PayPal 的 DE 面试流程,senior 级别,San Jose。从 recruiter 电话到 offer 大概 4 周。分享一下,因为我也找不到多少近期信息。

全流程 5 轮:一轮 phone screen(SQL + 轻量 system design),然后四轮 onsite。

SQL: 比我预期更重。他们要 window functions、CTE,还有一道题专门围绕 payment event stream 的去重逻辑。不是 LeetCode 那种 join 题,更像:给你一张很乱的 transactions 表,找出 30 分钟窗口内重复扣款的客户。直接白板冷写。建议练真正在用的分析型 SQL,不要只会 SELECT * FROM。

Pipeline design: 有两轮完全是 pipeline/架构。一轮是高吞吐 payment events 的摄取(类似 Kafka、schema evolution、exactly-once 语义)。另一轮是做一个有延迟约束的 fraud signal pipeline。我不确定他们是否期待你了解 PayPal 内部栈,但你得能讲清 batch vs streaming 的取舍、pipeline 的幂等、以及监控思路。

提到的工具: Spark、Flink(更多是概念层面)、Airflow 做编排、Hive。实际问题是「你会用什么,为什么」,不是「证明你精通某个工具」。

数据建模: 有一轮是给一个假想的 merchant analytics 产品做建模。维度建模(fact/dim 表)、缓慢变化维度这些常规内容。Kimball 基础要熟。

Behavioral: 两轮里混了 behavioral。标准 STAR。他们问了你什么时候在数据质量问题上在上 dashboard 之前就抓到了,你怎么做的;还有你负责的 pipeline 在高流量事件期间挂了,你怎么处理。偏 fintech 语境,但不算奇怪。

Offer 大概是 $210k TC,L5 对标,San Jose。股票部分相对大厂偏轻,但 base 不错。

欢迎追问。SQL 那轮真不是闹着玩的,分析侧没准备好别直接上。

由 AI 翻译,查看原文

4 条回复

analyst_ana (Primly starter)

deduplication 这个题真的是典型 fintech 问题。他们期待一个特定解法,还是更看你怎么把思路讲清楚?我每次听到他们说要你“冷写在白板上” sql 就会紧张。

由 AI 翻译,查看原文

de_derek (Primly starter)

他们要的是能跑的 SQL,不是伪代码。我在一个语法细节上绊了一下,他们让我写完也没打断,所以他们不追求完美,但逻辑必须对。我感觉 70% 的分在思路,30% 在语法写干净。

由 AI 翻译,查看原文

content_cole (Primly starter)

pipeline design 里那个「exactly-once semantics」问题总能绊倒人。这种题面试官一般也知道没有完美答案,他们只是想看你是否理解取舍(at-least-once + 幂等 consumer,vs. transactions 等)。他们有往深了追吗,还是就停在高层?

由 AI 翻译,查看原文

sre_sol (Primly starter)

我大概 8 个月前做过一次 PayPal SRE loop,pipeline design 那轮对我来说也会延伸到 reliability 的范畴。他们真的很在意整个系统里「当 X 挂了会怎样」,不只是 happy path。

由 AI 翻译,查看原文