Pinterest · Primly 社区

Pinterest data engineer 面试,pipeline 和 SQL:我遇到的情况

analyst_ana (Primly starter) · 4 条回复

分享下我今年早些时候的 Pinterest DE 面试经历。Mid-senior level。线上,4 轮。

第 1 轮:SQL。Live coding。我遇到的是一个多表 join 场景,涉及 events 表和 users 表,计算 retention 指标。他们让我写 7 天和 30 天 retention 的 query。挺常规,但后面要讨论效率。还问我在 Pinterest 这种规模(几十亿行 event)会怎么处理。我讲了按日期分区,以及用预聚合的中间表。

第 2 轮:数据建模 / 系统设计。这轮挺出乎意料。一半是系统设计,一半是数据建模。题目大概是:为 Pinterest 的 Pin engagement events 设计一条从接入到分析表的 data pipeline。他们希望你聊 schema 设计、分区策略、streaming vs. batch 的取舍(Pinterest 大规模用 Kafka),以及处理 late-arriving data。Kafka 基础要懂。还要知道 exactly-once semantics 是什么,以及什么时候重要。

第 3 轮:Coding(Python/Spark)。不太考 Spark 内部原理,但确实让我写了一个 PySpark transformation。题目是清洗和转换一个有 schema evolution 问题的数据集。要知道怎么处理 nullable columns 和 schema 不一致。

第 4 轮:Behavioral。和其他流程很像。Drive for results 的故事、跨职能影响力、处理线上事故。

他们给我的薪酬口径:SF 的 DE II 是 $200-240k TC。谈判空间可能比他们一开始表现出来的更大。

总体 DE 的 bar 确实在,但不算离谱。他们最在意的是你以前是否认真思考过 scale 的问题,而不只是把数据从 A 搬到 B。

由 AI 翻译,查看原文

4 条回复

finance_faye (Primly starter)

那个 $200-240k 区间:是 base + equity,还是 total?他们有一开始就把 equity 的 vesting schedule 细分讲清楚吗?

由 AI 翻译,查看原文

de_derek (Primly starter)

总包,4 年 vest,1 年 cliff。他们对 RSU 数量和 refresh 政策讲得挺直接的。上市公司标准的 4 年节奏,一般第 2 年后会给 refresh grant。直接问就行,他们会把明细表给你。

由 AI 翻译,查看原文

infra_ines (Primly starter)

Kafka 的「exactly-once」出现在 DE 面试里对我来说太搞笑了。一半每天用 Kafka 的工程师,在压力下都不一定讲得清 exactly-once semantics。但我也理解他们为什么问。你要是以为有、结果其实没有,那真的很容易踩大坑。

由 AI 翻译,查看原文

contractor_kai (Primly starter)

Spark 里 schema evolution 的处理,确实是那种能区分做过生产数据系统的人和只做过教程的人。很好的信号题。

由 AI 翻译,查看原文