Perplexity · Primly 社区

Perplexity data engineer 面试:Pipeline 和 SQL 基本就是全部

ds_dmitri (Primly starter) · 6 条回复

刚在几周前结束了我的 Perplexity data engineer 流程。分享一下我知道的,因为我准备时外面信息不多。

recruiter screen 很快,大概 25 分钟。她确认他们用 Spark、Airflow、Snowflake,并说会重点考 SQL,再加一点数据 pipeline 的 system design。确实如此。

technical phone screen(45 分钟) 前一个小时是一位面试官,SQL 占比非常重。window functions、CTE,还有一个多步骤聚合,需要你在时间序列上算 rolling stats。不是玩具查询,那种你会真的在想要扫多少次表。他们看起来先看正确性,再看效率。

onsite(线上,4 轮) pipeline design:设计一个用于高吞吐 search query logs 的 ingestion pipeline。考虑 latency、去重、schema evolution。我画了 streaming vs batch 的取舍。没有唯一正确答案,他们会 push back 看你怎么推理。 SQL deep dive:再来两道更复杂的 query,其中一道是从原始事件表做 sessionization。经典题。 coding:一道 Python,不是 leetcode 风格,更像「解析这个 log 格式并计算 X」。偏实用。 cross-functional:和 ML platform team 的人聊 data eng 怎么交付给 ML。他们想知道我有没有做过交叉领域的工作。

关键点: 他们一直在问 scale。未必是 FAANG 那种规模,但更在意当你的 pipeline 假设被打破会怎样。他们是在让我写一个完美解,还是让我告诉他们哪里会坏?是后者。

没有 take-home。总耗时:从第一次电话到 verbal offer 3 周。

我的背景:7 YOE,主要做 fintech 的 data platform。level 定在 senior DE。

欢迎提问。

由 AI 翻译,查看原文

6 条回复

ae_andre (Primly starter)

很有用,谢谢。他们在 Airflow 上问得有多具体?比如 DAG 设计模式,还是就一般熟悉就行?

由 AI 翻译,查看原文

de_derek (Primly starter)

更偏概念,不算很深。我聊了动态生成 DAG 和幂等任务,他们看起来就满意了。他们没有考 Airflow 内部实现细节。

由 AI 翻译,查看原文

backend_bekah (Primly starter)

sessionization 的 SQL 题现在到处都是。我今年面过的每家数据团队都有某种变体。

由 AI 翻译,查看原文

visa_vik (Primly starter)

他们会很早就问 H1B sponsorship 吗?我想判断一下,对一个需要 sponsorship 的人来说值不值得投。

由 AI 翻译,查看原文

de_derek (Primly starter)

我是公民,所以我自己没法现身说法。我的 recruiter 也没提过。不管怎样,可能值得在第一次电话里直接问,别花了 4+ 轮才发现。

由 AI 翻译,查看原文

analyst_ana (Primly starter)

这是我见过最详细的 Perplexity DE 拆解。下个月我 loop 前先收藏了。

由 AI 翻译,查看原文