Palantir · Primly 社区

Palantir data engineer 面试:Pipeline 和 SQL,我在 loop 里看到的

analyst_ana (Primly starter) · 5 条回复

2025 年末走了 Palantir data engineer 的面试流程,进了 final round,最后没接(comp 对我不合适)。因为网上几乎没有 DE 方向的细节,我把技术部分写出来。

我遇到的技术轮:

SQL 轮。 比典型的「写个 GROUP BY」更深入。他们给了我一个很像真实业务的 schema:event logs、用户行为、一些层级数据。然后让我写查询回答业务问题。有一道用到了 window functions,还要处理比较棘手的 null 语义。Schema 里有缺口(有一处没有明确 FK),他们希望你能注意到并问出来。如果你会的话,看看 query explain plans;他们会问 index usage。

Pipeline design 轮。 更像 SWE 的 system design,但范围在数据基础设施。我拿到的类似:'Design an ingestion system that pulls from 5 different source systems with different formats, normalizes them, and makes the data available for analysis within 15 minutes.' 他们在意的取舍点:idempotency、late-arriving data、schema drift。要知道 CDC(change data capture)是什么、为什么存在。要知道 micro-batch 和真正 streaming 的区别,以及各自适用场景。

Python/coding 轮。 一道 Python 数据转换题。少一些「LeetCode」味道,多一些「写个函数把这个脏 JSON 结构解析出来并输出成干净 schema」。脏是刻意的,边界情况才是重点。

Behavioral。 和别人说的类似。高压、ownership、mission alignment。

针对性准备:Spark vs. Flink 的取舍,Airflow DAG 模式,schema evolution 策略,了解 dbt 加分但不是必须。他们不用通用栈,用的是 Foundry,但他们想看你的心智模型能不能迁移。

这个 loop 真的很技术。如果你主要做 dashboard,而不是 pipeline engineering,会被看出来。screen 的时候对自己的深度要诚实。

由 AI 翻译,查看原文

5 条回复

analyst_ana (Primly starter)

在 pipeline design 轮次里问 schema drift,这个我完全没想到要准备。他们在解决方案上会追问到多具体?

由 AI 翻译,查看原文

de_derek (Primly starter)

他们希望我把具体选项讲清楚:向后兼容的 schema 变更 vs. versioning vs. schema registry。我提了 Confluent schema registry,他们看起来对这个方向挺满意的。所谓「正确」答案没那么重要,更重要的是你有一个真实的观点。

由 AI 翻译,查看原文

pivot_pat (Primly starter)

Python 那轮听起来就很符合我预期。他们会在意用 pandas 还是纯 Python 吗,还是实现方式是开放的?

由 AI 翻译,查看原文

contractor_kai (Primly starter)

comp 这事儿在 Palantir 对很多 DE 候选人来说确实是个筛子。他们给得有竞争力,但对 DE 岗来说不到 FAANG 那个档。你是手上有 competing offer,还是主要是 package 没到你的数字?

由 AI 翻译,查看原文

de_derek (Primly starter)

我当时有一个来自更小公司的竞争 offer,现金给得更多(股权更少)。Palantir 的股权上行空间是真的,但时间周期比我想要的更长。不管怎么选我都不后悔。

由 AI 翻译,查看原文