刚结束(并接受了)一个 PwC data engineer offer,所以来复盘一下。这个岗位在他们的 Technology Consulting practice,具体是给金融服务客户做 data platform 的团队。分享一下,因为网上关于 DE 面试的内容很少,大部分帖子还会把它跟 DS 角色混在一起。
screening:标准电话,25 分钟。他们想了解我的 pipeline 经验(Airflow、dbt、Spark 这类)以及我对 client-facing delivery 的舒适度。在 PwC 里,「client」这个词会出现很多,先习惯。
技术面 1:SQL + data modeling(75 分钟,共享 coding 环境) 这是最难的一轮,两道题: 第一题是纯 SQL。给一张带时间戳的交易表,算每个客户 rolling 7-day revenue,并标记该指标 week over week 下滑超过 20% 的客户。window functions、CTE、日期计算。不是那种「找重复」的新手题。 第二题是 data modeling。他们给了个模糊的业务描述(保险公司跟踪 claims、adjusters、outcomes),让我设计一个维度模型。star schema、缓慢变化维度、grain 定义。他们会追问我做的每个选择。
技术面 2:pipeline 设计 + 架构(60 分钟) 几乎全是概念。他们描述了一个场景:客户有 14 个源系统,把不同格式的 flat files 丢到 SFTP server,需要每天刷新一个整合的数据仓库。让我从头讲你会怎么做。
他们希望你覆盖:ingestion 层(怎么处理坏文件、schema drift)、transformation 层(dbt vs stored procs 以及原因)、orchestration(Airflow 调度、重试逻辑、告警)、以及数据质量检查。这里不写代码,就是架构讨论。他们还问如果一个源系统突然断供你怎么处理:pipeline fail 还是加载部分数据,你会跟 client 怎么说。
behavioral:标准 STAR。最看重的是技术方案需要怎么跟非技术干系人沟通。PwC 的 DE 角色是咨询角色,你要对客户做展示。
partner call:30 分钟,更像咖啡聊天。他们在确认你是不是一个适合 client-facing 的人。
offer 的 comp(senior associate level,NYC,2026):base 低 110k 左右,确实比纯科技公司 DE comp 低,但 benefits package 和在 PE/banking 客户那边的品牌认知,是大家做的 trade-off。
tips:特别把 dbt 练熟,它在两轮里都出现了。Databricks 在他们的平台项目里用得很重。这个团队的 cloud 是 AWS。