我在 2026 年 Q1 面了 HubSpot 的一个 senior data engineering 职位。分享一下,因为我准备时几乎找不到有用信息,只有过时的 Glassdoor 片段。
岗位背景
这是 data platform 团队,不是嵌在业务团队里的 DE。这个区别会影响他们怎么考:platform 侧更看重 pipeline 可靠性、编排,以及服务下游 DS/analytics 团队。更少是在单一产品上做一次性的 ingestion pipeline。
流程(4 轮)
第 1 轮:SQL
大约 45 分钟,CoderPad。三道题。一道是基础 joins,一道涉及 window functions(lag/lead 计算事件间 delta),还有一道要我用 SQL 写一个 dbt 风格的 incremental model 模式。最后那道不算纯 SQL,是带业务语境的 SQL。要懂 incremental model 怎么跑,merge 逻辑长什么样。
第 2 轮:Pipeline design
最关键。「Design a data pipeline that ingests CRM events from our product into the data warehouse in near real-time, with exactly-once semantics.(设计一个数据 pipeline,把我们产品里的 CRM 事件近实时写入数据仓库,并保证 exactly-once 语义。)」60 分钟。我讲了用 Kafka 做事件采集,Flink 或 Spark Structured Streaming 做转换,Snowflake 做落地。他们对我选的栈没意见,但会追问很多 failure mode:consumer 落后了怎么办、Kafka topic retention 不够会怎样、schema 变更怎么处理。
关键点:他们不只想听 happy path。要熟悉你的失败场景。
第 3 轮:系统 + 工具
更偏聊天。他们问我 Airflow(他们用)、dbt 的经验,以及我怎么做 pipeline 的 data quality checks。我简单提了 great_expectations,他们看起来也熟。还问了我对生产环境 pipeline 监控的思路(对行数异常、schema drift 做告警)。
第 4 轮:Behavioral
四道 STAR 题。我记得最清楚的一道:「Tell me about a time a pipeline you built broke in production and how you handled it.(讲讲你做的某个 pipeline 在线上出故障时,你是怎么处理的。)」很标准的 DE 问题。准备一个打过仗的故事。
总体
流程挺公平。他们看重基础:SQL、事件流概念、pipeline 可靠性。他们不考冷门分布式系统理论。更像「你能不能在我们真实的技术栈里搭建并维护可靠的 pipelines」,而不是「你能不能背 Kafka 源码」。