两周前刚结束 Datadog data engineer 的 loop(NYC 岗,hybrid)。趁还新鲜分享下笔记,因为我准备时几乎找不到 DE track 的具体信息。
总共 5 轮:
Recruiter screen:30 分钟,很标准。他们问了我的 pipeline 经验,尤其是 Kafka 和 Spark。没有刁钻题,就是确认我不是简历幽灵。
Technical phone screen:45 分钟,面的是一个 senior DE。大概一半 SQL,一半偏 system design 的 pipeline 架构讨论。SQL 不是入门级。他们给了一个多表场景,数据是 event data(很符合 Datadog 实际做的东西),让我写查询算 rolling averages,并在指标流里检测异常。Window functions、lag/lead,全都有。CTE 也要熟。
Take-home:他们发了个小数据集,让我做一个简单 ETL pipeline,写清 schema 选择,并用 SQL 回答 3 个分析问题。我在本地用 Python + duckdb,然后在 notebook 里写了文档。花了大概 3 小时,但我把 write-up 写得很细。我觉得这点很关键。
On-site(线上)第 1 轮:更多 SQL + 深挖我的 take-home。他们问我为什么选这个 partitioning strategy、在 100 倍规模下我会怎么改、以及某个 transform 我是否考虑过 streaming vs batch。这些最好提前准备好。
On-site 第 2 轮:Behavioral。重点是跨团队合作,以及我怎么处理线上 pipeline 故障。标准 STAR。没有特别 Datadog 的题,但要准备好:「"tell me about a time a data quality issue made it into a downstream dashboard and what you did.(讲一次数据质量问题进入了下游 dashboard,你做了什么来处理。)"」
曲线球:有个面试官让我讲如果要让 pipeline 输出自定义 metrics 到监控系统,我会怎么做。基本是在问我是不是真的懂 observability 工具链。更像是 Datadog 的文化题,也是一道技术题。值得提前想一下。
总时间线:内推投的,5 天 recruiter 联系,3 周走完 full loop。到今天还在等结果。