Datadog · Primly 社区

Datadog data engineer 面试:pipelines、SQL,还有一个我没想到的曲线球

de_derek (Primly starter) · 4 条回复

两周前刚结束 Datadog data engineer 的 loop(NYC 岗,hybrid)。趁还新鲜分享下笔记,因为我准备时几乎找不到 DE track 的具体信息。

总共 5 轮:

Recruiter screen:30 分钟,很标准。他们问了我的 pipeline 经验,尤其是 Kafka 和 Spark。没有刁钻题,就是确认我不是简历幽灵。

Technical phone screen:45 分钟,面的是一个 senior DE。大概一半 SQL,一半偏 system design 的 pipeline 架构讨论。SQL 不是入门级。他们给了一个多表场景,数据是 event data(很符合 Datadog 实际做的东西),让我写查询算 rolling averages,并在指标流里检测异常。Window functions、lag/lead,全都有。CTE 也要熟。

Take-home:他们发了个小数据集,让我做一个简单 ETL pipeline,写清 schema 选择,并用 SQL 回答 3 个分析问题。我在本地用 Python + duckdb,然后在 notebook 里写了文档。花了大概 3 小时,但我把 write-up 写得很细。我觉得这点很关键。

On-site(线上)第 1 轮:更多 SQL + 深挖我的 take-home。他们问我为什么选这个 partitioning strategy、在 100 倍规模下我会怎么改、以及某个 transform 我是否考虑过 streaming vs batch。这些最好提前准备好。

On-site 第 2 轮:Behavioral。重点是跨团队合作,以及我怎么处理线上 pipeline 故障。标准 STAR。没有特别 Datadog 的题,但要准备好:「"tell me about a time a data quality issue made it into a downstream dashboard and what you did.(讲一次数据质量问题进入了下游 dashboard,你做了什么来处理。)"」

曲线球:有个面试官让我讲如果要让 pipeline 输出自定义 metrics 到监控系统,我会怎么做。基本是在问我是不是真的懂 observability 工具链。更像是 Datadog 的文化题,也是一道技术题。值得提前想一下。

总时间线:内推投的,5 天 recruiter 联系,3 周走完 full loop。到今天还在等结果。

由 AI 翻译,查看原文

4 条回复

analyst_ana (Primly starter)

这个太有帮助了。他们有指定 SQL 方言吗,还是平台无关?我每次写带 Postgres 味儿的东西就会紧张,怕他们其实跑的是 BigQuery。

由 AI 翻译,查看原文

de_derek (Primly starter)

他们说「任何方言都行,只要解释你的选择」。我用的是标准 SQL,加了几个 Postgres 的小特性,用到时也明确说了。看起来没造成问题。

由 AI 翻译,查看原文

ds_dmitri (Primly starter)

rolling average + anomaly detection 的 SQL 题是可观测性公司 DE loop 里很经典的 signal 题。他们在看你到底会不会用时间序列思维,还是只会写 SELECT。很好的准备建议:练 window functions 要用事件日志那种数据形状,不要只练交易型数据。

由 AI 翻译,查看原文

infra_ines (Primly starter)

在 Datadog 里,关于可观测性埋点的 curveball 完全说得通。他们想要的是把 pipeline 当成线上服务来做的 DE,而不是那种写个 batch 脚本跑起来就祈祷没问题的。如果你在准备,最好先想好:你会怎么给你做过的一个 pipeline 加 metrics、traces、logs。

由 AI 翻译,查看原文