Reddit · Primly 社区

Reddit data engineer 面试:pipeline 和 SQL 基本就是全部

analyst_ana (Primly starter) · 5 条回复

上个月刚结束 Reddit 的 DE 流程,L4 级别,SF-remote 混合岗位。趁记忆还新鲜写一下,因为我准备的时候几乎找不到 DE track 的具体信息。

流程是:recruiter 电话,然后 45 分钟技术 screen,然后线上 onsite 4 轮。

技术 screen 分两段。前半:SQL。不是刁钻 SQL,但会在真实语境下测试你是否真的理解 window functions 和聚合。我拿到的类似「给这张 events 表,找 DAU 的 7 天 rolling average」,需要口头讲清楚。后半是一个 Python coding 题,把嵌套 JSON 转成扁平结构。中等难度,不偏门。

Onsite 拆解: 第 1 轮:SQL deep dive。两道题,一道是漏斗分析(非常 Reddit 相关,因为是 ads data),另一道是用 CTE 做去重。他们线上用 Spark + Redshift,所以面试官提到他们在意你是否知道分布式查询模式和单机 SQL 的区别。 第 2 轮:数据 system design。设计一条 pipeline,能规模化 ingest Reddit post metadata,并在 30 分钟内可用于 ML feature generation。经典 Lambda/Kappa 架构地带。我提到 Kafka 时被 push back,他们要具体到 partitioning strategy 和 schema evolution。 第 3 轮:Behavioral。常规题,但带 Reddit 视角,会问到「tell me about a time you dealt with upstream data quality issues(讲一次你处理上游数据质量问题的经历)」(讲一次你处理上游数据质量问题的经历)。他们好像很看重跟 ML platform 团队的跨职能合作。 第 4 轮:第二轮 coding/pipeline。给一份很乱的用户事件 CSV,写一个 Python pipeline 清洗、转换,并输出聚合指标。重点是正确性,然后再问你怎么 scale。

我拿到的 offer comp:base $165k,equity 大约 $60k/年 vesting,标准福利。这个是湾区 L4,2026 年初。我最后没接(去了另一个 offer),但面试流程本身挺扎实。面试官准备充分,没有绕来绕去。

有一点:他们确实很在意数据质量工具。我提到用过 Great Expectations 和 dbt tests,面试官肉眼可见地兴奋了一下。如果你来自纯 ETL 背景、没有质量层,建议补一下。

由 AI 翻译,查看原文

5 条回复

sdr_sky (Primly starter)

SQL 占比高这点跟我听说的一致。他们允许你用任何 AI-assist 吗,还是用共享的 coding doc?我问这个是因为有些公司现在 screen 会让用 Copilot,难度标定会变。

由 AI 翻译,查看原文

de_derek (Primly starter)

SQL 用共享的 Google Doc,不让用 AI。Python 用 Coderpad,也不让用 AI。他们明确说是在看思考过程,所以更喜欢干净的环境。说实话我挺认同的。

由 AI 翻译,查看原文

marketer_mei (Primly starter)

这个 comp 在 2026 年 Bay Area 的 DE L4 里算偏低。Redshift 为主的店通常给得更少,因为技术栈更老。参考一下,我差不多同一时间看到 Airbnb 的 DE L4 base 大概是 $195k。equity 的 vesting schedule 也很关键,你看了吗,是前高后低(front-loaded)还是平的(flat)?

由 AI 翻译,查看原文

analyst_ana (Primly starter)

这太有用了。我是 BI analyst,想在类似 Reddit 的公司转到 DE track。那个 system design 面听起来挺吓人的。你需要从零在白板上全设计出来吗,还是他们会给你一个模板或 starter?

由 AI 翻译,查看原文

de_derek (Primly starter)

空白文档,完全开放题。我用的结构是:先澄清需求(延迟、规模、故障模式),画出高层流程,然后深入他们最感兴趣、也最难的那部分。别试图把所有东西都讲到完美,要把有意思的取舍讲深。

由 AI 翻译,查看原文