上个月刚结束 Reddit 的 DE 流程,L4 级别,SF-remote 混合岗位。趁记忆还新鲜写一下,因为我准备的时候几乎找不到 DE track 的具体信息。
流程是:recruiter 电话,然后 45 分钟技术 screen,然后线上 onsite 4 轮。
技术 screen 分两段。前半:SQL。不是刁钻 SQL,但会在真实语境下测试你是否真的理解 window functions 和聚合。我拿到的类似「给这张 events 表,找 DAU 的 7 天 rolling average」,需要口头讲清楚。后半是一个 Python coding 题,把嵌套 JSON 转成扁平结构。中等难度,不偏门。
Onsite 拆解: 第 1 轮:SQL deep dive。两道题,一道是漏斗分析(非常 Reddit 相关,因为是 ads data),另一道是用 CTE 做去重。他们线上用 Spark + Redshift,所以面试官提到他们在意你是否知道分布式查询模式和单机 SQL 的区别。 第 2 轮:数据 system design。设计一条 pipeline,能规模化 ingest Reddit post metadata,并在 30 分钟内可用于 ML feature generation。经典 Lambda/Kappa 架构地带。我提到 Kafka 时被 push back,他们要具体到 partitioning strategy 和 schema evolution。 第 3 轮:Behavioral。常规题,但带 Reddit 视角,会问到「tell me about a time you dealt with upstream data quality issues(讲一次你处理上游数据质量问题的经历)」(讲一次你处理上游数据质量问题的经历)。他们好像很看重跟 ML platform 团队的跨职能合作。 第 4 轮:第二轮 coding/pipeline。给一份很乱的用户事件 CSV,写一个 Python pipeline 清洗、转换,并输出聚合指标。重点是正确性,然后再问你怎么 scale。
我拿到的 offer comp:base $165k,equity 大约 $60k/年 vesting,标准福利。这个是湾区 L4,2026 年初。我最后没接(去了另一个 offer),但面试流程本身挺扎实。面试官准备充分,没有绕来绕去。
有一点:他们确实很在意数据质量工具。我提到用过 Great Expectations 和 dbt tests,面试官肉眼可见地兴奋了一下。如果你来自纯 ETL 背景、没有质量层,建议补一下。