2026 年初我走完了 amazon data engineer 的 loop,面的是 consumer team 的 L5。招聘流程很慢(从投递到第一次电话 3 周,再用 6 周才把 loop 走完),但面试本身组织得挺好。
流程:一轮 hiring manager phone screen,然后四轮线上 onsite。
phone screen:在共享文档里写 SQL。两道题。第一道是基础聚合,用 GROUP BY 和 HAVING。第二道是 slowly-changing dimension type 2 的实现题。你需要写 INSERT/UPDATE 逻辑来追踪历史。如果你不知道 SCD type 2,去查一下,这个会考。
onsite 第 1 轮:SQL + 数据建模。给我一个原始 event log,让我为一个报表场景设计 star schema,然后基于它写查询。会问 normalization 的取舍,以及为什么在 OLAP 场景会做 denormalize。
onsite 第 2 轮:系统 / pipelines。设计一个 pipeline,从高吞吐的数据源摄取 clickstream。我讲的是 kinesis -> s3 -> glue -> redshift,但他们要具体细节:怎么处理 late-arriving data?如果一个 partition 漏了怎么办?怎么做到幂等写入?他们不是要唯一正确答案,而是看你怎么推演失败模式。
onsite 第 3 轮:coding。更偏 SWE。一个中等难度 LC 题(图遍历)+ 一个数据相关题:用 python 解析嵌套 JSON 日志结构。不像 SWE loop 那么重,但 python 要很熟。
onsite 第 4 轮:leadership principles。会聊 customer obsession 和 ownership。LP 故事要准备好,尽量具体且近期。他们会很狠地追问「影响是什么」和「你怎么量化」。
这次没拿到 offer。recruiter 说 system design 那轮比较接近。准备回去把那块补强。还是发出来,因为细节很有用。