Amazon · Primly 社区

Amazon data engineer 面试,Pipeline 和 SQL:五轮,具体考了什么

de_derek (Primly starter) · 4 条回复

2026 年初我走完了 amazon data engineer 的 loop,面的是 consumer team 的 L5。招聘流程很慢(从投递到第一次电话 3 周,再用 6 周才把 loop 走完),但面试本身组织得挺好。

流程:一轮 hiring manager phone screen,然后四轮线上 onsite。

phone screen:在共享文档里写 SQL。两道题。第一道是基础聚合,用 GROUP BY 和 HAVING。第二道是 slowly-changing dimension type 2 的实现题。你需要写 INSERT/UPDATE 逻辑来追踪历史。如果你不知道 SCD type 2,去查一下,这个会考。

onsite 第 1 轮:SQL + 数据建模。给我一个原始 event log,让我为一个报表场景设计 star schema,然后基于它写查询。会问 normalization 的取舍,以及为什么在 OLAP 场景会做 denormalize。

onsite 第 2 轮:系统 / pipelines。设计一个 pipeline,从高吞吐的数据源摄取 clickstream。我讲的是 kinesis -> s3 -> glue -> redshift,但他们要具体细节:怎么处理 late-arriving data?如果一个 partition 漏了怎么办?怎么做到幂等写入?他们不是要唯一正确答案,而是看你怎么推演失败模式。

onsite 第 3 轮:coding。更偏 SWE。一个中等难度 LC 题(图遍历)+ 一个数据相关题:用 python 解析嵌套 JSON 日志结构。不像 SWE loop 那么重,但 python 要很熟。

onsite 第 4 轮:leadership principles。会聊 customer obsession 和 ownership。LP 故事要准备好,尽量具体且近期。他们会很狠地追问「影响是什么」和「你怎么量化」。

这次没拿到 offer。recruiter 说 system design 那轮比较接近。准备回去把那块补强。还是发出来,因为细节很有用。

由 AI 翻译,查看原文

4 条回复

infra_ines (Primly starter)

幂等写入这个问题是经典题。他们在 amazon 真的很在意 exactly-once 语义和延迟到达的数据,因为他们内部的 pipeline 规模巨大。我会练到在白板上把 kinesis -> s3 -> glue 这条链路画出来,直到变成本能。

由 AI 翻译,查看原文

de_derek (Primly starter)

对,我把架构大致画得挺清楚,但在 redshift layer 具体怎么做 deduplication 这块卡住了。我觉得我就是在这丢分的。

由 AI 翻译,查看原文

backend_bekah (Primly starter)

电话面试考 SCD type 2,太狠了。这是真正的设计概念,不是筛人用的题。倒也佩服他们在测真实的数据仓库能力,而不只是语法。

由 AI 翻译,查看原文

recruiter_rita (Primly starter)

仅供参考,2026 年 amazon 的 DE 角色竞争更激烈了。更多申请者有 AWS 证书和 redshift 经验。你这条帖子对流程结构的描述是准确的。coding 环节因团队而异,但 python 熟练是基本要求。

由 AI 翻译,查看原文