Anthropic · Primly 社区

Anthropic data engineer 面试,Pipeline 和 SQL:完整 loop 复盘

de_derek (Primly starter) · 5 条回复

刚面完 Anthropic 的一个 data engineer 岗位,想写一下复盘,因为这个 track 几乎没有信息。

Recruiter screen 很标准。20 分钟,问背景、简单介绍团队(ML infra 方向),没什么意外。

接着是 technical phone screen,这里开始变得很具体。他们给了一个 SQL 题,涉及在模型训练 run 的时间序列上做窗口聚合。比如:算 moving average,识别不同实验里 cost-per-token 指标的异常。并不简单,但也不是为了坑你。整体语境很像「这就是我们实际在用的数据」。

Onsite 一共 4 轮: Data modeling:设计一个 schema 来追踪 LLM evaluation runs。他们想聊你怎么处理 versioning、实验 lineage,以及最终怎么跨几千个 eval 做查询。我深入讲了 slowly-changing dimensions,他们看起来挺买账。 Pipeline design:设计一个实时 + batch 的混合系统,用来大规模摄取和存储 token usage logs。他们会追问一致性和吞吐量的取舍。Kafka、Flink、iceberg on S3 都可以聊。 SQL deep dive:比 phone screen 更复杂。几个 CTE,还有一个 query optimization 问题:他们给你一个 execution plan,问你会怎么改。 Cross-functional behavioral:你怎么和 ML engineers 合作去理解数据需求?如果研究员项目进行中改 schema,你怎么处理?内容挺标准,但他们要真实故事,不要泛泛而谈。

我的 offer 在 onsite debrief 后大概 11 天回来。base 跟我看到的其他 AI lab 差不多(按 level 大概在 185-230k 区间),外加不少 equity。Anthropic 的 total comp 逻辑有点不一样,因为是 pre-IPO restricted stock,不是 options,所以流动性要用不同方式去考虑。

总体:非常技术落地的 loop。没人用冷门 trivia 刁难。重点都在 AI/ML 特有的数据问题(eval logs、训练指标、成本追踪)上,感觉很真。如果你之前做的是电商或 fintech 的数据 pipeline,面之前最好花点时间理解一下 ML infra 的使用场景。

由 AI 翻译,查看原文

5 条回复

ds_dmitri (Primly starter)

关于 eval runs 的 schema design 这个问题很能看出一家公司到底有没有认真对待数据。他们在意 foreign keys 和 normalization 吗,还是更像那种“讲讲你的思路”就行的感觉?

由 AI 翻译,查看原文

de_derek (Primly starter)

更偏后者。他们不想辩 normal forms。他们想看你会不会主动去想这种问题:半年后我怎么查询「all evals that used model version >= 2.1」。时间维度查询的角度才是重点。

由 AI 翻译,查看原文

infra_ines (Primly starter)

batch 侧用 iceberg on S3 在那种场景下很合理。他们有提到具体的 orchestration 工具吗,还是更偏 tool-agnostic?

由 AI 翻译,查看原文

analyst_ana (Primly starter)

从 recruiter screen 到 offer 的完整流程大概多久?我想判断要不要先拖一拖其他 offer。

由 AI 翻译,查看原文

de_derek (Primly starter)

总共大概 5 周。2 周才把 phone screen 约上,phone screen 到 onsite 间隔 1 周,然后 11 天出 offer。不是我见过最快的,但他们全程沟通都很到位。

由 AI 翻译,查看原文