刚面完 Anthropic 的一个 data engineer 岗位,想写一下复盘,因为这个 track 几乎没有信息。
Recruiter screen 很标准。20 分钟,问背景、简单介绍团队(ML infra 方向),没什么意外。
接着是 technical phone screen,这里开始变得很具体。他们给了一个 SQL 题,涉及在模型训练 run 的时间序列上做窗口聚合。比如:算 moving average,识别不同实验里 cost-per-token 指标的异常。并不简单,但也不是为了坑你。整体语境很像「这就是我们实际在用的数据」。
Onsite 一共 4 轮: Data modeling:设计一个 schema 来追踪 LLM evaluation runs。他们想聊你怎么处理 versioning、实验 lineage,以及最终怎么跨几千个 eval 做查询。我深入讲了 slowly-changing dimensions,他们看起来挺买账。 Pipeline design:设计一个实时 + batch 的混合系统,用来大规模摄取和存储 token usage logs。他们会追问一致性和吞吐量的取舍。Kafka、Flink、iceberg on S3 都可以聊。 SQL deep dive:比 phone screen 更复杂。几个 CTE,还有一个 query optimization 问题:他们给你一个 execution plan,问你会怎么改。 Cross-functional behavioral:你怎么和 ML engineers 合作去理解数据需求?如果研究员项目进行中改 schema,你怎么处理?内容挺标准,但他们要真实故事,不要泛泛而谈。
我的 offer 在 onsite debrief 后大概 11 天回来。base 跟我看到的其他 AI lab 差不多(按 level 大概在 185-230k 区间),外加不少 equity。Anthropic 的 total comp 逻辑有点不一样,因为是 pre-IPO restricted stock,不是 options,所以流动性要用不同方式去考虑。
总体:非常技术落地的 loop。没人用冷门 trivia 刁难。重点都在 AI/ML 特有的数据问题(eval logs、训练指标、成本追踪)上,感觉很真。如果你之前做的是电商或 fintech 的数据 pipeline,面之前最好花点时间理解一下 ML infra 的使用场景。