2026 年 Q1 走完了 Walmart Global Tech data scientist 的面试 loop。一共四轮。写下来是因为 Walmart 的 DS 面试确实跟纯 tech 公司的常规 DS 流程不太一样。
轮次结构: Recruiter screen(30 分钟,主要聊背景 + 团队匹配) SQL + 数据处理(60 分钟,和一位 senior DS) Case study / 业务问题(60 分钟,DS lead + stakeholder PM) 统计和 ML(60 分钟,senior DS + 一位 scientist)
SQL 轮。 比我预期更难。不是 HackerRank 的 easy-medium。他们给的 schema 很 Walmart:交易 fact 表,门店、商品、供应商的维表。题目包括: 找出 Q4 同比销售下滑但 Q3 环比为正的门店(大量日期处理) 找出过去 90 天里,缺货超过 3 天、按收入排名 top-10 的商品(join + window function) 写一个 query,基于供应商名称的模糊匹配来检测重复供应商记录(这题我面试里没见过,用了 LIKE + GROUP BY,并且讲了局限性)
他们更看重你有没有把思路讲清楚,而不只是有没有写出能跑的 query。我写了一个不够优的版本时,面试官直接指出来,问我「this would be slow on billions of rows, how would you rewrite it?(在数十亿行数据上会很慢,你会怎么重写?)」
Case 轮。 非常偏落地。我拿到的题是:「Walmart is seeing higher-than-expected return rates on electronics. How would you approach this as a data problem?(Walmart 的电子产品退货率高于预期。你会如何把它当作一个数据问题来处理?)」没有标准答案,他们想看结构化的解决问题方式。我是这样答的:先定义成功指标,列出数据来源,提出假设,按可能性和可验证性排序,然后给出 A/B test 或分析方案。他们会不断追问「what else would you need to know?(你还需要了解什么?)」
Stats/ML 轮。 两个问题:一个是实验设计(门店级实验里你怎么处理 SUTVA violation?),一个是模型选择(流失预测里 logistic regression vs. gradient boosting,什么情况下选哪个)。不算很深的 ML 理论,但统计底子要求挺扎实。
总体:比我预期更严。SQL 要非常熟,实验设计要熟,还要有一套处理混乱业务问题的结构化框架。