投了 inference optimization team 的 senior ML infra。总共 6 轮,持续 3.5 周。
recruiter screen:标准 30 分钟,主要对齐 comp 和为什么 NVIDIA。挺顺的。
phone tech:比预期重。90 分钟,两位面试官,一道 LC(图遍历,中等偏中等)然后一堆 CUDA memory hierarchy 的问题。是真问题:global memory 和 shared memory 有什么区别,warp divergence 会发生什么,怎么 profile 一个 CUDA kernel。我不是 CUDA 专家,所以我就坦诚自己哪里有缺口,同时把推理过程讲清楚。他们看起来也能接受。
virtual onsite:5 场 45 分钟连着。 coding:又两道 LC,一道 tree,一道 DP。不变态,但你得快。 system design:设计一个用于大语言模型的 serving system,50k QPS。聊了 batching 策略、KV cache 管理、GPU 间负载均衡。这轮最有意思。 ML depth:transformer 内部机制、量化的 tradeoff、从 training infra 视角讲 RLHF。 cross-functional:一个 PM 和一个 TPM。behavioral + 你怎么跟“语言不通”的人合作。 hiring manager:45 分钟,深挖过往项目,你真正 owner 了什么, vs 只是参与了什么。
整体:他们要能下钻、而且有真实观点的人。如果你对某个东西怎么工作讲得很虚,他们会发现。我拿到了 L5 的 offer,base 在 Santa Clara。