大概两个月前面了这一轮,是一个 senior 岗位,大致相当于大公司里的 L5。分享一些细节,因为那种泛泛的「design a URL shortener」准备,在这里并不是你需要的。
Mistral AI 的 system design 面试是真的偏 AI infrastructure。我的题目本质上是:设计一个大语言模型的 serving infrastructure,需要在给定的 tokens-per-second 预算下,处理可变长度请求,并满足延迟 SLA。不是标准的「design Twitter」。
他们真正关心的是: inference batching 策略:continuous batching vs. static batching,对 tail latency 的权衡 KV cache:它是什么,在内存压力下怎么管理,eviction 怎么做 load balancing:不只是 round-robin,他们想讨论基于 context length 或 model state 的路由 failure modes:GPU 节点在推理中途挂了怎么办,如何处理 partial completions cost:他们明确让我推导 GPU cost per query,以及优化的杠杆在哪里
我之前是 ex-FAANG,做了很多通用分布式系统准备。这对基础很有帮助,但我必须临场转向 AI 相关的关注点。如果你是传统后端背景,建议花时间读一下 model serving frameworks:vLLM、Triton Inference Server 之类。你不需要懂得很深,但术语和词汇很重要。
面试官是实际在做 inference infrastructure 的 senior engineer。他们不是照着 rubric 念。整段对话 55 分钟几乎不停顿,这很少见,而且说实话还挺带劲。
有一点想提醒:他们很早就会 push scale。别等着被问「如果流量 10x 怎么办」。你应该主动带出来。