Mistral AI · Primly 社区

Mistral AI senior / L5 system design 面试:你该期待什么,以及真正重要的点

backend_bekah (Primly starter) · 4 条回复

大概两个月前面了这一轮,是一个 senior 岗位,大致相当于大公司里的 L5。分享一些细节,因为那种泛泛的「design a URL shortener」准备,在这里并不是你需要的。

Mistral AI 的 system design 面试是真的偏 AI infrastructure。我的题目本质上是:设计一个大语言模型的 serving infrastructure,需要在给定的 tokens-per-second 预算下,处理可变长度请求,并满足延迟 SLA。不是标准的「design Twitter」。

他们真正关心的是: inference batching 策略:continuous batching vs. static batching,对 tail latency 的权衡 KV cache:它是什么,在内存压力下怎么管理,eviction 怎么做 load balancing:不只是 round-robin,他们想讨论基于 context length 或 model state 的路由 failure modes:GPU 节点在推理中途挂了怎么办,如何处理 partial completions cost:他们明确让我推导 GPU cost per query,以及优化的杠杆在哪里

我之前是 ex-FAANG,做了很多通用分布式系统准备。这对基础很有帮助,但我必须临场转向 AI 相关的关注点。如果你是传统后端背景,建议花时间读一下 model serving frameworks:vLLM、Triton Inference Server 之类。你不需要懂得很深,但术语和词汇很重要。

面试官是实际在做 inference infrastructure 的 senior engineer。他们不是照着 rubric 念。整段对话 55 分钟几乎不停顿,这很少见,而且说实话还挺带劲。

有一点想提醒:他们很早就会 push scale。别等着被问「如果流量 10x 怎么办」。你应该主动带出来。

由 AI 翻译,查看原文

4 条回复

ml_mike (Primly starter)

这很有用,也很少见。大多数 system design 备考材料都跟 inference infra 实际怎么运作完全脱节。KV cache 这个问题我在 2026 年看到多家 AI-native 公司都问过,不只是 Mistral。如果你从没认真想过 attention 的 keys 和 values 怎么跨 generation steps 做缓存,先去读 vLLM 的论文。

由 AI 翻译,查看原文

sec_sasha (Primly starter)

这一轮也会覆盖 mid-level 的面试吗,还是更偏 senior 的东西?我离 senior 可能还差一两年,但好奇在那边 L3/L4 对应级别的面试里会不会也出现。

由 AI 翻译,查看原文

ae_andre (Primly starter)

我不能确定,因为我只走过 senior 这条 track。我猜会涉及同样的话题,只是对成本建模和 failure modes 的深度要求没那么高。他们在做的东西决定了 inference 的基础概念可能任何级别都相关。

由 AI 翻译,查看原文

de_derek (Primly starter)

关于每次查询的 GPU 成本那段挺有意思的。算 data eng 的角度,但我最近也开始看到 infra 成本出现在数据设计面试里了。面试官想看的是经济上的推理,而不只是技术上的正确性。其实还挺不错的。

由 AI 翻译,查看原文