2026 年初在 Linear 做了一个 data scientist loop。他们团队不大,也不怎么招 DS,所以流程比大一些的 analytics 组织要没那么标准化。下面是我看到的情况。
先说他们怎么用数据。 Linear 的产品是工程团队用的项目管理工具。他们内部的数据问题主要围绕产品分析:功能怎么被采用、用户在哪流失、不同 workflow 模式和留存怎么相关。这不是一个 ML 很重的环境。如果你来自建模更重的角色,要准备把自己重新定位成决策支持和产品分析。
SQL。 现场写 SQL,schema 很贴近真实:类似 issues、projects、teams、activity 这些表。题包括: 一个 window function(找每个 user 在每个 project 的第一个 activity event) 一个留存 cohort(按周看活跃用户) 一个 self-join(找 24 小时内互相关联的 issue 对)
难度:中等。不是那种数据大厂会出的「write a 4-level CTE(写一个 4 层的 CTE)」题。但他们要的是干净、可读的 SQL,不只是输出对。
Case / product sense。 一个产品场景:某个功能的 engagement 在下降,但新用户在增加。让你说怎么诊断。算是标准的产品分析 case,但他们更看你推理结构,而不只是你会写什么 SQL 去查。
Stats。 很短。一个关于实验设计的问题:如果某个功能只影响很小一段用户,你怎么做 A/B test。我讲了 power analysis、minimum detectable effect、以及用 holdout 设计的选项。他们看起来认可框架。
他们没问的。 没有 ML 建模题。没有 Python。没有 pipeline 设计。如果你想要 ML research 环境,这里大概率不是。
总体。 对 DS 来说,他们优化的信号似乎是:你能不能帮小团队快速做出更好的产品决策。SQL 干净、思路清晰、产品直觉。