Coinbase · Primly 社区

Coinbase data scientist 面试:我实际遇到的 SQL、case study 和 stats 问题

ds_dmitri (Primly starter) · 4 条回复

做了 coinbase 的 DS 全流程,目标是 mid-senior 岗(他们的 L4/L5 区间)。想把技术部分写下来,因为它和纯 SWE 流程不一样,而且几乎没什么资料。

形式: recruiter screen,一轮技术电话面(偏 SQL),然后 onsite 4 轮:advanced SQL、stats/probability、product case、behavioral。

技术电话面: 45 分钟,一道 SQL。不是简单聚合。我那道是对时间序列做 window function。他们给了一个假设的 transactions 表 schema,让我识别可疑活动模式。你得熟 LAG、LEAD、PARTITION BY、以及写子查询。如果你实战里只写过基础的 GROUP BY,会很吃力。

SQL onsite: 更深的版本,两道题。一道是找在滚动 7 天窗口内达到某个阈值的用户。第二道是经典留存 cohort 分析:给一个 login events 表,按 signup cohort 算 30 天和 90 天留存。两题都能用 window functions 解决。他们还让我解释会怎么验证结果,这点卡住了不少我聊过的人,因为很多人只准备了「写出 query」,没准备「怎么 QA」。

stats 和 probability: 这是最有意思的一轮。问题从基础到应用都有,比如「给 PM 解释 p-value」,再到「怎么给一个会影响交易频率的功能设计 A/B test,而 baseline rate 是 rare events」。rare events 的 A/B test 在 fintech 很典型:Poisson 分布或基于 bootstrap 的方法,不只是标准 t-test。这块要真的懂。

product case: 给了一个下滑的指标,让我诊断原因。coinbase 特有指标,比如 daily active traders 周环比掉 15%。常规诊断框架可用:按触点/入口分段,先排查 data pipeline 问题,再看外部因素,再看产品改动。他们很在意你如何给假设排序。

我会怎么准备: window functions 是硬要求。把 retention cohorts 和 rolling windows 练到下意识。 补实验设计:rare events、以及无法干净随机化的情况。 对产品指标诊断要有清晰的心智模型,能口头顺下来。 crypto 背景对 case 有帮助,但不要求很深的 domain knowledge。理解 fintech 交易动态(季节性、外部市场影响)比知道 ethereum L2 是什么更有用。

由 AI 翻译,查看原文

4 条回复

analyst_ana (Primly starter)

现在 DS 面试里到处都在问 retention cohort 这个题。一个很好的自检:你能不能在 10 分钟内从零写出来?如果不能,那就把准备时间花在这里。

由 AI 翻译,查看原文

de_derek (Primly starter)

那个「explain p-values to a PM」的问题,他们到底在乎技术精确性,还是只是看你能不能把统计翻译成业务语言?我也被问过,说实话我一直不知道 interviewer 是按哪种标准打分的。

由 AI 翻译,查看原文

ds_dmitri (Primly starter)

两者都要。你得技术上正确,但也别像机器人。比如说「p-value 告诉你:如果实际上没有效应,你的结果会有多“意外”。p-value 越小,说明靠随机性得到这个结果会越意外,但它并不代表效应很大或很有意义」就两边都照顾到了。真正坑你的是:要么是教科书级别的错误定义,要么是简化到一追问就崩。

由 AI 翻译,查看原文

ml_mike (Primly starter)

罕见事件的 A/B 测试设计题是一个很容易被低估的准备方向。大多数 DS 面试指南都只讲标准的 t-test 场景。但 fintech 里充满了罕见事件问题,比如欺诈检测、某些特定流程的转化等。如果你要面 coinbase DS,得懂 Poisson 和负二项分布,也要知道什么时候该用 permutation test。

由 AI 翻译,查看原文