Databricks · Primly 社区

Databricks data scientist 面试(SQL + case + stats):loop 长什么样

ds_dmitri (Primly starter) · 5 条回复

刚结束 Databricks DS 面试流程,岗位是产品分析方向的 senior data scientist。给在找最新面经的人一个拆解,网上大多数帖子都是 2-3 年前的了。

recruiter screen 之后一共 4 轮。

SQL / 技术编码(60 分钟)。 两道 SQL,都是在共享编辑器里做。第一道是中等复杂度的聚合:多表 join、窗口函数、基于衍生列过滤。我会把它归类为 LeetCode medium SQL。第二道更难:自连接加 LAG/LEAD,用来跟踪用户漏斗里的连续事件。基本占了我剩下的大部分时间。他们不是在考你是否会 Databricks 特定的 SQL 语法(跟 Spark SQL 差不多),而是想看你是否能熟练写分析型 SQL。

另外还有一个很快的 Python 部分:一题用 pandas 做数据处理。写个函数按用户分组计算 7 天滚动平均。没什么坑,主要看熟练度。

统计与概率(45 分钟)。 比我预期更重。A/B 测试:需要多少样本量?他们带我过了一个低基准率的场景,问到了 power 计算。也问了 p-value 的常见误读(经典题),以及一个关于用贝叶斯 vs 频率学派看产品指标的问题。我平时主要在频率学派这套里工作,所以贝叶斯那题有点失误,但感觉也没有直接把我打崩。

Case study / 分析思维(60 分钟)。 给了个场景:“Databricks 在一批企业客户中的使用量环比下降了 15%。说说你会怎么查。”很标准的 DS case。我回答的路径是:先做数据质量检查,再按客户规模和产品模块分段,看外部因素(我们是不是改了定价?某个功能是不是坏了?),识别领先指标 vs 滞后指标。他们会在每一步继续追问。

Behavioral(45 分钟)。 形式跟工程的 behavioral 一样。DS 组织里的人来面,问 ownership 和影响力相关的问题。我讲了一个故事:我的分析发现了一个重要结论,但某个大产品团队并不想听。这个回答反馈很好。

流程里他们透露的 comp target:SF 的 senior DS 大概总包 $200-240k,RSU 占比很高。以 2026 的市场来看挺有竞争力。

由 AI 翻译,查看原文

5 条回复

analyst_ana (Primly starter)

用 LAG/LEAD 的 funnel tracking SQL 题现在到处都是。对任何偏 analytics 的 DS 面试来说,这基本是标准题了。给在准备的人一句:要能写出一个 query,找出在 N 天内走完 step A 再到 step B,但中间没有走到 step C 的用户。这类变体会一直出现。

由 AI 翻译,查看原文

content_cole (Primly starter)

2026 年在 SF,senior DS 的总包 $200-240k 听起来差不多。我见过 Databricks 的 DS offer,中级 senior 大概就是这个区间。对比一下,我朋友的 offer(也是 senior DS,偏 ML)大概 ~$230k,其中约 40% 是 RSUs,4 年 vest,没有 cliff。

由 AI 翻译,查看原文

ds_dmitri (Primly starter)

对,RSU 相对 base 的占比我也觉得偏高,但 vesting 结构是标准的。如果你在意的话,按当前 pre-IPO 估值建个模型算一下也值得。毕竟不是 public stock,所以波动性你得自己承担一些。

由 AI 翻译,查看原文

returner_ren (Primly starter)

stats 那轮是完全口头聊吗,还是会让你写点什么?我一直在准备 stats 概念,但要我当场在脑子里口算 power calculations 再大声讲出来会紧张。

由 AI 翻译,查看原文

ds_dmitri (Primly starter)

一半口头讲,一半在纸上推。做 power calculation 的时候他们让我把公式推导步骤写出来。我不觉得他们期待心算,更在意你知道这些变量(effect size、alpha、power),并且能推理取舍的方向。

由 AI 翻译,查看原文