Cloudflare · Primly 社区

Cloudflare data scientist 面试(SQL + case + stats):整个流程到底长什么样

ds_dmitri (Primly starter) · 4 条回复

上个月走完了 Cloudflare 的 DS loop,岗位在他们 analytics team。放一些数据点。

流程概览: Recruiter screen(30 分钟) Technical phone screen(45 分钟,SQL + stats 问题) Onsite:两天共 4 轮(不是连续两天)

Technical phone screen: 两道 SQL。第一道是窗口函数,按 region 给 traffic volume 排名。第二道更复杂:多表 join,按时间窗口过滤,再按某个维度聚合。都在 CoderPad 里做。没有 trick 题,但第二题里有个关于怎么处理 null 的细微要求,我差点漏掉。

Onsite 轮次:

第 1 轮(SQL deep dive):难度和 phone screen 类似,但更复杂一点。他们在意 query 效率,不只是对不对。有一段还问到了索引策略。

第 2 轮(stats + probability):随机变量概念、A/B 测试设计、怎么处理某个 variant 方差明显更高的测试。他们还问我怎么在指标里识别 bot 流量,区分它和真实用户行为变化。这是个 CF-specific 的问题,打了我一个措手不及。进 loop 前建议想一想。

第 3 轮(case/product analytics):给一个场景:Cloudflare 的某个产品指标周环比掉了 15%,让你讲诊断流程。很标准,但他们想看你能想到网络相关的原因(BGP 更新、新 anycast 节点、攻击流量暴涨),不只是泛泛的“看看是不是 bug”。

第 4 轮(behavioral):和其他岗位一样,具体可参考这里另一个帖子。

Python 在需要写一点代码的环节完全够用。我这次 loop 没被问 ML 建模,但听说看团队不同,有些 loop 会加建模。

说句实话:这里的 SQL bar 比我面过的大多数 DS 都高。如果你在的公司是 analyst 写 SQL、你主要做 modeling,建议补一补 SQL。

由 AI 翻译,查看原文

4 条回复

analyst_ana (Primly starter)

bot traffic 这个问题太偏领域了,有点刁钻。你有机会提前准备吗,还是现场即兴发挥的?

由 AI 翻译,查看原文

ds_dmitri (Primly starter)

大多是临场发挥,但刚好我前几天读过一篇 CF 的 blog 讲 bot management。哪怕只是对区分 bot 流量的信号有个表层理解,也能让我把答案说得更连贯:异常检测、流量阈值、user-agent 分析。基本就是把我对异常检测的理解套到他们的领域里。

由 AI 翻译,查看原文

de_derek (Primly starter)

query efficiency 这个点确实存在。我面过一些团队只在乎结果对不对;也有些团队会在乎你会不会不小心在 10TB 的表上做全表扫描。cloudflare 就属于后者,这跟他们的规模也很合理。

由 AI 翻译,查看原文

ml_mike (Primly starter)

这是哪个 team 的?我在 CF 看到过一些 DS 的面试轮次,会更偏建模,具体看是更靠 data science 还是 data analytics。

由 AI 翻译,查看原文