Bloomberg · Primly 社区

Bloomberg data engineer 面试,pipelines 和 SQL:实际考了什么

de_derek (Primly starter) · 4 条回复

我在 2026 年初走完了 Bloomberg data engineer 的流程,NYC 岗。分享一下实际考的内容,因为我搜到的大多很泛,或者是三年前的。

Phone screen 是 recruiter,标准背景问题。然后是 45 分钟技术面,面试官是工程师。一半 SQL,一半 Python 数据处理。SQL 真挺难的:CTE、window functions、ranking,还有几道题得想清楚 aggregation 顺序才能避免 double-counting。不是 LeetCode 那种 puzzle,更像「给你个很脏的数据集,回答一个业务问题。」这种 framing 很 Bloomberg。

Onsite 两天四轮(虚拟):

Data modeling / pipeline design。给了一个 ingesting market data feeds 的场景:高吞吐、late-arriving data、deduplication。你要讲 schema 选择、partitioning strategy、以及怎么处理 reruns。Kafka 会出现。我提了 exactly-once semantics,结果他们就这个聊了 20 分钟,所以 streaming 基础要懂。

SQL depth round。更多 window functions。还有一个 query optimization 题:基本就是「带我过一遍,你怎么 debug 一个在十亿行表上很慢的 query。」execution plans、indexes、partition pruning。

Coding。Python。一道 string parsing,一道本质上是把 join 用代码做出来(不是 SQL)。原始难度不高,但时间很紧。全程要解释你的思路。

Behavioral。Bloomberg 的 behavioral 更偏 ownership 和 crisis response。「Tell me about a pipeline that failed in production and what you did.(跟我讲一个在生产环境里失败的 pipeline,以及你做了什么。)」准备两三个真实事故案例。他们不想听理论答案。

我当时有 7 年 data eng 经验,主要在 fintech,金融数据的角度确实加分。如果你来自别的领域,建议补一点 market data 概念:tick data、time-series、order books(高层理解就够)。

整个流程从投递到 offer 大概 6 周。recruiter 沟通还不错,比平均水平好一点。

由 AI 翻译,查看原文

4 条回复

ds_dmitri (Primly starter)

重复计数导致的聚合陷阱太真实了。这是个经典的 Bloomberg SQL 题型。我 2024 年面那里的 data analytics role 时也遇到过一模一样的题。他们有问 Spark 相关的吗,还是主要是 Python pandas 风格?

由 AI 翻译,查看原文

de_derek (Primly starter)

pipeline design 的讨论里提到了 Spark,但不是那种动手写代码的问题。我在 streaming 的场景里提了 PySpark,他们就挺满意。coding 轮都是纯 Python,没有分布式框架。

由 AI 翻译,查看原文

analyst_ana (Primly starter)

收藏了。我下周有一个 Bloomberg data analyst 的 screen,我担心 SQL 门槛太高。他们有给任何准备材料,或者暗示该看什么吗?

由 AI 翻译,查看原文

backend_bekah (Primly starter)

“金融领域知识”这个角度是被低估的准备建议。很多 DS/DE 的面试指南都完全不提,因为它们写得很泛。对 Bloomberg 来说,这点真的能把你和别人拉开差距。

由 AI 翻译,查看原文