Coinbase · Primly 社区

Coinbase data engineer 面试:pipeline 和 SQL,他们真正看重什么

de_derek (Primly starter) · 4 条回复

上个月刚走完 Coinbase data engineer 的 loop。总共五轮,四轮 technical。发帖是因为我准备的时候几乎找不到 DE 岗位的具体信息。

SQL 那轮最硬核。不是那种“write a query(写一个查询。)”的东西。他们给了一个很乱的 schema(区块链交易数据,多张表,有些反规范化),让我写 window functions 来算滚动 7 天活跃钱包数。然后追问:如果在 prod 里高并发跑,怎么优化延迟。想想分区,想想增量刷新 vs 全量刷新。

Pipeline design 那轮:让我设计一个近实时的 on-chain event ingestion 数据 pipeline。Kafka source,某种流处理(我讲了 Flink vs Spark Structured Streaming 的取舍),sink 到 warehouse。他们很在意容错和 exactly-once 语义。不需要“标准答案”,但要把 trade-off 讲清楚。

还有一轮 coding。比较标准的 Python。一题基本是用 pandas 做数据清洗,另一题更偏算法。比我预期的 DE 要轻一点,但他们说这里不做 LeetCode hard。

Behavioral 也带 crypto 味。他们问我一次构建高数据量系统的经历,也问我对 web3 data 兴奋点是什么。我没装自己是 DeFi 狂热粉,但我诚实说我觉得 on-chain 数据从 analytics engineering 角度结构上很有意思。效果还行。

Recruiter 很靠谱。从第一次电话到 offer 大概 5 周。offer 是 mid-level DE,SF 或 remote。base 在 $175-190k 区间,另有 equity,对 2026 市场来说挺不错。

如果你也在这个流程里,欢迎问更具体的问题。

由 AI 翻译,查看原文

4 条回复

ds_dmitri (Primly starter)

rolling window wallet 这个问题挺有意思。他们要你在 window 内处理 deduplication 吗?通常这些题难就难在这里。

由 AI 翻译,查看原文

de_derek (Primly starter)

是的,他们确实提到了这个。wallet address 一天里可能会出现多次。我在窗口上用了 COUNT(DISTINCT wallet_address),然后他们让我想想规模上来后的性能影响。还说了句类似 "assume 10 billion rows",然后就看我怎么处理。

由 AI 翻译,查看原文

backend_bekah (Primly starter)

在 Coinbase 这个规模下用 Flink 做 exactly-once semantics 听起来太吓人了。他们有具体聊 checkpointing 配置吗,还是就保持在高层?

由 AI 翻译,查看原文

corp_refugee (Primly starter)

「what excites you about web3 data(web3 数据让你兴奋的点是什么)」这个问题我总是卡。这个数据结构我觉得很有意思,但「excited about web3」在这里真的靠它撑了太多。

由 AI 翻译,查看原文