上个月刚走完 Coinbase data engineer 的 loop。总共五轮,四轮 technical。发帖是因为我准备的时候几乎找不到 DE 岗位的具体信息。
SQL 那轮最硬核。不是那种“write a query(写一个查询。)”的东西。他们给了一个很乱的 schema(区块链交易数据,多张表,有些反规范化),让我写 window functions 来算滚动 7 天活跃钱包数。然后追问:如果在 prod 里高并发跑,怎么优化延迟。想想分区,想想增量刷新 vs 全量刷新。
Pipeline design 那轮:让我设计一个近实时的 on-chain event ingestion 数据 pipeline。Kafka source,某种流处理(我讲了 Flink vs Spark Structured Streaming 的取舍),sink 到 warehouse。他们很在意容错和 exactly-once 语义。不需要“标准答案”,但要把 trade-off 讲清楚。
还有一轮 coding。比较标准的 Python。一题基本是用 pandas 做数据清洗,另一题更偏算法。比我预期的 DE 要轻一点,但他们说这里不做 LeetCode hard。
Behavioral 也带 crypto 味。他们问我一次构建高数据量系统的经历,也问我对 web3 data 兴奋点是什么。我没装自己是 DeFi 狂热粉,但我诚实说我觉得 on-chain 数据从 analytics engineering 角度结构上很有意思。效果还行。
Recruiter 很靠谱。从第一次电话到 offer 大概 5 周。offer 是 mid-level DE,SF 或 remote。base 在 $175-190k 区间,另有 equity,对 2026 市场来说挺不错。
如果你也在这个流程里,欢迎问更具体的问题。