上个月刚结束 Humana 的 final round,岗位是 Senior Data Engineer。现在所谓的「onsite」基本都是线上,但他们还是这么叫。分享一下拆解,因为它的形态跟纯 SWE loop 有点不一样。
结构
在 Teams 上一天搞定,4 个 45 分钟 session。连着排,中间有短休息。他们会都塞在同一天。
session 1:technical coding
先来一道 SQL。很真实的 healthcare 数据 schema:members、claims、diagnoses。题目是找出有特定慢性病 flag、且 12 个月内没做过预防筛查的 member。窗口函数、条件聚合。SQL 不算刁钻,但你得能现场写出来。然后是一道短 Python 题:解析保险 API 响应里嵌套的 JSON。
session 2:system / architecture
你会怎么设计一条数据 pipeline:从多个 payer 来源 ingest claims 数据,做标准化,然后给 analytics 和 ML features 使用?典型的 ELT 设计。我讲了 Kafka 做流式、dbt 做转换、Snowflake 或 BigQuery 作为 warehouse 目标,还有 ingestion 时的数据质量检查。Healthcare 场景里,data contract 和上游 SLA 的波动很重要,payer 文件不一定按时到。
session 3:behavioral
标准形式,但偏 healthcare。会问你怎么跟 compliance 团队合作,pipeline 里怎么处理 PII/PHI,以及一个团队冲突解决的例子。
session 4:leadership / culture conversation
见了一个在 hiring manager 管理链条上的人。更不结构化,更像「这是我们的 roadmap,你觉得你怎么融入,你有什么问题」的对话。他们明显会用这轮来评估成熟度,以及你怎么谈 ambiguity。
overall
流程挺公平。一天很长,但推进效率高。最终轮后第 8 个工作日给了 hiring decision。Offer 带 background check 的前置条件。
补充一点:他们非常严格地用 behavioral anchors。interviewer 会在我回答的时候记笔记。STAR 故事一定要结构清晰。