VMware · Primly 社区

VMware data engineer 面试:pipelines、SQL,以及真正卡住我的点

de_derek (Primly starter) · 4 条回复

上个月刚走完 VMware data engineer 的面试 loop,senior 级别,remote,cloud infrastructure data team。发出来是因为网上几乎找不到他们 DE 流程的有用信息。

recruiter screen 之后是四轮:

Round 1:SQL + data modeling,45 分钟。 这轮才是真正的筛子。他们先给了一个自己设计的 schema(有点像简化版 vCenter telemetry:hosts、VMs、resource pools),让我写 window functions 算 running averages、识别 outliers,还要做多表 join,并且有一些很刁钻的 NULL 处理。不是 Leetcode 那种,更像「这是个真实 schema,证明你会用」。他们还明确说用这种方式考 SQL,因为更贴近工作。

然后让我为一个新的 ingestion use case 设计数据模型。我画了 medallion architecture(bronze/silver/gold),并讲了 partitioning 策略。他们对我的 partitioning 选择稍微 push back 了一下,感觉更像技术讨论,而不是故意刁难。

Round 2:Python + pipelines。 在共享 IDE 里写代码。有个任务是写一个 pipeline:从 Kafka topic(mock 的)读数据,transform records,然后写到目标端并去重。他们很在意 error handling 和 idempotency。我一直强调「如果这一步执行到一半失败会怎样」,面试官反应挺好。

Round 3:面向数据的 system design。「Design a pipeline to ingest VM performance metrics at scale。」经典题。聊了 Kafka、Flink/Spark Streaming、Delta Lake、monitoring。他们问了很多 late-arriving data 和 exactly-once semantics。面试官很有主见,感觉像来回讨论,不像答题。

Round 4:Behavioral。 直接 STAR。跨团队冲突、我 push back 一个技术决策的经历、一个我会重新做的项目。

大概十天后给了 offer。流程很有条理,反馈也是真反馈。最需要重点准备的是 SQL 那轮。window functions、CTEs,还有准备好聊你的 indexing 选择。

由 AI 翻译,查看原文

4 条回复

analyst_ana (Primly starter)

谢谢。有没有问到 dbt 或者 Airflow 这类编排工具?我在想要不要补一补这些,还是就专注原生 SQL 和 Python。

由 AI 翻译,查看原文

sec_sasha (Primly starter)

system design 聊天时他们提到过 Airflow,但没有直接考。我在讲调度的时候是我自己提的,他们看起来也很熟。我觉得你知道到能讲得明白就行,不用指望他们会深挖。

由 AI 翻译,查看原文

ae_andre (Primly starter)

SQL 面试里对 NULL 的处理总是最能看出水平。大多数人都说自己会 SQL,直到 NULL 出现。听起来他们面得挺认真。给你做 take-home 了吗,还是全程都是现场 live coding?

由 AI 翻译,查看原文

sdr_sky (Primly starter)

数据晚到这个问题,如果你没在生产环境里遇到过,确实很难准备。给看到的人:去查 Flink/Spark Streaming 里的 watermark,并了解 event time 和 processing time 之间的取舍。这个问题在 VMware、Snowflake 以及一堆偏基础设施的公司都很常见。

由 AI 翻译,查看原文