Databricks · Primly 社区

Databricks 面试被拒复盘:我会怎么改

returner_ren (Primly starter) · 5 条回复

周二下午我收到了 Databricks 的拒信,就在我最后一轮 virtual onsite 结束 3 小时后。这个速度可能本来就是信号,但当时我还处在那种「也许只是自动回执」的自我安慰窗口里。

我面的是 mid-level SWE,大概对应 L4。总共 6 轮,三周左右:phone screen,然后一个 take-home Spark coding challenge,然后 onsite 四轮 panel:分布式系统设计、coding(两轮)和 behavioral。

我觉得我输在:

分布式系统设计那轮。 题目很开放:设计一个能在规模下处理 late-arriving events 的 data pipeline。我画的方案还算合理,但我没有把它明确和 Databricks 的真实产品面联系起来:Delta Lake、structured streaming、lakehouse 架构。他们是数据公司,他们想看你理解他们真正解决过的问题。我讲得太泛了,本该更具体。

Take-home。 我题做对了,但 Spark 代码不够 idiomatic。我用了 pandas UDFs,本来应该用原生 Spark functions。对 200GB 的数据集来说,这差别很大。我知道这是风险,但还是交了。错误。

Behavioral 那轮。 我刚结束两年的职业空窗期。我解释得很诚实,但没有把 gap 讲成「我学到了什么、我怎么回来得不一样」。我只给了事实,没有叙事。他们可能在「growth mindset」上给我打低了。

如果重来一次,我会先花整整一周读 Delta Lake 文档和 Databricks 的 engineering blog,再去刷任何 LeetCode。coding 只是门槛。system design 才是你拉开差距的地方,而你靠懂他们的领域来拉开差距。

还有:要把职业空窗期的解释练到能说出口,不要只在脑子里想。Onsite 的 behavioral 节奏很快,你当下没有时间临时组织语言。

三个月后我去了别的地方。结果也还行。但这次很扎心,因为我觉得是可以修正的。

由 AI 翻译,查看原文

5 条回复

recruiter_rita (Primly starter)

systems design 的反馈很准确。我在 Databricks 上尤其见过很多次。候选人准备的是通用 distributed systems,但没把它和 lakehouse pattern 连接起来。面试官真的就是做这些东西的人。你的回答如果放到任何公司都能用,他们一眼就看得出来。去看 Delta Lake 的 docs,还有他们关于 Spark engineering 的文章,花点时间。

由 AI 翻译,查看原文

returner_ren (Primly starter)

对,而且我面试前就知道这一点,这才是最让人沮丧的。我有信息,只是没花时间做 domain prep,因为我在担心 LC hard。完全是优先级搞错了。

由 AI 翻译,查看原文

infra_ines (Primly starter)

pandas UDF 这个点每次都能坑到人。原生 Spark functions 在 JVM 上跑,没有序列化开销。Pandas UDF 需要把数据 pickle 过进程边界。数据量大时差距能到一个数量级,任何在 Databricks 的 data engineer 做 code review 都会立刻看出来。

由 AI 翻译,查看原文

jp_newgrad (Primly starter)

谢谢你发这个。我两周后有个 databricks 的 phone screen,这正是那种特别具体、很有帮助的信息。大家只会说“懂 spark”,但知道 failure modes 长什么样要有用得多。

由 AI 翻译,查看原文

sam_recovering (Primly starter)

空档期叙事这块确实很关键。我也遇到过类似情况。问题不在空档期本身,而在于你没有把它讲成一个故事。「我在照护家人」本身没问题,但你要补上你观察到了什么,或者你之后会怎么不一样地做事。面试官只是想校准风险。

由 AI 翻译,查看原文