Goldman Sachs · Primly 社区

Goldman Sachs data engineer 面试:pipeline 和 SQL,四轮分别问了什么

de_derek (Primly starter) · 4 条回复

今年早些时候走了 Goldman Sachs data engineering 的面试 loop,Engineering Division,NYC 的职位。recruiter screen 之后总共四轮。这里是拆解。

recruiter screen:30 分钟,主要是过简历,然后问了几个 data modeling 的高层问题。他们问我是否做过「large-scale data pipelines」,意思是要你说具体数字:每天多少行、延迟 SLA、一些能落地的指标。

round 1,coding + SQL:一道中等复杂度的 coding(Python,图遍历,不算变态)和两道 SQL。SQL 重点在 event log 的 partitioning 和 aggregation。有一道故意把需求写得含糊,他们想看你在写之前会不会先澄清。

round 2,面向数据的 system design:设计一个实时 trading data pipeline。从 market feeds 摄取,为低延迟查询和历史分析分别存储。他们追得很凶:feed 掉了怎么办,怎么保证 exactly-once delivery,backfill 怎么做。kafka 立刻就提到了。他们还追问 consumer group lag monitoring,我刚好真的做过,所以比较顺。

round 3,behavioral:这个让我意外,是完整的 45 分钟 behavioral。STAR format。很多「tell me about a time you disagreed with a technical decision(讲一次你不同意某个技术决策的经历)」和「how did you handle a production incident.(你是怎么处理一次生产事故的)」。GS 对这个的权重比我以为的高,尤其对 eng 角色。

round 4,technical deep dive:一个 senior IC 把我过去的一个项目挖得非常细。我要解释我两年前做过的架构选择。他们是真的好奇,不是想坑我。

pipeline + systems design 是决定生死的一轮。如果你至少在理论上没有端到端设计过 streaming data system,去面之前先把这个补上。

由 AI 翻译,查看原文

4 条回复

infra_ines (Primly starter)

kafka consumer lag 这个问题是 GS 经典题,我已经在三份不同报告里看到提到了。他们会深入到具体工具吗,还是更偏概念?比如他们在意你用 Flink 还是自写 consumer 吗?

由 AI 翻译,查看原文

de_derek (Primly starter)

大多是概念层面的,但我提到我在生产环境里会追的具体指标时(按分区的 consumer lag、reprocessing rate),他们明显更来劲了。问题本身不绑定具体工具,但他们很认可有运维实战经验。

由 AI 翻译,查看原文

backend_bekah (Primly starter)

behavioral 是完整 45 分钟一轮这点挺有意思的。fintech 在 2023 之后整体上对这个更认真了。GS 尤其看重 senior 角色的这一轮,我猜是因为文化契合度和风险管理思维。

由 AI 翻译,查看原文

remote_swe_42 (Primly starter)

你在进 loop 之前从 recruiter 那里拿到过 comp 数字吗?好奇 DE 的 band 和 NYC 的 SWE 在差不多同等 seniority 下对比如何。

由 AI 翻译,查看原文