CrowdStrike · Primly 社区

CrowdStrike data engineer 面试,pipeline 和 SQL:整个流程到底长什么样

de_derek (Primly starter) · 4 条回复

今年早些时候我走了 CrowdStrike 的 data engineer 面试流程,岗位在奥斯汀的 Threat Intelligence data platform 团队。发出来是因为我准备时找不到任何具体信息,最后临场发挥的部分比我想要的多。

总共 5 轮。

phone screen 很轻。先 recruiter 电话,然后和团队里的一个 DE 做 30 分钟技术聊。他们让我从头到尾讲一个我负责的 pipeline:ingestion、transformations、怎么处理 late-arriving data。完全不考算法。

onsite(virtual)是连续 4 场: SQL deep dive。不简单。window functions、CTEs,还有一道题是 7 天窗口内对 event logs 去重。他们看重你会写高效的 query,不只是写对。panel 里有个人提到他们用 Snowflake 和一些内部工具,所以如果你能聊到那边的 query optimization 会加分。 pipeline design 轮。给场景:每天从 endpoint sensors ingest 50M 条 security event records,做 normalize,然后让它们可查询,p99 latency 要低于 200ms。他们不是要一个标准答案,而是看你怎么权衡 batch vs streaming、怎么处理 schema drift、你会监控哪些指标。 data modeling。让我建模一个 schema,用来跟踪 file hash reputation 随时间变化。偏 CDC、slowly changing dimensions。如果你做过 time-series 或 audit tables,就往这个方向讲。 behavioral。标准问题,但带 security 视角。有个我记得的问题:描述一次你做的 pipeline,正确性和速度一样重要。(他们想听的是你怎么验证输出,而不只是跑得多快。)

他们很看重的点:你需要把 data quality 和可靠性当成第一优先级来讲。这是 security 公司,坏数据会带来真实后果。我提了对 pipeline 输出做 anomaly detection,这个反响很好。

我拿到的 offer comp:senior DE,奥斯汀,base 大约 $155k,RSU 大概 $160k(4 年)。第一年总 TC 大约 $195k(含 sign-on)。

整体从第一次 recruiter 电话到 offer 大概 4 周。panel 很强,follow-up 问得也好,值得准备。

由 AI 翻译,查看原文

4 条回复

ds_dmitri (Primly starter)

dedup window 这个问题在安全数据 pipeline 里很经典。事件会延迟到,因为端点会离线,重新连上才同步。他们是希望你写出实际的 SQL,还是只要描述思路?

由 AI 翻译,查看原文

de_derek (Primly starter)

现场在共享文档里写 SQL。他们关注的是 row_number() over partition 的思路,以及我有没有处理一个边界情况:同一个 event id 在不同 source 里 timestamp 不一致。我做对了,但确实想了一会儿。

由 AI 翻译,查看原文

sec_sasha (Primly starter)

文件 hash reputation 建模这个问题很真实。这基本就是他们 Falcon 平台的核心数据问题之一。如果你接触过 VirusTotal 或任何 threat intel feed 的 schema,这个就能直接对上。

由 AI 翻译,查看原文

corp_refugee (Primly starter)

这个 TC 在 Austin 还不错。CrowdStrike 在安全领域里,除去纯 FAANG 那种数字,算是给得比较高的雇主之一。

由 AI 翻译,查看原文