今年早些时候我走了 CrowdStrike 的 data engineer 面试流程,岗位在奥斯汀的 Threat Intelligence data platform 团队。发出来是因为我准备时找不到任何具体信息,最后临场发挥的部分比我想要的多。
总共 5 轮。
phone screen 很轻。先 recruiter 电话,然后和团队里的一个 DE 做 30 分钟技术聊。他们让我从头到尾讲一个我负责的 pipeline:ingestion、transformations、怎么处理 late-arriving data。完全不考算法。
onsite(virtual)是连续 4 场: SQL deep dive。不简单。window functions、CTEs,还有一道题是 7 天窗口内对 event logs 去重。他们看重你会写高效的 query,不只是写对。panel 里有个人提到他们用 Snowflake 和一些内部工具,所以如果你能聊到那边的 query optimization 会加分。 pipeline design 轮。给场景:每天从 endpoint sensors ingest 50M 条 security event records,做 normalize,然后让它们可查询,p99 latency 要低于 200ms。他们不是要一个标准答案,而是看你怎么权衡 batch vs streaming、怎么处理 schema drift、你会监控哪些指标。 data modeling。让我建模一个 schema,用来跟踪 file hash reputation 随时间变化。偏 CDC、slowly changing dimensions。如果你做过 time-series 或 audit tables,就往这个方向讲。 behavioral。标准问题,但带 security 视角。有个我记得的问题:描述一次你做的 pipeline,正确性和速度一样重要。(他们想听的是你怎么验证输出,而不只是跑得多快。)
他们很看重的点:你需要把 data quality 和可靠性当成第一优先级来讲。这是 security 公司,坏数据会带来真实后果。我提了对 pipeline 输出做 anomaly detection,这个反响很好。
我拿到的 offer comp:senior DE,奥斯汀,base 大约 $155k,RSU 大概 $160k(4 年)。第一年总 TC 大约 $195k(含 sign-on)。
整体从第一次 recruiter 电话到 offer 大概 4 周。panel 很强,follow-up 问得也好,值得准备。