recruiter 主动联系了我,先聊了一次,现在已经约了 technical screen。想找最近在这边面过 data engineering 或 data platform 的人分享一下。
我主要想知道:更偏 SQL 还是 python/spark?会不会问一些 distributed systems 风格的问题,还是主要看 ETL 设计和 pipeline 架构?有没有什么 behavioral 的坑需要注意?
欢迎把你的数据点丢在下面。就算是去年的、职位略有不同,也一样有用。
recruiter 主动联系了我,先聊了一次,现在已经约了 technical screen。想找最近在这边面过 data engineering 或 data platform 的人分享一下。
我主要想知道:更偏 SQL 还是 python/spark?会不会问一些 distributed systems 风格的问题,还是主要看 ETL 设计和 pipeline 架构?有没有什么 behavioral 的坑需要注意?
欢迎把你的数据点丢在下面。就算是去年的、职位略有不同,也一样有用。
不是 DE,但我去年在 state street 做过一场 data analyst panel。SQL 很重:多表 joins、window functions、带过滤条件的 aggregation。python 也提到了,但不深。behavioral 这块问了很多数据质量,以及当数字对不上时你会怎么处理。
大概 8 个月前在那边面了 data platform。design 轮里提到了 spark,但不是主角。他们更在乎 lineage 和 auditability,而不是纯处理性能。这也合理,毕竟是银行,一切都得可追溯。
lineage 和 auditability,懂了。这跟我现在做金融数据用的能力是同一块肌肉,所以挺安心的。谢谢。
就 behavioral 而言:他们问我(software track)有没有在问题造成下游影响之前就抓到错误的经历。我猜 data eng 也是类似的口味。所有东西都带着 compliance-and-risk 的视角。