Intel · Primly 社区

Intel data engineer 面试:pipelines、SQL,以及真正会考什么

de_derek (Primly starter) · 4 条回复

今年 Q1 走完了 Intel data engineering 的 loop,最后接了这个岗位。发出来是因为我备面时完全找不到一篇最近且细节足的分享,讲他们到底问什么。

Intel 的 data engineering 规模不小,分布在多个团队:manufacturing analytics、product telemetry、芯片研发指标的内部工具,还有 AI/HPC 方向。我的 loop 是 manufacturing analytics,会涉及 ETL pipelines,把 fab 车间和传感器阵列的数据搬进分析系统。

SQL: 这块占比很大。我有两道专门的 SQL 练习。一道是偏高阶的聚合题,涉及 window functions、partitioning,还有一堆很恶心的 NULL。第二道是优化题:给你一条很慢的 query 和 schema,你会改什么?我需要讲清 index 策略和反规范化的取舍。这不是入门级 SQL。如果你在 window functions 或 query plan 上有短板,面之前先补。

Pipeline design: 有一轮基本就是 pipelines 的 system design。设计一个数据摄取系统,能处理来自成千上万 chip test benches 的 streaming telemetry,schema 会变,传感器偶尔故障导致记录不完整。他们很在意 schema evolution(比如某个传感器开始多发一个字段怎么办?)、exactly-once 处理保证,以及数据质量检查。我讲了 Apache Kafka 做 ingestion、Spark 做 transformation、Delta Lake 做存储。他们这些都很熟,还追问了 Delta 的 ACID 特性。

Python / Pyspark coding: 一轮中等难度,重点是数据处理。写一个函数对这个 DataFrame 做某个 transformation。不像 LeetCode 那种算法题,但需要写干净、高效的 Spark 代码。

Behavioral: 常规问题,但会围绕跨团队的数据 ownership。他们很在意你怎么处理这种情况:工程团队不愿意改 schema 或 instrumentation。在 Intel 这是个真实问题。

整个流程 5 周,终面后 10 天收到 offer。

由 AI 翻译,查看原文

4 条回复

analyst_ana (Primly starter)

Window functions 和 query optimization 被频繁考到,这对那个体量的公司很合理。他们有没有具体考一些 data warehousing 概念,比如 slowly changing dimensions、star vs. snowflake schemas?

由 AI 翻译,查看原文

de_derek (Primly starter)

没有明确提到。schema design 的题更偏 streaming 和半结构化数据,而不是传统的 warehouse 建模。但我也不意外其他团队的 loop 会更偏 warehouse,这取决于你在 Intel 的哪个方向面。

由 AI 翻译,查看原文

ds_dmitri (Primly starter)

schema evolution 这个问题真的很有意思。大多数地方不考这个,但它是生产 pipeline 里最真实的问题之一。很高兴知道 Intel 也在意这个。

由 AI 翻译,查看原文

contractor_kai (Primly starter)

对那个 use case 来说,用 Delta Lake 而不是传统数据仓库是个合理选择。他们有让你和 Iceberg、Hudi 之类的替代方案做对比吗?还是更想看你对他们现有技术栈的熟悉度?

由 AI 翻译,查看原文