Cisco · Primly 社区

Cisco data engineer 面试:pipelines 和 SQL 才是全部重点

de_derek (Primly starter) · 4 条回复

刚走完我在 San Jose 的 Cisco data engineer 面试全套流程。写个拆解,因为我准备时完全找不到具体信息。

先是 recruiter 电话初筛,然后是和团队里一个 DE 的 45 分钟技术面。技术面几乎全是 SQL。不是玩具查询,而是真实的多表 join 聚合、window functions、ranking。他们给了我一个类似 network event log 的 schema,让我按 device 找异常。如果你是数仓背景,可以按 Redshift 或 Snowflake 的方言来想。他们不抠语法,但很在意你是否理解 partitioning 和 indexing。

Onsite 一共四轮: SQL + 数据建模:为 telemetry ingestion pipeline 设计 schema。我画了 star schema。面试官问了和宽表(wide flat tables)相比的取舍。 Pipeline 架构:讲我会怎么搭一条端到端的 Kafka 到 Spark Streaming 到 Postgres pipeline 来做 device health metrics。他们关注容错、exactly-once 语义、late-arriving events。 Python / coding:一题中等难度,大概是把嵌套 JSON event 记录转换成扁平的表格格式。日常做这个的话不难。 Behavioral:标准 STAR。团队冲突、你如何端到端负责一个项目、如何处理模糊需求。

我发现他们真的很看重数据质量。好几个面试官都问我怎么检测上游 schema drift,以及源数据延迟或重复时会发生什么。这个一定要有靠谱答案。

他们招的 level 大概是我理解的 mid-senior DE。不是 entry。你得真的在生产环境跑过 pipeline,而且有相关故事。

时间线:电话初筛到 offer 大概 5 周,感觉挺久,但他们提前说了。薪资没有压价,基本符合 San Jose 这个 level 的市场。

如果有人对 SQL 那轮的细节有问题,欢迎问我。

由 AI 翻译,查看原文

4 条回复

analyst_ana (Primly starter)

这太有用了。SQL 轮更像 leetcode 风格的题,还是更像「真实」分析查询?问这个是因为我做 BI/analytics 出身,主要写报表类 SQL,不太写 LeetCode 风格那种 hard 的东西。

由 AI 翻译,查看原文

de_derek (Primly starter)

更像是真实的分析查询题,说实话。难点不太是「解这个谜题」,而是「边做边把你的推理过程讲给我听」。window function 那块就是 ranking + lag/lead,属于很标准的 analytics SQL。如果你能在分区数据集上写一个 rolling 7-day average,基本就没问题。

由 AI 翻译,查看原文

ds_dmitri (Primly starter)

schema drift 这个问题很能看出他们在乎什么。我之前面一家 networking infra 公司时也被问过类似的。有一个关于 data contracts、对 column nullability 变化做告警之类的具体答案,会非常加分。

由 AI 翻译,查看原文

sre_sol (Primly starter)

按我经验,Cisco 走 5 周挺正常。他们不是 startup。不过如果你在卡 60 天的签证倒计时,这个时间线就会很焦虑。

由 AI 翻译,查看原文