上个月刚做完 oracle 的 onsite,岗位是 senior SRE,cloud reliability team。现在说 onsite 其实有点名不副实了,全程视频面试,一天内连续四个 45 分钟的 session,中间两次 10 分钟休息。
block 1:技术深挖。基本是偏可靠性的 system design + 架构讨论。他们给了个场景:某个 oracle cloud service 的 error rate 升高、latency 飙升,而且有一个 region 比其他 region 更严重。让我讲你会怎么排查和响应。这就是他们版本的 incident response 模拟。他们想看的是:你对监控和指标的直觉、你会先看哪里、incident 中怎么沟通、事后怎么写 root cause 复盘。
block 2:coding / 技术问题解决。即使是 SRE 也有 coding 环节。中等难度,写一个函数,把 log entry 按 error code 在不同时间 bucket 里做解析和聚合。可以用 python 或 go,我用的是 python。不是 leetcode,就是很实用的脚本题,SRE 日常确实会写。
block 3:behavioral / leadership。经典 behavioral:讲一次你如何提升系统可靠性;一次你因为安全原因顶住 deadline;一次你跟一个一直把你服务弄坏的 dev team 合作的经历。他们打分挺严格的,我能看出来 interviewer 在记具体细节。
block 4:hiring manager 对话。不是那种「看看你是不是 culture fit」的闲聊。hiring manager 显然看过前三轮的 notes,追问都很犀利。他也讲了团队 roadmap 和当前挑战。更像真实交流,不像在被审。
最大意外:对具体性的要求非常高。oracle 不要模糊的事故故事。他们要:error rate 是多少,latency p99 是多少,修复用了多久,postmortem 的 action item 是什么。全程都要有数字。
注:整天大概 5 小时。我面完直接累瘫。注意节奏。