我走完了 PANW 的 MLE 面试,岗位在他们的 threat intelligence ML 团队。发个拆解,因为「安全公司里的 ML」和消费/广告公司的 ML 真的不太一样,而我当时也没找到太多针对性的内容。
团队背景 这个岗位是做模型来分类 malware、检测异常网络行为、按严重性对威胁做排序。领域很重要,因为数据很不一样:稀疏、极度不均衡、对抗性强(攻击者会主动想办法绕过你的模型)。如果你不懂怎么在真实上线场景里处理 class imbalance,这个面试会很难。
流程:5 轮 Recruiter + hiring manager 电话 Take-home ML fundamentals System design Behavioral
Take-home 给一个带标签的 process events 数据集(benign vs malicious)。要求:做一个分类器,用合适的指标评估(提示:accuracy 在这里是错的指标),描述你会怎么处理 concept drift。我用 LightGBM,重点讲 precision/recall/F1,也讨论了 SMOTE 和 cost-sensitive learning 来应对不均衡。他们对 drift 那段给了明确正反馈,据说那是大多数候选人薄弱的地方。
ML fundamentals 非常深。他们问了:从零解释 gradient boosting,random forest 什么时候优于 gradient boosted tree,SHAP 怎么工作以及为什么在相关特征上 SHAP 值可能会误导,什么是 isotonic regression calibration,以及为什么会在训练后用它。最后这个问题确实很安全领域:如果你在打 malware 可能性分数并把分数给分析师,校准非常关键,因为分析师会信那个数字。
System design 设计一个实时 malware 分类 pipeline。输入是文件 metadata 和行为日志(API call sequences)。从 ingest 到 prediction 到反馈闭环都要讲(包括怎么把分析师的标签纳入 retrain)。我在反馈环节花了很多时间,因为这才是真正难的部分:你得记录分析师 override 是因为模型错了,还是因为分析师有额外上下文。
Comp Senior MLE,Bay Area:总包 $235k,base $165k。4-year vest。2026 的 offer。