Samsung · Primly 社区

Samsung data scientist 面试(SQL + case + stats):mid-senior DS 岗位的流程长什么样

analyst_ana (Primly starter) · 4 条回复

我在 2026 Q1 走完了 Samsung 的 DS 面试流程,面的是他们 SmartThings analytics team 上一个 mid-senior 的岗位。总共 4 轮,按类型拆一下。

SQL 轮(60 分钟): 比我做过的大多数 SQL 轮都难,不只是 join 和 aggregate。他们给了一个用户设备事件的 schema(deviceid, eventtype, timestamp, session_id),然后让我做: 找出在 7 天窗口内与 3+ 种不同 device type 互动过的用户 按 engagement rate 排名设备,其中 engagement = 每个 active session 的事件数 写一个 query,识别“在没有用户主动操作的情况下结束”的 session(需要从 event type 序列推断)

最后一题需要 window function,还要非常仔细地推理事件顺序。我用的是 postgres 语法(他们说任何方言都行)。

statistics + case 轮(60 分钟): 两个面试官。前半段是 stats 问题:他们问了一个新 SmartThings 功能的 A/B test 设计(如何处理同一 household 下设备同时出现在 test 和 control 的情况),然后让我用通俗英语解释 p-value,并举一个“统计显著但不应该影响产品决策”的场景。后半段是一个简短的产品 case:“一个新的 Samsung TV 功能在前 30 天 adoption 是 20%,但到第 90 天掉到 5%。发生了什么,你会查什么?”他们想看分析能力和产品直觉。

ML/modeling 轮(60 分钟): 把一个过往项目细讲(他们先看了我的简历,然后挑了一个具体项目)。追问很多:为什么选这个模型、怎么处理 class imbalance、现在回头看会怎么做。然后还有个短的白板题:设计一个模型预测智能设备是否会在未来 72 小时 offline。他们在意 feature、label 怎么定义,以及评估指标怎么选(precision vs recall 的取舍)。

behavioral(45 分钟):常规。和 stakeholder 沟通、模糊问题的 framing、反对 PM 决策等。

整体最难的是 SQL window function 那题,在时间压力下做。如果你这块生疏,面之前一定要练。

由 AI 翻译,查看原文

4 条回复

analyst_ana (Primly starter)

A/B 测试里的同住污染问题真的是个很好的问题。我从来没想过设备公司会有这个情况,但完全说得通:家里一个人拿到了这个功能,家里所有设备都会受影响。你当时怎么回答的?

由 AI 翻译,查看原文

sdr_sky (Primly starter)

我说可以在 household 或 account 层面随机,而不是在 device 层面,然后也承认这样会让有效 N 变小。我还提了如果有 exposure 前的数据,也可以用 difference-in-differences。他们看起来更想确认我理解 clustering 的问题,而不一定要我给出完美答案。

由 AI 翻译,查看原文

de_derek (Primly starter)

那个 event sequence 的 SQL 题在限时下太狠了。「session ended without user-initiated action」要求你先定义 session 里最后一个 event 应该长什么样,还要决定在一个时间窗口内缺少某种 event type 算不算。这既是 data modeling 的判断题,也是 SQL 题。

由 AI 翻译,查看原文

ml_mike (Primly starter)

把 device churn prediction 当建模练习,其实是个很干净的面试领域。你有时间序列的传感器数据、有明确的故障事件作为 label,还有真实的 precision/recall 取舍(false negatives = 设备意外离线,false positives = 不必要的维护请求)。他们这个题选得不错。

由 AI 翻译,查看原文