实验、隐私、合规与指标决策闭环
本册定位:本篇只讲如何把观察问题转成可证伪实验、如何在隐私与合规约束内取得证据,以及如何把结果纳入“发现—假设—干预—验证—复盘”决策闭环。指标合同、事件身份和质量发布分别复用 指标语义事实卡、事件模型与数据契约 和 数据质量与重算。项目场景仅是 E2(已有材料映射),全部数字均为 E3(演练证据),没有原始实验记录、审批、配置和样本明细支撑的线上结论均为 E0(待核对)。
![]()
正式图的 PlantUML(统一建模语言)源见 metric-experiment-privacy.puml。图中先过目的与权限门禁,再冻结分配和证据;出现 SRM(样本比例不匹配)或护栏越界时停止扩面,只有完整窗口结束后才进入决策和复盘。
1. 证据边界与全章控制合同
| 等级 | 本册可用来源 | 可表达内容 | 禁止表达内容 |
|---|---|---|---|
| E1 | 本地文件、审计命令、真实渲染图 | 文件、结构、链接和渲染事实 | 未读取的生产策略和效果 |
| E2 | 简历与既有项目分册 | 候选实验、隐私和决策方案 | 已在线上采用、已改善具体比例 |
| E3 | 统计机制、公式、人造数据 | 样本量、效应、偏差与决策演练 | 生产基线、客户承诺或真实事故 |
| E0 | 当前缺少源码、审批、实验明细和原始结果 | 待核对阈值、责任人、制度和结果 | 任何确定性线上实验结论 |
| 启动前必须冻结 | 运行中必须监控 | 结束后必须交付 |
|---|---|---|
| 问题、假设、随机化单元、资格、主指标、护栏、样本计划 | 分配比例、暴露、数据质量、护栏、污染、异常和隐私访问 | 效应与区间、偏差边界、决策、回退、删除、审计和复盘 |
1.1 从业务问题到可证伪假设
热门面试题
问题(基础题):什么样的问题适合进入实验?
- 考点:可干预、可观测、可证伪。
- 回答思路:先确认存在可控动作,再定义结果与失败证据。
- 详细答案:适合实验的问题要能明确改变一个干预、找到可比对象,并在有限窗口内观察结果和护栏。假设应写成“对哪类对象做什么,相对什么基线,使哪个主指标朝何方向变化,同时哪些护栏不得恶化”。纯粹追问历史原因、不可逆高风险动作或样本极少的场景,不应硬套随机实验。
- 进阶追问:指标上涨目标能直接作为假设吗?
- 进阶回答:不能,还要写人群、干预、对照、机制、窗口、最小有意义变化和否定条件。
问题(原理题):为什么必须在看结果前冻结假设?
- 考点:事后解释与选择性报告。
- 回答思路:说明先看数据再挑指标会提高偶然命中概率。
- 详细答案:若结果出来后才选择人群、窗口、指标或方向,分析者可以从大量组合中挑到看似有利的一项,显著性失去原有错误率含义。预先冻结主假设、指标合同和排除规则,可以把确认性结论与探索性发现分开;探索结果仍有价值,但必须在新样本中再次验证。
- 进阶追问:运行中发现原假设写错怎么办?
- 进阶回答:停止或标记当前实验为探索性,版本化修改并重新规划,不能静默改题后沿用原结论。
问题(项目追问题):如何把 WMS(仓储管理系统)拣货拥堵写成实验假设?
- 考点:业务机制、主指标和护栏。
- 回答思路:以波次策略为干预,以正确完成为结果,以库存和质量为硬护栏。
- 详细答案:可以演练为:对满足同仓、同班次和相近订单结构的出库波次,采用新分组策略,相对旧策略降低高分位完成时长;同时错拣率、库存差异、超时交接和人工干预不得恶化。随机化单元不能直接选订单,否则同一波次内两种策略相互影响;真实阈值、收益和上线事实均为 E0。
- 进阶追问:只看平均拣货时长够吗?
- 进阶回答:不够,还要看尾部时长、正确性、拥堵外溢、班次结构和库存守恒。
| 假设字段 | 必答问题 | 失败示例 |
|---|---|---|
| 对象 | 谁有资格进入 | 把所有仓和所有班次混在一起 |
| 干预与对照 | 唯一主动差异是什么 | 同时改策略、设备和排班 |
| 机制 | 为什么可能影响结果 | 只写“预计提升” |
| 主指标 | 哪个结果决定取舍 | 事后从多个指标挑最高者 |
| 护栏 | 哪些损害不可交换 | 只看速度不看错拣和库存 |
| 否定条件 | 什么证据会推翻假设 | 无论结果如何都解释成成功 |
sequenceDiagram
participant 业务 as 业务责任人
participant 分析 as 指标分析
participant 评审 as 实验评审
participant 证据 as 证据仓
业务->>分析: 提交现象、损失与候选动作
分析->>分析: 固定对象、机制、结果和替代解释
分析->>评审: 提交主假设、护栏和否定条件
alt 不可干预或不可证伪
评审-->>业务: 改为观察研究或风险评审
else 可进入实验
评审->>证据: 冻结假设版本与指标合同
评审-->>业务: 批准样本与执行设计
end图解读:节点是业务、分析、评审与证据仓;箭头把现象压缩成可否定命题;前提是干预可控、结果可观测;正常路径冻结版本后设计实验;失败路径转观察研究;结论是实验从问题定义开始,而非从流量切分开始。
数据演绎 1:把模糊目标变为可证伪合同
演练(E3):某仓旧策略下 1,000 个波次的高分位完成时长为 48 分钟,业务认为至少缩短 5 分钟才有价值;主假设写为新策略将同资格波次的高分位缩短不少于 5 分钟,错拣率不得增加 0.2 个百分点,库存差异必须为 0。输入是资格、策略版本、完成时间、错拣和库存事实;观测信号是主效应与两项护栏;若只缩短 2 分钟或库存出现差异,状态转为“不采纳”;结论不是“新策略有效”,而是形成可被数据否定的演练合同。
1.2 随机化单元、资格与分层
热门面试题
问题(基础题):什么是随机化单元?
- 考点:分配对象与独立性。
- 回答思路:区分用户、订单、仓库、班次、设备和时间片。
- 详细答案:随机化单元是被稳定分配到对照或干预的一组最小对象。选择原则是同一单元不能同时看到两种策略,单元之间的干预影响应尽量小,且分配键在实验期内稳定。前台功能常按账户,仓内策略可能按波次或班次,报警治理可能按设备组;随机化单元不一定等于最终分析单元。
- 进阶追问:为什么不能每次请求都随机?
- 进阶回答:同一对象会来回切换,产生学习、缓存和状态污染,也无法解释累计结果。
问题(原理题):分层随机与简单随机如何选择?
- 考点:基线平衡与方差。
- 回答思路:对强影响且实验前已知的变量分层,避免小样本结构失衡。
- 详细答案:简单随机在大样本下通常能平衡已知与未知因素;样本较小、仓库规模或线路差异很强时,可先按仓型、班次、地区等少量预先变量分层,再在层内随机。分层变量不能由干预后结果决定,也不能过多导致单元稀疏;分析时要保留层信息并按设计估计。
- 进阶追问:看到组间不平衡后再改分层可以吗?
- 进阶回答:不能把事后修饰冒充预先设计,可做敏感性分析并在下一轮重新随机。
问题(项目追问题):IoT(物联网)报警降噪按什么单元随机?
- 考点:污染与安全边界。
- 回答思路:按共享规则和处置链选择设备组或站点,严重报警保留安全通道。
- 详细答案:若同一站点设备共享聚合、值班和通知配额,按单设备随机会让两组互相挤占资源,宜按站点或规则组随机,并按设备类型和历史报警负荷分层。严重安全报警不能仅为实验被抑制,应保持硬穿透和人工复核。真实分组、规则和风险阈值需审批证据,当前只能给 E2 候选设计。
- 进阶追问:站点数太少怎么办?
- 进阶回答:延长观察、采用分阶段切换或可信观察设计,并降低因果结论强度,不能把设备条数当独立样本。
| 场景 | 候选随机化单元 | 主要污染风险 | 分层变量示例 |
|---|---|---|---|
| 支付页面 | 账户或支付单 | 同账户跨端切换 | 渠道、地区、历史成功层 |
| WMS(仓储管理系统)波次 | 波次或班次 | 同巷道拥堵外溢 | 仓型、班次、订单难度 |
| Runner(执行器)调度 | 任务队列或租户 | 共享工作池抢占 | 任务类型、历史耗时 |
| IoT(物联网)报警 | 站点或规则组 | 通知配额和值班共享 | 设备类型、历史报警负荷 |
sequenceDiagram
participant 资格 as 资格服务
participant 分层 as 分层器
participant 随机 as 随机分配
participant 版本 as 版本路由
participant 审计 as 分配审计
资格->>分层: 提交稳定单元与实验前变量
分层->>随机: 在每个预定义层内请求分配
随机->>审计: 写入单元、组别、盐值与版本
随机->>版本: 返回稳定组别
alt 单元已分配
版本->>审计: 复用原组别并记录暴露
else 资格变化
版本-->>资格: 不静默换组,进入规则裁决
end图解读:参与者覆盖资格、分层、随机、路由和审计;箭头保证同一稳定单元复用分配;前提是分层变量来自实验前;正常路径稳定暴露;失败路径在资格变化时停止静默换组;结论是随机化需要可重放的分配证据。
数据演绎 2:簇级随机不能把明细当独立样本
演练(E3):12 个仓各有 1,000 个订单,若按仓随机,独立随机化单元是 12 个仓而非 12,000 个订单。假设仓内订单相关系数为 0.02,平均簇大小为 1,000,设计效应约为 1 + (1000 - 1) × 0.02 = 20.98,名义 12,000 条明细的有效信息量约为 12000 / 20.98 ≈ 572。输入为簇数、簇大小和相关性;观测信号是组间仓结构;状态从“订单量很大”转为“簇数不足”;结论是不能用明细条数制造虚假把握度,相关系数也只是 E3 假设。
1.3 样本量、MDE(最小可检测效应)与统计功效
热门面试题
问题(基础题):样本量由哪些因素决定?
- 考点:基线、方差、效应、错误率和功效。
- 回答思路:解释想发现越小变化、指标越波动,所需样本越多。
- 详细答案:样本量取决于主指标类型与基线、自然方差、MDE(最小可检测效应)、允许的一类错误率、目标统计功效、分配比例以及随机化单元相关性。还要把资格率、暴露率、流失、簇设计和实验周期纳入。样本量是设计输入,不应在看见结果后反推到恰好显著。
- 进阶追问:MDE(最小可检测效应)越小越专业吗?
- 进阶回答:不是;小到没有业务价值只会扩大成本,应由收益、风险和执行代价共同确定。
问题(原理题):统计功效不足会造成什么问题?
- 考点:二类错误与不稳定估计。
- 回答思路:区分“没有证据”与“证明没有效应”。
- 详细答案:统计功效是给定真实效应达到 MDE(最小可检测效应)时,检验能发现它的概率。功效不足会让真实有价值的变化经常不显著,已显著结果也可能效应夸大。未显著不能直接说两组等价;要看置信区间是否已排除业务上重要的好处和损害,若没有排除,只能说证据不足。
- 进阶追问:怎样证明两方案近似等价?
- 进阶回答:预先定义等价界值,使用等价或非劣设计,并确认区间整体落在可接受范围内。
问题(项目追问题):支付成功率实验如何估样本量?
- 考点:支付单元、基线和资金护栏。
- 回答思路:以支付单为分析对象,按账户或支付单稳定随机,先取历史方差再定有价值变化。
- 详细答案:先冻结“可核对支付成功”的分子、合格发起分母、渠道与窗口,再用历史稳定期估计基线和日波动;业务给出值得承担改造与资金风险的 MDE(最小可检测效应),统计侧设错误率和功效,最后根据资格率与暴露率反推流量和周期。金额差异、重复扣款、未知态和退款异常必须作为硬护栏。
- 进阶追问:能用支付请求数代替支付单数吗?
- 进阶回答:不能直接替代,重试会让同一支付单产生相关请求并放大样本,应按稳定业务实体去重。
| 设计输入 | 方向 | 设计含义 | 常见误区 |
|---|---|---|---|
| 更小 MDE(最小可检测效应) | 样本增大 | 希望识别更细变化 | 变化虽可测但无业务价值 |
| 更高自然方差 | 样本增大 | 指标噪声更强 | 只看均值不看分布 |
| 更高统计功效 | 样本增大 | 降低漏掉真实效应概率 | 把高功效当绝对真理 |
| 簇内相关增强 | 有效样本下降 | 同仓、同站点对象不独立 | 把明细条数当独立样本 |
| 暴露率下降 | 所需资格流量增大 | 分配不等于真正看到干预 | 只按分配人数规划周期 |
sequenceDiagram
participant 业务 as 业务与风险
participant 历史 as 历史数据
participant 统计 as 样本规划
participant 评审 as 实验评审
业务->>统计: 给出最小有价值变化和失败成本
历史->>统计: 提供基线、方差、资格率与相关性
统计->>统计: 计算名义样本并修正簇、暴露和流失
统计->>评审: 提交样本、周期、功效与假设
alt 周期或风险不可接受
评审-->>业务: 放弃、扩大效应或改设计
else 计划可执行
评审-->>统计: 冻结样本计划和停止规则
end图解读:节点由业务、历史、统计和评审组成;箭头把业务价值与数据波动共同输入样本规划;前提是主指标合同稳定;正常路径冻结计划;失败路径调整设计而非偷看后提前结束;结论是样本量首先是业务与风险选择。
数据演绎 3:两比例近似样本规划
演练(E3):某流程基线完成率假设为 80%,业务认为提升 3 个百分点才值得上线,采用双侧 5% 一类错误率与 80% 统计功效。按两独立比例近似,每组约需 2 × (1.96 + 0.84)^2 × 0.8 × 0.2 / 0.03^2 ≈ 2,788 个独立对象;若实际暴露率 70%、预计 5% 数据无效,则每组资格对象约需 2788 / 0.70 / 0.95 ≈ 4,192。输入、公式和状态变化全部是演练;结论是规划应从有效独立样本反推资格流量,而非宣称真实支付或仓内基线。
1.4 分配、暴露、ITT(意向处理分析)与分析集合
热门面试题
问题(基础题):分配和暴露有什么区别?
- 考点:被分组不等于看见干预。
- 回答思路:以路由成功、页面展示或规则真正执行区分两个事件。
- 详细答案:分配表示稳定单元被指定到某组,暴露表示干预版本确实作用于对象。网络失败、资格变化、缓存、人工绕过或任务未执行都可能导致已分配但未暴露。两者要分别记录,并优先用 ITT(意向处理分析)保持随机化可比性,再把暴露分析作为机制诊断,不能只挑成功暴露者比较。
- 进阶追问:为什么只分析暴露者会偏?
- 进阶回答:是否暴露往往与设备、活跃度或系统健康相关,筛选后两组不再保持随机可比。
问题(原理题):ITT(意向处理分析)为什么保守但重要?
- 考点:随机化保护与实际可交付效果。
- 回答思路:按初始分配归组,包含未完全执行带来的稀释。
- 详细答案:ITT(意向处理分析)按最初随机分配计算结果,不因未暴露、交叉或中途退出随意换组,因此保留随机化带来的可比性,也估计在真实执行摩擦下“分配该策略”的总体效果。它可能因执行失败稀释机制效应,但这种稀释本身揭示了方案能否稳定交付;机制效应需要额外假设和分析。
- 进阶追问:执行故障很严重时还要报告吗?
- 进阶回答:要,同时报告分配、暴露、故障和 ITT(意向处理分析)结果,并判断实验是否已失去解释资格。
问题(项目追问题):Runner(执行器)调度实验如何定义暴露?
- 考点:配置下发与实际执行分离。
- 回答思路:只有任务被新策略领取并完成调度决策才算暴露,失败回退单独记录。
- 详细答案:分配可按租户或队列稳定落组;配置下发不等于暴露,任务必须由指定调度版本完成选择并写入策略版本、候选节点和结果。因回退走旧策略的任务仍按原分配进入 ITT(意向处理分析),并单列交叉率。积压、失败、重复执行、下游限额和核心任务时限是护栏。
- 进阶追问:任务重试算多个样本吗?
- 进阶回答:不能直接算,分析实体应是稳定任务或业务结果,尝试次数是机制与成本指标。
| 集合 | 归组规则 | 主要用途 | 主要风险 |
|---|---|---|---|
| 资格集合 | 满足启动前规则 | 解释覆盖边界 | 运行中静默改资格 |
| 分配集合 | 按稳定随机结果 | 守住可比性 | 分配日志缺失 |
| 暴露集合 | 干预确实生效 | 诊断机制和交付 | 暴露选择偏差 |
| ITT(意向处理分析)集合 | 按初始分配 | 估计可交付总体效果 | 效应被执行失败稀释 |
| 按方案集合 | 按实际执行策略 | 辅助机制分析 | 交叉原因与结果混杂 |
sequenceDiagram
participant 单元 as 稳定业务单元
participant 分配 as 分配服务
participant 执行 as 干预执行
participant 事件 as 事实事件
participant 分析 as 分析层
单元->>分配: 请求并获得固定组别
分配->>事件: 写入分配事实
分配->>执行: 下发目标版本
alt 干预真正生效
执行->>事件: 写入暴露与结果
else 失败或回退
执行->>事件: 写入未暴露、交叉与原因
end
事件->>分析: 构建资格、分配、暴露和结果集合
分析->>分析: 主报 ITT,辅报机制与交叉诊断图解读:参与者从业务单元到分析层;箭头分别产生分配、暴露和结果事实;前提是稳定身份与版本可追溯;正常路径记录真实生效;失败路径仍保留原分配和回退原因;结论是不能用暴露成功者替换随机总体。
数据演绎 4:暴露筛选如何改变结论
演练(E3):两组各分配 1,000 个任务,对照完成 800 个,干预完成 820 个,ITT(意向处理分析)差为 2 个百分点。干预组只有 700 个真正暴露,其中 600 个完成,若只看暴露者得到 600 / 700 = 85.71%,会与对照 80% 比出 5.71 个百分点;但未暴露往往因节点故障或队列类型不兼容,并非随机缺失。输入是分配、暴露和完成事实;观测信号是 30% 未暴露;状态转为“执行质量需排查”;结论是 5.71 个百分点不能作为随机因果效应。
1.5 效应量、p-value(显著性概率值)与置信区间
热门面试题
问题(基础题):p-value(显著性概率值)回答什么?
- 考点:条件概率与错误解释。
- 回答思路:先固定“无差异”模型,再解释当前或更极端数据的相容程度。
- 详细答案:p-value(显著性概率值)是在零假设及检验前提成立时,观察到当前或更极端数据的概率。它不是“假设为真的概率”,也不是结果可复现、效应有业务价值或没有偏差的保证。统计判断必须同时报告绝对与相对效应、置信区间、样本质量、护栏和设计边界。
- 进阶追问:小于 0.05 就必须上线吗?
- 进阶回答:不必须;还要看区间、业务价值、风险、成本、多重检验、偏差和可推广性。
问题(原理题):置信区间为什么比单个显著性标签更有信息?
- 考点:方向、大小与不确定性。
- 回答思路:用区间是否覆盖无效应、有价值和有害界值来决策。
- 详细答案:置信区间给出与数据和模型相容的效应范围,可以同时判断方向、精度和最坏可能损害。区间跨零不等于证明无差异;区间很窄且整体落在无业务价值区,才支持“即使有变化也不值得”。区间很宽则说明证据不足,应补样本、降低结论或重新设计。
- 进阶追问:95% 置信区间表示真值有 95% 概率在其中吗?
- 进阶回答:经典定义下不是;它指重复抽样并按同一方法构造区间时,长期有 95% 覆盖真值。
问题(项目追问题):库存防超卖实验能接受“平均更好”吗?
- 考点:硬不变量与分布尾部。
- 回答思路:正确性护栏一票否决,性能同时看区间和尾部。
- 详细答案:库存可售为负、重复扣减和账实差属于硬护栏,不能被平均延迟改善抵消。性能主结果可以报告绝对毫秒差、相对变化和置信区间,并按热点商品、仓库和高分位检查。即使平均值显著改善,只要正确性护栏出现无法解释的差异,就应停止或回退并保全证据。
- 进阶追问:零次超卖能证明绝对安全吗?
- 进阶回答:不能,只能说明当前样本未观察到;还要结合暴露量、上界、压力和故障注入验证。
| 结果维度 | 应报告内容 | 不能推出 |
|---|---|---|
| 绝对效应 | 相差多少单位或百分点 | 自动具有业务价值 |
| 相对效应 | 相对基线变化比例 | 低基线下实际影响很大 |
| 置信区间 | 相容效应范围与精度 | 真值的直接概率分布 |
| p-value(显著性概率值) | 与零假设相容程度 | 假设为真概率、复现概率 |
| 护栏结果 | 风险是否越界 | 未越界即证明无风险 |
sequenceDiagram
participant 数据 as 冻结数据集
participant 估计 as 效应估计
participant 区间 as 区间计算
participant 业务 as 业务阈值
participant 决策 as 决策评审
数据->>估计: 输入两组结果与设计信息
估计->>区间: 输出绝对、相对效应和标准误
业务->>决策: 提交有价值界值与有害界值
区间->>决策: 提交区间和检验结果
alt 区间含重大损害或证据过宽
决策-->>业务: 回退、补证据或拒绝扩面
else 区间排除重大损害且具业务价值
决策-->>业务: 进入综合权衡而非自动上线
end图解读:节点把数据估计、统计区间和业务阈值分开;箭头要求统计证据与价值判断会合;前提是数据冻结且设计有效;正常路径进入综合评审;失败路径因损害或不确定性停止;结论是显著性不是发布开关。
数据演绎 5:同一显著结果可能没有业务价值
演练(E3):对照完成率 80.0%,干预 80.8%,绝对差 0.8 个百分点,相对提升 1%;假设 95% 置信区间为 [0.1, 1.5] 个百分点且 p-value(显著性概率值)小于 0.05。若预先定义 MDE(最小可检测效应)为 2 个百分点,则区间上界仍未稳定覆盖业务目标。输入为两组率、区间、价值阈值和护栏;观测信号是方向偏正但效应偏小;状态应为“统计上可区分、业务上不采纳或继续验证”,不能宣称成功。
1.6 多重检验、探索分析与结论分级
热门面试题
问题(基础题):为什么同时看很多指标容易误报?
- 考点:家族错误率。
- 回答思路:每次检验都有偶然命中机会,次数增加后至少一次误报概率上升。
- 详细答案:若每项都按 5% 阈值独立判断,做 20 次检验时至少一次偶然显著的概率约为
1 - 0.95^20,接近 64%。指标、人群、窗口、方向和中途查看都在增加选择空间。因此必须预先指定一个主指标和少量关键护栏,其他结果标为探索性,并按决策目标控制错误率。 - 进阶追问:所有指标都做严格校正吗?
- 进阶回答:确认性结论需要;诊断和探索可披露未校正结果,但不能升级为上线因果证据。
问题(原理题):Bonferroni(邦费罗尼校正)与 FDR(错误发现率)适用边界是什么?
- 考点:控制目标与保守性。
- 回答思路:前者控制至少一次误报,后者控制已发现结果中的预期错误比例。
- 详细答案:Bonferroni(邦费罗尼校正)把总错误预算除以检验数,简单且保守,适合少量高风险确认性结论。FDR(错误发现率)控制被判为发现的一组结果中预期错误比例,更适合大量探索信号,但不保证每一个发现可靠。方法选择、检验族和排序规则都应在看结果前定义。
- 进阶追问:指标相关时还能校正吗?
- 进阶回答:可以,简单方法仍可保守有效;也可使用考虑相关结构的方法,但必须预先说明和验证。
问题(项目追问题):跨境履约按很多线路下钻时怎样避免挑结果?
- 考点:总体主结果、分群和探索验证。
- 回答思路:先固定总体或预定义线路,事后异常线路只生成下一轮假设。
- 详细答案:先把总体准时且正确妥投作为主结果,并预定义少数业务关键线路与承运商分层;运行后发现某条线路显著改善,只能标为探索性,还要检查样本量、结构变化、迟到轨迹和承诺版本。下一轮在新时间窗或新对象上针对该线路复验,不能把同一数据既用于发现又用于确认。
- 进阶追问:总体不显著但一个大线路显著能上线吗?
- 进阶回答:先确认该线路是否预定义、交互是否可信、护栏是否通过,再限定范围复验,不能直接全量。
| 分析类型 | 目标 | 错误控制 | 允许结论 |
|---|---|---|---|
| 主指标确认 | 支撑核心决策 | 预先分配错误预算 | 可进入综合上线评审 |
| 关键护栏 | 防止重大损害 | 硬门禁或单独控制 | 越界立即停止 |
| 预定义分群 | 检查异质性 | 纳入检验族 | 仅在设计覆盖范围解释 |
| 探索下钻 | 发现后续假设 | 披露未校正和样本量 | 不作确认性因果结论 |
| 复现实验 | 用新样本确认 | 新的预注册计划 | 支持范围化决策 |
sequenceDiagram
participant 计划 as 分析计划
participant 数据 as 实验数据
participant 确认 as 确认性分析
participant 探索 as 探索性分析
participant 复验 as 新样本复验
计划->>确认: 分配主指标、检验族和错误预算
数据->>确认: 提交冻结结果
数据->>探索: 提交维度与异常样本
确认-->>计划: 输出可决策结论与区间
探索-->>计划: 输出候选机制和未校正发现
alt 探索发现值得行动
计划->>复验: 创建新假设、样本与停止规则
复验-->>计划: 用独立证据确认或否定
end图解读:参与者将确认、探索和复验分流;箭头保证错误预算只服务预定义结论;前提是分析计划先于结果;正常路径输出确认结论;探索路径必须进入新样本;结论是下钻用于发现,不得偷换成确认。
数据演绎 6:二十次检验的偶然命中
演练(E3):在所有真实效应均为零且近似独立的假设下,20 个指标分别用 5% 阈值,至少一个偶然显著的概率为 1 - (1 - 0.05)^20 ≈ 64.15%。若采用 Bonferroni(邦费罗尼校正),单项阈值为 0.05 / 20 = 0.0025。输入是检验数和总错误预算;观测信号是结果中最小的概率值;状态从“发现亮点”转为“先检查检验族和预定义”;结论只说明选择空间会放大误报,不说明任何真实项目结果。
1.7 护栏指标、停止实验与连续偷看
热门面试题
问题(基础题):护栏指标与主指标有什么区别?
- 考点:收益与不可交换损害。
- 回答思路:主指标回答是否值得,护栏回答是否允许继续。
- 详细答案:主指标对应核心假设和价值方向;护栏保护资金、库存、质量、安全、隐私、稳定性和成本等不能被平均收益抵消的边界。护栏要有口径、责任人、刷新频率、阈值、持续时长和动作。硬护栏越界可立即停验,软护栏异常先冻结扩面并复核数据资格。
- 进阶追问:护栏越多越安全吗?
- 进阶回答:不一定,过多噪声护栏会频繁误停;应围绕失败成本选择少量可行动指标并分级。
问题(原理题):为什么每天看到显著就停会破坏错误率?
- 考点:连续偷看与可选停止。
- 回答思路:每次查看都增加在随机波动高点结束的机会。
- 详细答案:固定样本检验的错误率建立在预定结束时分析;若每天查看并在第一次显著时停止,相当于重复多次检验且选择最有利时点,误报概率上升。解决方式是预设固定样本与窗口,或使用经设计的序贯方法和错误预算。安全护栏可随时监控,但不能把业务主结果随时偷看当停验规则。
- 进阶追问:结果明显有害也必须等满样本吗?
- 进阶回答:不必,预先定义的安全停止线应立即触发;停止原因和已看数据必须完整记录。
问题(项目追问题):支付实验应设置哪些停止条件?
- 考点:资金硬门禁、数据资格和业务损害。
- 回答思路:优先重复扣款、金额不一致、未知态、错误率和 SRM(样本比例不匹配)。
- 详细答案:演练中可把重复扣款、资金账与渠道账不平、金额币种错误设为单事件硬停;未知态年龄、退款异常和渠道错误持续越界设为冻结扩面;SRM(样本比例不匹配)、分配日志缺口或主结果数据不完整则停止解释而非判输赢。具体阈值必须由风险与生产证据确定,当前为 E0。
- 进阶追问:停止后能直接选择对照组吗?
- 进阶回答:先执行业务止损和对账,保留分配与副作用证据,再决定回退、修复或终止。
| 停止类型 | 触发信号 | 立即动作 | 后续状态 |
|---|---|---|---|
| 安全硬停 | 资金、库存、安全或隐私重大事件 | 停止干预并止损 | 不因主指标好转恢复 |
| 护栏软停 | 风险持续越过预设线 | 冻结扩面、复核数据 | 评审后恢复或终止 |
| 数据资格停 | SRM(样本比例不匹配)、缺失、污染 | 停止因果解释 | 修复后重启或降级 |
| 无望停止 | 序贯规则显示难达目标 | 节省继续成本 | 记录规则和边界 |
| 计划结束 | 样本与完整窗口均达到 | 冻结数据和分析 | 进入决策而非自动上线 |
sequenceDiagram
participant 监控 as 独立监控
participant 护栏 as 护栏裁决
participant 执行 as 干预执行
participant 证据 as 证据保全
participant 评审 as 实验评审
监控->>护栏: 提交安全、质量、比例与业务信号
alt 硬护栏越界
护栏->>执行: 立即停验和回退
护栏->>证据: 冻结分配、样本与副作用
else 软护栏或数据资格异常
护栏->>执行: 冻结扩面
护栏->>评审: 请求复核与恢复条件
else 计划窗口完成
护栏->>证据: 冻结正式分析版本
证据->>评审: 提交完整结果
end图解读:节点分离监控、裁决、执行、证据和评审;箭头赋予安全信号即时停止权;前提是停止线预先定义;正常路径在计划窗口冻结;失败路径回退或暂停扩面;结论是安全监控与主结果偷看必须分治。
数据演绎 7:早期波动不等于稳定胜出
演练(E3):计划每组 5,000 个对象,首日每组只有 500 个,对照完成 390 个,干预 410 个,观察差为 4 个百分点;完整窗口结束后每组 5,000 个,对照 4,000 个,干预 4,030 个,差缩小到 0.6 个百分点。输入是预定样本、每日累计结果和完整业务周期;观测信号是效应随时间回落;状态从“早期领先”转为“未达到 2 个百分点 MDE(最小可检测效应)”;结论是首日显著或曲线领先不能替代预定停止规则。
1.8 SRM(样本比例不匹配)与 A/A(同版本随机对照检验)
热门面试题
问题(基础题):什么是 SRM(样本比例不匹配)?
- 考点:实际分配与计划比例偏离。
- 回答思路:先看分配层,再逐层看资格、曝光和结果缺失。
- 详细答案:SRM(样本比例不匹配)是观察到的组别数量与预先分配比例出现难以由随机波动解释的偏差。它通常提示哈希、缓存、资格、灰度、版本、日志丢失、机器人过滤或跨端身份问题。SRM(样本比例不匹配)不是业务效果,而是实验基础设施或数据资格告警;未解释前应停止因果结论。
- 进阶追问:比例接近 50:50 就一定没问题吗?
- 进阶回答:不一定,总体平衡可能掩盖某地区、版本或时段反向失衡,还要按预定义关键层检查。
问题(原理题):A/A(同版本随机对照检验)能验证什么?
- 考点:分配、采集与分析流水线。
- 回答思路:两组接收相同策略,预期只有随机波动,据此暴露系统偏差。
- 详细答案:A/A(同版本随机对照检验)把对象随机成两组但都执行同一版本,用于检查分配稳定、比例、暴露日志、指标计算、方差估计和误报率。它不能证明未来干预无污染,也不能保证所有小概率偏差都被发现;仍需覆盖完整业务周期和关键分层,并保留故障注入验证。
- 进阶追问:A/A(同版本随机对照检验)显著怎么办?
- 进阶回答:先查 SRM(样本比例不匹配)、指标和身份链路;即使纯随机偶发,也要按预设错误率解释而非随意重跑到不显著。
问题(项目追问题):Runner(执行器)实验出现 60:40 如何排查?
- 考点:分配到执行的分层守恒。
- 回答思路:核对资格、哈希、路由、队列、暴露和结果六层计数。
- 详细答案:先确认计划比例和生效版本,再按租户、队列、任务类型和时间片核对资格数、分配数、路由数、暴露数、完成数与丢弃数。常见原因包括某队列未加载新配置、分配键在重试时变化、旧缓存固定到对照、干预日志写失败或只保留完成任务。修复后应重新执行 A/A(同版本随机对照检验),原实验不直接续用。
- 进阶追问:补权重能挽救结果吗?
- 进阶回答:权重只能处理已知且可建模差异,不能替代对未知分配故障的根因和重新随机。
| 排查层 | 守恒问题 | 典型故障 | 决策 |
|---|---|---|---|
| 资格 | 两组是否来自同一资格规则 | 规则版本不一致 | 停止并重建资格 |
| 分配 | 计划比例是否守恒 | 哈希盐或键变化 | 原实验失效 |
| 路由 | 分配是否到达目标版本 | 缓存、灰度覆盖 | 修复路由并复验 |
| 暴露 | 是否同口径记录生效 | 一组漏埋点 | 停止结果分析 |
| 结果 | 缺失是否与组别相关 | 只记录成功对象 | 回源补全或重启 |
sequenceDiagram
participant 计划 as 分配计划
participant 资格 as 资格层
participant 分配 as 分配层
participant 暴露 as 暴露层
participant 结果 as 结果层
participant 裁决 as 质量裁决
计划->>资格: 下发比例、单元和生效版本
资格->>分配: 提交应分配对象总数
分配->>暴露: 提交各组路由计数
暴露->>结果: 提交生效、失败和交叉计数
结果->>裁决: 提交完成、缺失和护栏计数
alt 任一层比例或守恒异常
裁决-->>计划: 标记 SRM 并停止因果解释
else 全链路一致
裁决-->>计划: 允许进入效果分析
end图解读:参与者按资格、分配、暴露和结果逐层守恒;箭头用于定位比例从哪一层偏离;前提是每层有独立控制总数;正常路径进入效果分析;失败路径标记 SRM(样本比例不匹配);结论是只看最终人数无法定位实验失真。
数据演绎 8:50:50 计划下的比例异常
演练(E3):计划 10,000 个稳定单元按 50:50 分配,实际记录对照 5,300、干预 4,700。期望各 5,000,卡方统计量为 (5300-5000)^2/5000 + (4700-5000)^2/5000 = 36,远超常见随机波动范围。输入是计划比例和分配层计数;观测信号是 600 个净差;状态立即转为“SRM(样本比例不匹配),不可解释效果”;结论是先查资格、哈希、路由和日志,不能用显著主指标掩盖分配故障。
1.9 新奇效应、幸存者偏差与污染
热门面试题
问题(基础题):什么是新奇效应?
- 考点:短期行为与长期稳态。
- 回答思路:新变化引发注意、学习或抵触,早期效应未必持续。
- 详细答案:新奇效应是对象因功能刚变化而暂时更关注、尝试或反感,早期读数偏离长期稳态。处理方法包括覆盖完整业务周期、按暴露后时间分层、观察效应衰减,并在推广前保留回退。不能看到首周提升就外推到季度或所有新老对象。
- 进阶追问:效应衰减就说明功能没价值吗?
- 进阶回答:不一定,要看稳定后效应、学习成本、目标周期和业务价值,而非要求早期峰值永远保持。
问题(原理题):幸存者偏差为什么会夸大效果?
- 考点:干预后筛选。
- 回答思路:只观察留下者,会排除因干预退出、失败或不可观测的对象。
- 详细答案:若只分析完成任务、持续活跃或未退款对象,就把退出、失败和未知态从分母移除;而这些状态可能正由干预造成。应从随机分配总体出发,报告缺失、退出和删失,并对不可观测结果做边界或敏感性分析。按结果筛样本会破坏随机可比性。
- 进阶追问:删除机器人属于幸存者偏差吗?
- 进阶回答:若规则在实验前固定且与组别无关通常可以;事后按结果和组别差异删除则可能引入偏差。
问题(项目追问题):仓内策略实验会怎样互相污染?
- 考点:共享人员、设备、巷道与学习迁移。
- 回答思路:识别同班次共享资源和操作员跨组学习,提升随机化层级或隔离时段。
- 详细答案:同一班次里两种波次策略会共享拣货员、设备、巷道和补货能力;干预组减少拥堵可能让对照也受益,操作员学到新路线后又带回旧策略。可按班次、区域或仓随机,设置清洗期和策略版本标记,并观察跨组资源占用。若污染不可避免,应降低结论强度或使用分阶段切换设计。
- 进阶追问:污染只会让效果变小吗?
- 进阶回答:不一定,资源抢占可让对照更差,学习迁移可让差异缩小,方向取决于机制。
| 偏差 | 形成机制 | 诊断信号 | 处置 |
|---|---|---|---|
| 新奇效应 | 短期注意、学习或抵触 | 效应随暴露年龄变化 | 覆盖完整周期并分层 |
| 幸存者偏差 | 只保留成功、活跃或可见对象 | 退出与缺失组间不同 | 回到分配总体,做边界分析 |
| 污染 | 共享资源、跨组传播、状态串用 | 对照出现干预行为 | 提升随机化层级或隔离 |
| 历史效应 | 节假日、促销、故障同时发生 | 时间与组别交互 | 同期对照和完整周期 |
| 测量反应 | 监控或人工关注改变行为 | 被观察阶段异常改善 | 自动化采集和盲化复核 |
sequenceDiagram
participant 分配 as 随机分配
participant 干预 as 干预组
participant 对照 as 对照组
participant 共享 as 共享资源
participant 分析 as 偏差分析
分配->>干预: 下发新策略
分配->>对照: 保持旧策略
干预->>共享: 改变队列、人员或资源占用
共享-->>对照: 产生外溢或抢占
干预-->>对照: 操作经验或配置跨组传播
干预->>分析: 报告暴露年龄、退出和结果
对照->>分析: 报告污染标记、退出和结果
分析->>分析: 分离短期、幸存与污染边界图解读:参与者明确干预、对照与共享资源;箭头展示外溢和经验传播;前提是污染事件可标记;正常路径比较完整分配总体;失败路径是共享机制破坏独立性;结论是偏差必须通过设计和运行事实诊断,不能靠统计显著性消除。
数据演绎 9:只看幸存者会反转结果
演练(E3):两组各分配 1,000 个任务。对照有 900 个可观察结果,其中 720 完成;干预只有 700 个可观察,其中 630 完成。只看幸存者得到对照 80%、干预 90%,似乎提升 10 个百分点;按分配总体的保守结果至少是对照 72%、干预 63%。输入是分配、可观察、完成和缺失原因;观测信号是干预组 30% 结果缺失;状态转为“疑似差异性缺失”;结论是先追查退出与不可观测机制,不能把 90% 宣称为效果。
1.10 因果、相关与非随机证据边界
热门面试题
问题(基础题):相关性为什么不能直接证明因果?
- 考点:混杂、反向因果和共同趋势。
- 回答思路:两个变量同变可能来自第三因素,也可能结果反过来影响原因。
- 详细答案:相关只说明变量共同变化,无法排除用户选择、业务结构、季节、故障、规则变化等混杂,也无法确定方向。因果问题需要构造“同一对象若未接受干预会怎样”的反事实;随机化通过分配机制近似这个反事实,观察研究则依赖更强且不可完全验证的假设。
- 进阶追问:随机实验就能证明所有因果吗?
- 进阶回答:只能在设计、执行、测量和样本范围内支持因果,污染、缺失、失配和外推仍会破坏结论。
问题(原理题):不能随机时如何提高证据可信度?
- 考点:准实验、时间和对照选择。
- 回答思路:寻找外生规则、同期对照、干预前趋势与安慰剂检验。
- 详细答案:可使用分阶段上线、阈值规则、差分比较或中断时间序列等设计,但要说明选择机制、共同趋势、同步事件、预期外溢和测量变化。应画因果关系、冻结协变量、检验干预前趋势、设置未受影响结果和伪干预时间,并做敏感性分析。结论强度低于执行良好的随机实验。
- 进阶追问:上线前后比较为什么很弱?
- 进阶回答:时间同时带来季节、流量、人员、故障和规则变化,无法把差异唯一归因于上线。
问题(项目追问题):报警量下降能证明降噪有效吗?
- 考点:观测断裂与漏报。
- 回答思路:报警量只是过程信号,必须结合信号完整、真实风险、确认和恢复结果。
- 详细答案:报警减少可能来自规则聚合,也可能来自设备离线、采集丢失、通知失败或阈值过高。应先对账原始信号和设备在线率,再比较独立标注的真实风险、漏报、重复通知、确认时长和恢复复发。若不能随机,可按站点分阶段切换并用同期未切换站点比较,同时检查趋势和污染。
- 进阶追问:通知数下降而确认变快能说明成功吗?
- 进阶回答:仍不够,要证明严重事件未漏、数据完整、恢复质量和复发没有恶化。
| 证据类型 | 主要前提 | 可支持结论 | 关键威胁 |
|---|---|---|---|
| 随机对照 | 分配、执行和测量有效 | 样本范围内平均因果效应 | 污染、失配、缺失、外推 |
| 分阶段切换 | 切换次序近似外生 | 条件性因果证据 | 时间趋势与学习外溢 |
| 差分比较 | 两组干预前趋势可比 | 共同趋势下的相对变化 | 同期差异冲击 |
| 中断时间序列 | 无同刻其他结构变化 | 时间断点关联证据 | 季节和同步发布 |
| 普通相关 | 测量可靠 | 生成候选假设 | 混杂、反向因果、选择偏差 |
sequenceDiagram
participant 现象 as 观察现象
participant 假设 as 因果假设
participant 设计 as 识别设计
participant 反例 as 反例与安慰剂
participant 结论 as 证据分级
现象->>假设: 提出机制、方向和替代解释
假设->>设计: 优先随机,否则选择准实验
设计->>反例: 检查前趋势、污染、同步变化和伪结果
alt 关键假设被反例推翻
反例-->>结论: 降级为相关或未知
else 设计与反例检查通过
反例-->>结论: 在明确范围内给条件性因果结论
end图解读:节点从现象、假设、识别设计到反例;箭头要求先排替代解释再分级结论;前提是机制和设计假设透明;正常路径给范围化因果证据;失败路径降级为相关或未知;结论是因果强度来自识别设计,不来自图表形状。
数据演绎 10:前后改善可能完全由共同趋势解释
演练(E3):干预仓准时率从 80% 升到 86%,同期未干预仓从 78% 升到 83%。只做前后比较会宣称提升 6 个百分点;在“共同趋势成立”的假设下,差分估计为 (86%-80%) - (83%-78%) = 1 个百分点。输入为两组干预前后读数、相同口径和趋势假设;观测信号是对照也明显改善;状态从“上线带来 6 点提升”转为“条件性增量约 1 点且需区间与反例”;结论不能跨越共同趋势、污染和同期事件边界。
1.11 最小化采集、同意与目的限制
热门面试题
问题(基础题):最小化采集要求什么?
- 考点:必要性、粒度、频率和期限。
- 回答思路:每个字段都要能回答“为哪个目的、为何必需、保存多久”。
- 详细答案:最小化采集不是少采几个字段,而是只收实现明确目的所必要的数据,选择最低可用粒度和频率,限定对象、用途和保留期。能用仓级计数回答的问题不采员工轨迹,能用年龄段不采生日,能在端侧汇总不上传原始信号。无法说明必要性的字段默认不进入合同。
- 进阶追问:以后可能有用能作为采集理由吗?
- 进阶回答:不能单独作为理由,应有明确合法目的、必要性评估、责任人和到期规则。
问题(原理题):同意为什么不等于无限授权?
- 考点:知情、具体、自愿和可撤回。
- 回答思路:同意绑定目的、范围、期限与退出方式,不覆盖所有后续用途。
- 详细答案:有效同意应让对象理解谁处理、处理什么、为何处理、保存多久、与谁共享及如何撤回;不能把非必要分析捆绑在核心服务里,也不能用模糊文本覆盖未来用途。撤回通常约束后续处理,并触发相应停用或删除流程;法律义务等其他处理基础需单独记录,不能假装仍靠同意。
- 进阶追问:内部员工数据也需要目的限制吗?
- 进阶回答:需要,劳动关系不意味着可无限监控,仍应评估必要性、透明度、权限和期限。
问题(项目追问题):WMS(仓储管理系统)效率实验能采个人轨迹吗?
- 考点:业务必要性与员工隐私。
- 回答思路:优先波次、任务和区域聚合,个人级数据只在确有必要且受控时使用。
- 详细答案:若问题是波次策略是否减少拥堵,通常可用波次、区域、任务时长、设备状态和质量结果,不必长期保存精确个人移动轨迹。需要排查安全事件时,也应限定时段、区域、访问角色和保留期,向相关人员说明用途,并禁止把实验数据静默转为绩效排名。具体制度需法务和组织政策核对,本文不作法律结论。
- 进阶追问:去掉姓名后就能任意使用吗?
- 进阶回答:不能,工号哈希、时间地点组合仍可能重识别,目的、权限和期限继续适用。
| 控制问题 | 合格证据 | 不合格做法 | 默认动作 |
|---|---|---|---|
| 目的是什么 | 明确业务问题与责任人 | “以后分析可能有用” | 拒绝采集 |
| 是否必要 | 字段到假设的逐项映射 | 全量复制源表 | 降粒度或删除字段 |
| 是否需同意 | 处理基础与告知记录 | 默认勾选且不可撤回 | 暂停处理并评审 |
| 能否二次使用 | 新旧目的兼容评估 | 实验数据转绩效排名 | 新审批或禁止 |
| 保存多久 | 业务、审计与法律期限 | 永久保存 | 设置到期与删除任务 |
flowchart TD
A[业务问题] --> B{字段是否直接必要}
B -->|否| X[不采集或删除]
B -->|是| C{能否降低粒度或频率}
C -->|能| D[使用聚合或端侧计算]
C -->|不能| E{处理基础与告知是否成立}
E -->|否| X
E -->|是| F[限定目的、权限、期限和撤回]
F --> G[版本化采集合同]
G --> H[到期复审与删除]图解读:节点从问题到必要性、降粒度、处理基础和到期删除;箭头把“不采集”作为合法终点;前提是字段能映射到目的;正常路径形成版本化合同;失败路径拒绝无必要或无依据处理;结论是隐私控制应在采集前发生。
数据演绎 11:字段最小化清单
演练(E3):原方案拟采 20 个字段,其中 8 个直接支持资格、主指标和护栏,5 个可由仓级与小时级聚合替代,4 个仅是“以后可能有用”,3 个涉及精确位置且当前假设不需要。评审后保留 8 个必要字段和 5 个聚合字段,删除 7 个无必要原始字段,字段数从 20 降为 13,减少 35%。输入是目的映射、粒度、频率和期限;观测信号是无责任人的字段数;状态从“全量采集”转为“最小合同”;该比例只是演练,不宣称真实合规成果。
1.12 脱敏、假名化、访问、保留、删除与审计
热门面试题
问题(基础题):脱敏和假名化有什么区别?
- 考点:可逆性与重识别风险。
- 回答思路:展示脱敏降低可见性,假名化用受控标识替代直接身份,但都不自动匿名。
- 详细答案:脱敏可掩码、泛化或截断敏感字段,降低日常查看暴露;假名化用令牌或受控标识替代直接身份,并把映射单独保护。二者仍可能通过映射或组合属性重识别,通常仍属于受保护数据。真正不可逆匿名需要评估合理重识别风险,不能只看“没有姓名”。
- 进阶追问:哈希手机号就是匿名吗?
- 进阶回答:通常不是,手机号空间可枚举,未加密钥的哈希易被反查,且行为组合仍可关联。
问题(原理题):删除为何不能只删明细表?
- 考点:派生、缓存、备份、导出和审计链。
- 回答思路:沿血缘登记所有副本,区分立即删除、逻辑隔离和备份到期消亡。
- 详细答案:个人数据可能进入明细、汇总、特征、缓存、搜索索引、导出、临时文件和备份。删除请求要解析身份、权限与法律保留例外,生成可追踪任务,沿血缘执行删除或不可逆聚合,并验证服务不可再检索。备份若不能单条即时改写,应隔离访问、记录到期,并确保恢复后重新执行删除清单。
- 进阶追问:审计日志也要删除吗?
- 进阶回答:按法律和安全目的最小保留,可保存删除动作证据与不可逆摘要,不应无限保留原始敏感内容。
问题(项目追问题):支付实验数据如何做访问控制?
- 考点:职责分离、最小权限和高风险导出。
- 回答思路:分析默认使用假名和聚合,原始金额与身份按对象范围、期限和审批开放。
- 详细答案:分析人员默认访问按支付单假名化的状态、渠道、时间窗和必要金额区间;直接身份、完整账号、渠道凭据和原始回调不进入普通实验表。高风险查询通过 RBAC(基于角色的访问控制)、对象范围、工单、限时授权和导出审批,所有查看、下载、共享和删除写审计。真实角色矩阵与保留期为 E0。
- 进阶追问:管理员可以绕过审计吗?
- 进阶回答:不应;紧急通道也要限时、双人确认、不可篡改记录和事后复核。
| 生命周期 | 主要控制 | 证明材料 | 失败处置 |
|---|---|---|---|
| 写入 | 字段分级、假名化、加密 | 合同版本与密钥域 | 拒绝越界字段 |
| 查询 | 最小权限、对象范围、限时授权 | 身份、工单与查询审计 | 撤权并调查 |
| 导出 | 水印、审批、限量与到期 | 导出清单和接收方 | 吊销链接并处置泄露 |
| 保留 | 按目的与义务设期限 | 到期策略和例外依据 | 阻止无期限续存 |
| 删除 | 血缘传播、验证与备份重删 | 删除单、结果摘要 | 隔离残留并重试 |
flowchart LR
A[分类分级] --> B[假名化与加密]
B --> C[最小权限查询]
C --> D[受控分析与导出]
D --> E{达到保留期限或合法请求}
E --> F[沿血缘删除或不可逆聚合]
F --> G[缓存、索引、派生与备份验证]
G --> H[保留最小审计证据]
C -->|越权| X[拒绝、告警与调查]
D -->|泄露| X图解读:节点覆盖分类、保护、访问、导出、保留和删除;箭头让控制贯穿全生命周期;前提是血缘与数据责任人可查;正常路径到期删除并验证;失败路径触发拒绝和调查;结论是脱敏不能替代权限、期限与审计。
数据演绎 12:删除闭包与验证
演练(E3):一项删除请求命中 1 个主体标识、12,000 条明细、3 个派生汇总、2 个缓存键、1 个搜索索引和 2 个历史导出。任务先冻结主体映射,删除或不可逆聚合在线副本,吊销导出,再记录 1 个备份到期重删项;验证查询返回 0 个可识别在线对象,汇总总量变化与删除清单一致。输入是身份解析、血缘、副本和例外依据;观测信号是残留数与失败任务年龄;状态从“已受理”到“在线完成、备份待到期”;数字仅作流程演练。
1.13 “发现—假设—干预—验证—复盘”决策闭环
热门面试题
问题(基础题):指标决策闭环包含哪些阶段?
- 考点:发现、假设、干预、验证、复盘。
- 回答思路:每阶段都给输入、产物、退出条件和责任人。
- 详细答案:发现阶段先证明指标有资格并界定影响;假设阶段写机制、反例和证伪条件;干预阶段选择可逆动作、随机化或可信对照,并设护栏与回退;验证阶段按冻结合同报告效应、区间、偏差和隐私状态;复盘阶段记录采纳、拒绝、继续验证或灰度的原因,关闭行动项并删除到期数据。
- 进阶追问:验证无显著结果算闭环失败吗?
- 进阶回答:不算,可靠否定假设、缩小不确定性并停止无效投入也是有效决策产物。
问题(原理题):为什么复盘必须记录“当时所知”?
- 考点:结果偏见与可审计决策。
- 回答思路:好决策可能遇到坏结果,坏决策也可能偶然成功,需按当时证据评价。
- 详细答案:只按最终结果评价会产生结果偏见,让团队把偶然成功当方法正确,也把合理试验因外部事件失败当无能。复盘应保存问题版本、数据水位、备选方案、预期、风险、停止线、审批和未知项,再比较实际机制与预测。这样才能改进决策过程,而非用事后故事美化结果。
- 进阶追问:复盘行动项怎样算关闭?
- 进阶回答:必须有责任人、期限和可验证证据,并在下一次演练、实验或审计中复核,而非只改文档状态。
问题(项目追问题):如何用闭环讲支付或库存项目?
- 考点:业务不变量、实验边界和诚实表达。
- 回答思路:从异常证据开始,给可逆干预、硬护栏、验证和 E0-E3(证据等级)边界。
- 详细答案:先说明支付可核对或库存不超卖是不变量,现象只产生假设;再冻结支付单或库存业务键、窗口和权威源,选择限定渠道、仓或租户的可逆干预,设置金额差异、重复扣款、可售为负和账实差硬停。结果只报告 E3 演练效应和区间,项目主题标 E2,真实线上收益保持 E0,最后说明为何采纳、拒绝或继续验证。
- 进阶追问:面试官追问“提升多少”怎么办?
- 进阶回答:给演练输入、公式和真实取数路径,明确没有原始实验记录就不把比例说成项目事实。
| 阶段 | 核心问题 | 必交付物 | 退出条件 |
|---|---|---|---|
| 发现 | 数据可信且问题重要吗 | 资格、影响和基线卡 | 现象被证实或否定 |
| 假设 | 哪个机制可被推翻 | 主假设、反例、指标与护栏 | 评审通过或转观察 |
| 干预 | 怎样最小可逆地改变 | 分配、权限、回退与样本计划 | 门禁通过并开始 |
| 验证 | 结果、风险和不确定性如何 | 效应、区间、偏差与审计 | 完整窗口和审批完成 |
| 复盘 | 决策是否应保持或调整 | 决策记录、行动项和删除单 | 复核证据关闭 |
flowchart LR
A[发现可信异常] --> B[提出可证伪假设]
B --> C[设计最小可逆干预]
C --> D[验证主结果、护栏与偏差]
D --> E{证据支持什么决策}
E -->|采纳| F[限定扩面与持续监控]
E -->|拒绝| G[回退并停止投入]
E -->|不确定| H[新样本或新设计]
F --> I[复盘、审计与到期删除]
G --> I
H --> B
I --> A图解读:节点构成发现到复盘的反馈环;箭头允许采纳、拒绝和继续验证三类合法结果;前提是每阶段产物可审计;正常路径限定扩面;失败或不确定路径回退、重设计;结论是指标只有驱动可验证行动并留下复盘证据才形成闭环。
数据演绎 13:一次 IoT(物联网)降噪决策演练
演练(E3):发现某规则组每小时产生 1,000 个通知,其中人工确认 80 个、独立抽检真实风险 90 个。假设“按站点聚合同源重复信号可减少通知且不增加漏报”,按站点随机,干预组通知降至 600 个,确认仍为 80 个,但抽检真实风险只识别 84 个,漏掉 6 个。输入为通知、确认、独立风险和站点分配;主指标改善 40%,安全护栏恶化 6 / 90 = 6.67%;状态触发硬停与回退;结论是本轮假设被否定,不能把降噪比例包装成成功。
2. 项目口述、排障与复习清单
三分钟项目话术:我不会从“做了一个实验平台”开始,而是先讲业务不变量和证据等级。以 WMS(仓储管理系统)、支付、Runner(执行器)或 IoT(物联网)为例,先验证指标合同和数据资格,再把现象写成对象、干预、机制、主指标、护栏和否定条件;按共享状态选择账户、波次、队列或站点作为随机化单元,用历史方差、MDE(最小可检测效应)和统计功效规划有效样本。运行中分开记录资格、分配、暴露和结果,主报 ITT(意向处理分析),监控 SRM(样本比例不匹配)、污染、差异性缺失和硬护栏。结束后同时报告绝对效应、区间、业务价值、多重检验和可推广边界。隐私侧从目的和最小采集开始,落实同意、假名化、权限、保留、删除和审计。最后记录采纳、拒绝或继续验证,不用无证据比例装饰项目。
异常排查顺序:先冻结实验与指标版本,确认计划比例、资格、分配、暴露、结果和护栏逐层守恒;再检查数据迟到、去重、身份、分层、缓存、跨组污染、退出和新奇效应;涉及资金、库存、安全、隐私或 SRM(样本比例不匹配)时停止扩面和因果解释;修复后用 A/A(同版本随机对照检验)或新样本重启,不静默续用已污染结果。项目机制延伸见 支付资金正确性、订单库存与履约、WMS(仓储管理系统)案例 和 告警风暴治理。
- 能把业务现象写成对象、干预、对照、机制、主指标、护栏和否定条件。
- 能解释随机化单元为何不总等于分析单元,并识别簇内相关和污染。
- 能用基线、方差、MDE(最小可检测效应)和统计功效规划样本。
- 能区分分配、暴露、ITT(意向处理分析)和按方案分析。
- 能正确解释 p-value(显著性概率值)、置信区间、效应量和未显著结果。
- 能治理多重检验、连续偷看、护栏与停止实验。
- 能从资格、分配、路由、暴露和结果逐层排查 SRM(样本比例不匹配)。
- 能识别新奇效应、幸存者偏差、差异性缺失和跨组污染。
- 能说明随机、准实验与普通相关的因果边界。
- 能把最小化采集、同意、目的限制、脱敏、假名化、访问、保留、删除和审计串成生命周期。
- 能用“发现—假设—干预—验证—复盘”做出采纳、拒绝或继续验证的可审计决策。
- 能明确所有项目映射为 E2、演练数字为 E3、真实线上实验结论无证据时为 E0。
2.1 综合题使用边界
以下综合题用于三到五分钟口述演练,每题都必须主动声明 E0-E3(证据等级),不能把演练样本、候选设计或通用统计机制说成真实线上实验成果。
3. 综合面试题与追问
问题(综合题):如何从一个异常指标定义可执行实验,而不是直接切流量?
- 口述答案:我先把异常当作待验证现象,不把时间相关写成原因。第一步冻结指标合同、版本和数据水位,核对实体、事件、窗口、去重、迟到和权威源,确认变化不是埋点、回填或结构漂移;然后按仓库、渠道、版本、任务类型等预定义维度定界影响。第二步并列业务、系统、数据与外部环境假设,每个假设写机制、支持样本、反例和未知项。只有存在可控且风险可回退的动作时才进入实验,把命题写成“对哪类稳定对象实施什么干预,相对哪个对照,使哪个主结果至少变化多少,同时哪些资金、库存、质量、安全和隐私护栏不得恶化”。随后选择随机化单元,避免共享状态污染;用历史基线、方差、MDE(最小可检测效应)、统计功效、暴露率和完整业务周期规划样本。启动前冻结资格、分配、暴露、分析、停止和回退规则,并通过目的、最小采集、权限与保留评审。运行中先看数据资格、SRM(样本比例不匹配)和护栏,不随主结果波动提前停。结束后报告绝对效应、置信区间、偏差、可推广范围和成本,再决定采纳、拒绝或新样本复验。项目映射是 E2,数字演练是 E3,真实实验结论没有原始记录时保持 E0。决策记录还要保存当时可见的数据版本、未解决异常、备选方案和责任人;若实验被否定,同样沉淀失败机制、停止投入和下一轮取证条件,防止团队只保留正向故事。发布后仍按完整业务窗口复核,发现效果衰减或护栏滞后恶化就执行预设回退。
- 追问 1:异常确认后为什么还要列多个假设?
- 直答 1:同一曲线可由业务变化、系统故障、数据错误或结构效应造成,单一故事容易形成确认偏见。
- 追问 2:何时不应做实验?
- 直答 2:干预不可逆、风险不能隔离、样本不足、法律依据不明或结果无法及时观测时不应硬做。
- 追问 3:未显著是否意味着假设错误?
- 直答 3:不一定,要看区间是否已排除业务重要效应,以及设计、执行和功效是否合格。
- 详情:指标异常的质量资格
问题(综合题):怎样设计一个 WMS(仓储管理系统)波次策略随机实验?
- 口述答案:我先声明这是 E2 候选方案与 E3 演练,不声称项目真实做过实验。业务问题不是“新算法快不快”,而是新波次分组能否在不牺牲正确履约的前提下降低尾部完成时长。资格限定到同仓型、同班次、可比订单难度和设备可用状态;主指标选出库波次从释放到正确交接的高分位时长,硬护栏包括错拣、库存差异、重复任务、超时交接和安全事件,操作指标包括巷道拥堵、补货等待与人工干预。由于订单共享波次、人员、设备和巷道,随机化单元优先用波次、班次或区域,而非把同波次订单拆组;仓数量少时还要按仓型和历史负荷分层,并按簇设计修正样本量。分配、策略实际执行、回退、任务结果和库存流水分别留痕,主分析按初始分配做 ITT(意向处理分析)。运行中检查组间波次数、订单难度、操作员跨组学习和共享资源污染;安全或库存护栏越界立即停验。完整班次与高峰周期结束后,报告效应区间、污染、结构和最坏损害,不只报均值。若通过,也先按仓或班次限定扩面,并在复盘中记录回退能力、个人数据最小化与到期删除。验证不能停在看板,要抽取波次回放任务、库存流水和交接事实,确认没有通过少生成任务、延后困难单或转移到下一班次来改善时长;同时比较未受影响区域,检查瓶颈是否外溢。扩面后保留旧策略兼容窗口和按仓回切开关,直到完整促销与恢复周期复核通过。 复核结论由仓内作业、库存和安全责任人共同签署,避免数据团队单方面宣布成功。
- 追问 1:为什么不按订单随机?
- 直答 1:同波次订单共享策略与资源,拆组会互相影响并破坏独立性。
- 追问 2:完成更快但错拣增加怎么办?
- 直答 2:错拣是质量护栏,越界应回退,不能用时长收益抵消。
- 追问 3:仓很少怎样提高可信度?
- 直答 3:延长周期、分阶段切换、按基线分层并按簇数推断,不能拿订单明细冒充独立样本。
- 追问 4:需要保存员工精确轨迹吗?
- 直答 4:通常不需要,优先波次、区域和任务聚合;确有安全目的时再限定范围、权限和期限。
- 详情:WMS(仓储管理系统)库存与仓内方案
问题(综合题):支付转化实验如何同时守住因果、资金正确性和合规?
- 口述答案:我会把“支付成功”定义为可核对支付单在规定窗口达到业务确认且内部账务、渠道状态和金额币种一致,而不是页面回跳或单次回调。资格按支付单、账户、渠道能力、地区和版本冻结,随机化单元需避免同一账户跨端反复换组;干预只改变一个可控要素,例如渠道排序或重试提示,不同时改价格、风控和结算规则。样本规划使用历史稳定期的支付单基线与方差,业务先给 MDE(最小可检测效应)和最大可接受资金风险。主指标是可核对完成率,硬护栏包括重复扣款、金额币种差异、未知态年龄、退款异常、渠道账与内部账不平,性能和投诉是辅助护栏。分配、真实暴露、渠道请求、回调、主动查单、账务分录和对账都按稳定支付身份关联;重试请求不当多个独立样本。运行中一旦出现资金单事件硬失败、SRM(样本比例不匹配)或一组日志缺失,就停止扩面和效果解释,先止损、查单、对账和保全证据。隐私侧只采实验所需假名支付标识、状态、必要金额粒度和渠道,不把完整账号、凭据或原始身份放进分析表,访问和导出需审批审计。最终即使转化区间为正,也要资金护栏全过且风险收益可接受才进入限定灰度。正式结论还要等待退款、冲正和对账窗口结束,避免早期成功率掩盖后续资金差异;对已产生未知态建立对象清单和年龄分布,逐笔查单收敛。决策记录分别写业务收益、资金最坏损害、渠道依赖和回切步骤,任何真实比例都必须能追到冻结数据与审批版本。
- 追问 1:回调成功能直接进主指标吗?
- 直答 1:不能,还要核对业务身份、状态版本、金额币种、内部入账和渠道账。
- 追问 2:未知态算失败还是成功?
- 直答 2:都不能强归类,应单列年龄并主动查单,直至权威证据收敛。
- 追问 3:转化显著提升能覆盖一笔重复扣款吗?
- 直答 3:不能,重复扣款属于资金硬护栏,应停验和处置。
- 追问 4:真实收益怎么表达?
- 直答 4:没有实验明细、账务对账和审批记录时保持 E0,只展示 E3 公式与取证路径。
- 详情:支付账务与资金一致性
问题(综合题):如何为 Runner(执行器)调度策略设计实验并处理共享资源污染?
- 口述答案:先把结果实体定义为稳定任务或业务批次,重试尝试只作为机制和成本事件,避免把一次任务的多次尝试当独立样本。若新策略会改变任务优先级、节点选择或并发,随机化单元应选择租户、队列或相互隔离的工作池;按单任务随机却共享线程、数据库连接和下游配额,会让干预抢走对照资源,既可能夸大也可能稀释效果。资格需冻结任务类型、优先级、截止时间和下游能力,按历史耗时、峰谷与租户规模分层。主指标可以是按时完成的独立任务比例或积压清空时长,护栏包括失败、重复执行、核心任务超时、下游限流、数据库负载和恢复时间。配置下发只是分配,只有新调度版本完成候选节点选择并留下策略版本才算暴露;故障回退旧策略仍按初始分配进入 ITT(意向处理分析),并单列交叉率。运行中逐层核对资格、分配、路由、暴露和结果,出现 60:40 等 SRM(样本比例不匹配)先查哈希键、缓存、旧配置和只记录成功任务的问题。实验至少覆盖完整峰谷和积压恢复周期,结果报告尾部、任务类型异质性、资源外溢和成本,不能只看平均耗时。通过后先限定租户或队列扩面,保留一键回退和独立恢复演练。验证时按任务键回放领取、执行、重试和终态,证明积压下降不是丢弃、延期或转移到死信;同时压测失去一个执行节点和下游限流,比较恢复净速率与核心任务时限。若扩面后共享资源模型变化,原实验效应立即降级为待复核,不能永久沿用旧结论。
- 追问 1:任务重试为什么不能增加样本量?
- 直答 1:同一任务的尝试高度相关,且重试由失败触发,会扭曲独立性和结果分母。
- 追问 2:如何发现资源污染?
- 直答 2:比较两组共享池占用、连接、限流、等待和跨组任务,并检查对照是否随干预负荷变化。
- 追问 3:积压下降就算成功吗?
- 直答 3:不算,还要确认任务未被丢弃、延期或转移到下游,且核心时限和正确性护栏通过。
- 详情:业务指标树与 Runner(执行器)护栏
问题(综合题):IoT(物联网)报警风暴治理怎样做安全实验?
- 口述答案:我先把“报警更少”从成功定义中移除,因为采集断裂、设备离线、阈值过高和通知失败都会让数量下降。结果实体是独立风险事件,主指标可以是单位真实风险的重复通知数或有效处置负担,硬护栏是严重风险漏报、信号完整性、设备在线、确认时长、恢复质量和复发。若同站点设备共享规则、聚合窗口、通知配额和值班人员,随机化单元应按站点或规则组,并按设备类型和历史负荷分层;严重安全报警始终走穿透通道,不为实验抑制。启动前用 A/A(同版本随机对照检验)验证分配、采集和分析,建立独立抽检或人工标注作为风险近似权威。运行中区分分配、规则真正生效、候选报警、实际通知、确认和恢复,离线补发只修订历史,不重新触发过期通知。护栏越界立即停验和恢复旧规则,保留被抑制样本供复核。还要按暴露年龄检查新奇效应,防止值班人员因刚上线而短期更关注;按完整离线与恢复周期观察稳态。隐私上优先站点和设备假名,不为降噪采集无必要个人位置或值班行为。最终只在独立风险不恶化、数据完整且区间支持业务价值时限定扩面。扩面后继续抽检被聚合和被抑制样本,并追踪恢复后复发,防止短期通知下降掩盖迟发风险;规则、模型和设备固件任一变化都触发重新分层。复盘把误停、漏报、人工负担和采集缺口分别登记,不能只展示通知节省量。 每个被抑制风险都要能追到规则版本、原始信号和处置结果,保证后续抽检可复现。
- 追问 1:通知下降 40% 为什么还不能宣称成功?
- 直答 1:它可能来自漏采或过度抑制,必须同时验证真实风险、漏报、完整性和恢复。
- 追问 2:离线补发怎样处理?
- 直答 2:保留历史事实并按事件时间重算,但过期信号不重复触发实时通知。
- 追问 3:严重报警能参加实验吗?
- 直答 3:可记录和比较,但应保留独立安全穿透,不以实验分组阻断必要处置。
- 追问 4:谁决定停止?
- 直答 4:预先授权的安全和值班角色按硬护栏先停后审,停止动作全程审计。
- 详情:监控指标与告警风暴治理
问题(综合题):随机化单元选错会造成哪些错误,如何评审?
- 口述答案:随机化单元不是“数据里数量最多的那一列”,而是能稳定承载单一策略且尽量不向其他单元外溢的最小对象。评审先画业务状态和共享资源:账户是否跨端、订单是否共享支付与库存、波次是否共享人员巷道、任务是否共享工作池、设备是否共享站点规则和值班。若同一对象会反复看到两种版本,就有状态和学习污染;若干预改变共享容量,对照结果也会被影响;若按仓或站点随机却按订单明细计算标准误,则会把簇内相关误当独立信息。选择后还要定义稳定分配键、盐值、版本、资格变化、跨组规则和清洗期,并检查随机化单元与分析单元如何聚合。样本量按簇数和设计效应修正,分层只使用实验前已知且强影响结果的少量变量。运行中监控跨组版本、共享资源占用、人员学习和配置传播;污染超限时停止解释或提升随机化层级。若可用簇太少,可以延长周期、采用随机顺序分阶段切换或可信准实验,但应降低因果强度。最终报告“对哪些单元、在什么共享边界内”的效应,不把局部实验外推到所有仓、渠道或站点。评审产物还应包含单元关系图、分配键稳定性测试、簇数与设计效应演算、跨组污染样本和故障回退路径。上线前用同版本随机对照检验和配置故障注入证明分配可重放;若资格变化会导致换组,则先修复身份合同,不带病启动。 最终由业务、平台和统计三方确认独立性假设,不以单一技术评审替代业务资源边界。 评审结论和未满足的独立性条件一并留档。
- 追问 1:随机化单元一定等于分析单元吗?
- 直答 1:不一定,可按仓随机、按订单观察,但推断必须尊重仓级分配和簇内相关。
- 追问 2:每次请求随机有什么风险?
- 直答 2:同一对象来回切换会引入状态、缓存、学习和累计副作用污染。
- 追问 3:簇很少还能算显著吗?
- 直答 3:推断主要受簇数限制,应采用簇级方法和保守区间,不能靠增加簇内明细变强。
- 详情:事件身份与稳定业务键
问题(综合题):样本量和统计功效在面试中应该怎样现场推演?
- 口述答案:我先问主指标是比例、均值、时长还是簇级结果,再冻结基线、方差和分析实体。业务必须先给 MDE(最小可检测效应):变化多大才值得承担开发、风险和迁移成本;统计侧再给一类错误率、目标统计功效、单双侧方向和分配比例。比例指标可用近似公式展示趋势,均值需要历史方差,长尾时长可能需要变换、稳健统计或重采样;按仓、站点随机还要用簇大小和簇内相关修正设计效应。算出的名义样本只是可分析独立对象,随后除以资格率、暴露率和有效结果率,反推出所需流量与周期,并覆盖周内、班次、账期或离线恢复等完整业务节奏。若周期不可接受,我不会降低标准到“容易显著”,而会重新评估业务上真正值得的效应、改进测量、使用实验前协变量、扩大覆盖或放弃实验。运行中不得看到趋势就缩短样本;若用序贯设计,要事先冻结查看点和错误预算。结束时未显著并不等于等价,要看区间是否排除了有价值收益和不可接受损害。所有基线和数字若无原始数据只是 E3 演练,并明确真实取数来源。现场推演会做两次敏感性检查:把基线、方差、暴露率和簇内相关换成较差情形,看周期是否仍可承受;再把潜在收益换算为正确业务结果而非请求数,确认 MDE(最小可检测效应)有经济意义。计划版本保存公式、参数来源和失效条件,业务结构变化后必须重算。 正式执行还要核对每天可获得的独立样本与预计周期一致,偏离时先查资格和流量,而非修改目标。
- 追问 1:MDE(最小可检测效应)由谁决定?
- 直答 1:业务、风险、成本与统计共同决定,统计不能替业务定义什么值得上线。
- 追问 2:样本越多越好吗?
- 直答 2:更多样本提高精度,但也增加时间、成本和暴露风险,且微小无价值变化也会显著。
- 追问 3:如何处理暴露率只有 60%?
- 直答 3:从所需有效样本反推资格流量,并把低暴露作为交付质量问题和效应稀释来源。
- 追问 4:未显著可以说两组一样吗?
- 直答 4:不能,除非按预定义等价界值设计,且区间整体落在可接受范围内。
- 详情:指标实体、分母和窗口合同
问题(综合题):如何正确解释 p-value(显著性概率值)、效应量和置信区间?
- 口述答案:我会先报绝对效应,再报相对效应、置信区间和设计背景,最后才提 p-value(显著性概率值)。例如完成率从 80% 到 80.8%,绝对差是 0.8 个百分点,相对变化约 1%;若区间为 0.1 到 1.5 个百分点,它说明在模型和数据前提下与当前证据相容的效应范围,而不是“真值有 95% 概率在区间”。p-value(显著性概率值)是在零假设成立时看到当前或更极端数据的概率,不是假设为真概率、结果复现概率,也不衡量业务价值。决策时把区间与预先定义的 MDE(最小可检测效应)、有害界值和护栏比较:区间虽不跨零但整体低于有价值变化,可判为统计可区分却不值得;区间跨零且很宽,只能说证据不足;区间很窄并排除有价值收益,才支持停止投入。还要说明是否多重检验、连续偷看、SRM(样本比例不匹配)、污染或差异性缺失,任何一项都可能让漂亮数值失去资格。对于资金、库存和安全硬护栏,单个重大失败不能被平均效应或显著性抵消。最终结论应是采纳、拒绝、限定灰度或继续验证,并写清范围和不确定性。我还会并列原始计数、分母、样本流失和关键分群,防止百分比隐藏低基线或结构变化;对长尾指标给中位数与高分位,对金额给总额和对象数。图表必须显示零效应、有价值和有害界值,让评审看到最坏相容结果,而非只见一颗绿色显著标签。 报告附上冻结样本和计算版本,使另一位分析者能够复算同一数值、区间和结论。
- 追问 1:p-value(显著性概率值)小于 0.05 是否代表效果很大?
- 直答 1:不代表,样本很大时极小且无业务价值的效应也可显著。
- 追问 2:区间跨零是否证明无效?
- 直答 2:不证明,可能是样本不足;要看区间是否仍包含重要收益或损害。
- 追问 3:为什么先报绝对效应?
- 直答 3:绝对变化更接近真实业务影响,相对比例在低基线下容易夸张。
- 详情:指标口径、分子与分母
问题(综合题):多重检验和事后分群怎样治理?
- 口述答案:我会在启动前把分析分成确认性和探索性两层。确认层只保留一个核心主指标、少量硬护栏和业务上预定义的关键分群,明确检验族、方向、错误预算和决策规则;探索层可以看更多指标、仓库、渠道、线路、版本和时间窗,但结果只用于生成机制假设。原因是每个组合都有偶然命中机会,20 项都用 5% 阈值时,即使真实效应全为零,至少一次偶然显著的概率也可能接近 64%。少量高风险确认结论可用 Bonferroni(邦费罗尼校正)等方法控制至少一次误报,大量探索可考虑 FDR(错误发现率),但方法必须与决策目标匹配,并披露检验数、相关性和未校正状态。若总体不显著而某线路亮眼,我先问该线路是否预定义、样本是否足够、组间结构与数据迟到是否平衡、交互是否可信;事后发现只能在新时间窗或新对象上复验,不能用同一数据既发现又确认。护栏不是为了挑好结果,也不能因多重校正而忽视单个资金或安全事故。最终报告全部计划结果、失败和未确定项,防止只发布正向指标;复盘把探索发现登记为下一轮假设,而非悄悄改主指标。分析清单还要把被查看但未报告的窗口、方向和排除规则纳入检验族,防止只数最终表格列数;代码、数据快照和计划版本共同归档。新一轮复验应使用尚未参与发现的对象或时间窗,并保持原问题和停止规则,若再次失败就明确关闭该假设。 所有探索结果保留发现时间、样本和检验路径,避免下一轮把旧发现误写成启动前假设。
- 追问 1:为什么不把所有指标都设为主指标?
- 直答 1:会分散错误预算、增加偶然命中和互相冲突的决策,失去唯一目标。
- 追问 2:探索性结果没有价值吗?
- 直答 2:有价值,适合定位机制和生成假设,但要用新样本确认后才能支撑高风险决策。
- 追问 3:护栏也要做多重校正吗?
- 直答 3:统计告警可考虑错误控制,但预定义单事件安全硬停不应因校正而被忽略。
- 详情:维度分析、高基数与多重比较
问题(综合题):如何设置护栏、停止实验和回退条件?
- 口述答案:我把停止条件分为安全硬停、风险软停、数据资格停、无望停止和计划结束。安全硬停保护资金、库存、安全、隐私和不可逆客户影响,例如重复扣款、可售为负、严重报警漏报或越权导出,触发后立即停止干预、回退和保全证据,不等待主指标。风险软停针对错误率、未知态年龄、尾部延迟或投诉持续越界,先冻结扩面,由业务、数据和风险共同复核。数据资格停包括 SRM(样本比例不匹配)、分配日志缺口、组间测量不一致、污染和大规模差异性缺失;此时不是判干预失败,而是停止因果解释。无望停止和提前成功都必须采用预先设计的序贯规则,不能每天偷看主结果并在最有利时结束。计划结束同时要求目标有效样本和完整业务窗口达到,数据冻结后再分析。每个护栏都写口径、刷新频率、阈值、持续时间、责任人、动作和恢复条件,并使用独立监控避免实验链路自己漏报。回退不只切配置,还要处理已产生副作用、未知态、缓存、任务和数据修订;支付先查单对账,库存先冻结差异键,报警恢复旧规则后复核被抑制风险。停止和恢复全程留审计,复盘验证行动项真正关闭。上线前实际演练停止信号、权限、路由回切、对象清单和业务补偿,测量从触发到干预停止的时间;若只能停配置而不能收敛副作用,实验不具备启动资格。恢复必须使用新版本审批和观察窗口,不能因曲线回落就自动续跑。 事故影响对象、补偿结果和残留风险应在恢复前形成可核对清单,由业务责任人确认。
- 追问 1:主指标明显变好时能提前停吗?
- 直答 1:只有预先定义的序贯规则允许,否则会因可选停止提高误报。
- 追问 2:护栏越多越安全吗?
- 直答 2:不一定,过多噪声告警会误停,应按失败成本选少量可行动且分级的护栏。
- 追问 3:停止后多久可以重启?
- 直答 3:根因、影响和修复被验证,A/A(同版本随机对照检验)或新样本资格通过后再按新版本启动。
- 详情:架构质量属性、失败成本与风险
- 问题(综合题):发现 SRM(样本比例不匹配)后怎样定位和处置?
- 口述答案:第一步不是给结果加权,而是停止扩面和因果解释,冻结计划比例、分配版本、盐值、资格规则和时间线。然后按资格、分配、路由、暴露、结果五层做守恒:资格层核对两组是否来自同一规则和生效时间;分配层检查稳定键、哈希、跨端身份和重试是否换键;路由层检查缓存、灰度、旧配置和故障回退是否覆盖随机结果;暴露层检查一组是否漏记录或定义不同;结果层检查是否只保留成功、活跃或未退款对象。总体 50:50 也不够,还要按预定义地区、版本、渠道、任务类型和时段检查,因为相反失衡可能在总体抵消。A/A(同版本随机对照检验)可帮助验证基础设施,但不能用反复重跑到比例正常来掩盖偶然或系统问题。若根因是可完全恢复的日志缺失,应回源补全并验证逐层摘要;若分配本身或资格被破坏,原实验通常不能挽救,应修复后重新随机。事后权重只对已知选择机制做敏感性分析,不能修复未知故障。处置报告要列受影响时间、对象、结果使用者和已做决策,撤回错误看板或结论,并把根因加入分配契约、监控和故障演练。修复验证要用固定资格样本重放稳定键,比较预期组别、路由、暴露和结果摘要,并故意制造缓存旧值、日志延迟和重试换键,确认告警能定位层级。原实验数据保留为事故证据,不与新实验拼接;任何已据此执行的业务决策都要登记复核与更正责任。 对外公告区分已确认故障、可能影响和仍未知范围,不用修复完成替代影响闭环。
- 追问 1:什么比例偏差才算 SRM(样本比例不匹配)?
- 直答 1:要结合计划比例和样本量检验,不能用固定百分点;业务上还要看分层和机制。
- 追问 2:比例正常能证明随机化正常吗?
- 直答 2:不能,稳定键、组间测量、污染和结果缺失仍可能有问题。
- 追问 3:能删除多出来的一组样本吗?
- 直答 3:不能随意删,这会引入选择偏差;应定位产生差异的链路并决定补全或重启。
- 详情:事件采集、身份与版本契约
- 问题(综合题):A/A(同版本随机对照检验)应该验证什么,不能证明什么?
- 口述答案:A/A(同版本随机对照检验)让两个随机组执行完全相同版本,目标不是证明业务无差异,而是验证实验基础设施。启动前冻结随机化单元、计划比例、资格、分层、暴露和指标合同;运行至少覆盖完整业务周期,检查同一对象是否稳定落组、总体和关键层是否 SRM(样本比例不匹配)、两组暴露日志是否同口径、结果缺失和迟到是否对称、方差估计是否符合历史、多个指标的误报是否接近设计预期。还应注入少量可控故障,例如一组路由日志延迟、缓存旧版本或结果回填,验证监控能否定位到资格、分配、暴露和结果层。若某个指标显著,不要重跑到不显著;先排查身份、数据和计算,若都正常,也承认按错误率会偶发显著,并看整个检验族和重复批次。A/A(同版本随机对照检验)不能证明未来干预没有新奇效应、共享资源污染、执行交叉或安全风险,也不能证明所有小偏差都被发现。通过标准应是分配与数据合同可复现、已知故障能被告警、误报和方差在预期范围,而不是“所有指标完全相等”。结果与配置保留版本,后续生产实验仍需独立护栏和 SRM(样本比例不匹配)监控。评审还要比较组间实验前特征、每日比例和迟到修订,确认总体正常没有掩盖时段或分层异常;对误报率只看长期批次,不因一次恰好无显著就宣布平台可靠。每次分配算法、身份规则或指标合同变更后重新执行,不沿用旧验证结论。 通过记录必须绑定具体分配、身份和指标版本以及有效期,不能成为平台永久免检证明。
- 追问 1:A/A(同版本随机对照检验)要跑多长?
- 直答 1:至少覆盖主要业务周期和迟到窗口,具体由流量、方差和分层覆盖决定。
- 追问 2:出现一次显著就是平台坏了吗?
- 直答 2:不一定,随机误报本来会发生;要结合检验族、重复性和链路证据判断。
- 追问 3:A/A(同版本随机对照检验)通过后能省掉实验护栏吗?
- 直答 3:不能,它只验证基础设施,不覆盖新干预的业务、安全和污染风险。
- 详情:指标质量分层校验与发布
- 问题(综合题):新奇效应、幸存者偏差和污染如何共同诊断?
- 口述答案:我会把三类问题分别映射到时间、选择和干预边界。新奇效应看同一随机总体在暴露后第几天或第几个业务周期的效应,若首日高、随后衰减,要区分注意、学习、抵触和真实稳态,不能用早期峰值外推。幸存者偏差看从资格、分配、暴露到结果每层流失是否组间不同;只分析完成、活跃、未退款或可观察对象,会把可能由干预造成的退出移出分母,主分析应回到 ITT(意向处理分析),并对缺失做最坏边界与敏感性分析。污染看对照是否接触干预版本、共享人员设备和容量是否被改变、配置或经验是否跨组传播;它可能让差异缩小,也可能因资源抢占让对照更差。诊断时冻结分配,按暴露年龄画效应,列退出与缺失原因,核对跨组版本和共享资源,再用完整周期、清洗期、提升随机化层级或分阶段设计降低风险。若污染或差异性缺失无法量化,就降低为探索结果或重启实验,而不是靠协变量调整包装成确定因果。报告同时给稳态区间、缺失边界、污染比例和适用对象,并说明推广后资源结构变化可能让效应再次改变。验证可增加三个反例:比较未暴露对象是否也变化、比较共享资源较弱的隔离层、把干预日期前移做伪检验;若伪结果同样“有效”,说明时间或选择解释仍在。复盘记录哪类偏差由设计预防、哪类只能定界,避免统计调整被误写成已经消除风险。 若三类偏差方向相反,也要分别报告,不能用相互抵消后的总体数字宣称没有问题。 推广前还要在新业务周期复核稳态与污染。
- 追问 1:新奇效应一定让结果先高后低吗?
- 直答 1:不一定,也可能因学习成本先低后高,关键是按暴露年龄观察机制。
- 追问 2:污染能通过删除污染样本解决吗?
- 直答 2:通常不能,污染与资源和行为相关,删除会破坏随机总体,应改设计或做边界分析。
- 追问 3:缺失结果怎样做最坏边界?
- 直答 3:分别假设缺失对象全部失败或成功,观察结论是否仍稳健,并披露假设。
- 详情:同期群、留存与偏差边界
- 问题(综合题):如何向面试官说明因果与相关的边界?
- 口述答案:我会从反事实开始:因果问题问同一对象在接受干预和未接受干预时结果会差多少,但同一时刻不能同时观察两个状态,所以需要一个可信对照近似未发生的结果。普通相关只看到两个变量共同变化,可能由季节、用户选择、业务结构、故障或第三变量共同驱动,也可能是结果反过来影响所谓原因。随机分配在样本足够且执行有效时,使干预前已知和未知因素平均可比,因此能在实验对象和窗口内支持平均因果效应;但 SRM(样本比例不匹配)、跨组污染、差异性缺失、测量变化、多重检验和提前停止仍会破坏结论,推广到新地区、仓型或高峰也需要外部有效性证据。不能随机时,我会明确采用条件性更强的准实验,例如分阶段切换、差分比较或时间断点,并检查干预前趋势、同期事件、安慰剂结果、伪干预时间和污染;任何关键假设不能验证,就降级为相关或候选机制。举例说报警量下降不能单独证明降噪有效,先排除设备离线、采集丢失和通知失败,再用独立风险、漏报和恢复验证。表达上不说“数据证明了原因”,而说“在这些设计假设和范围内,证据支持或不支持某个因果命题”,并列替代解释与所需追加证据。正式报告还应画出干预、结果、混杂和测量之间的关系,逐项标记哪些由随机化平衡、哪些只能观测、哪些完全未知;随后用负向结果、伪时间和未受影响对象挑战自己的解释。若关键反例成立,就撤销因果措辞并重写决策,而不是继续增加模型复杂度。
- 追问 1:随机实验是不是最高级且永远优先?
- 直答 1:因果识别通常更强,但不可逆风险、伦理、合规、样本和污染可能使其不可行。
- 追问 2:相关结果还有什么价值?
- 直答 2:可用于监控、预测、定界和生成假设,只是不能越界成干预效果。
- 追问 3:随机结果能外推到所有场景吗?
- 直答 3:不能,外推取决于对象、执行环境、业务周期和机制是否与实验范围相近。
- 详情:归因、偏差与因果边界
- 问题(综合题):无法随机时怎样设计一个可信的分阶段验证?
- 口述答案:我先解释为什么不能随机,是站点数量太少、系统状态共享、法律与安全限制,还是发布能力不足;原因不同会影响替代设计。以跨境履约规则为例,可将具备资格的仓或线路按预先确定且尽量外生的顺序分阶段切换,保留同期未切换对象作为对照。启动前冻结结果实体、承诺版本、事件时间、迟到规则、分群和干预日期,收集足够长的干预前序列,检查两组趋势是否近似平行;若趋势明显不同,不能依赖简单差分。运行中记录同期促销、承运商故障、节假日、人员和口径变化,设置未受干预影响的安慰剂指标与伪切换日期,检查是否在不应出现效果的地方也产生断点。估计时同时报告前后变化、同期对照变化及差分区间,按站点或线路聚类处理相关性;切换顺序若与风险或表现有关,要说明选择偏差并做敏感性分析。任何支付、库存、安全和隐私护栏越界仍立即回退,不能因不是随机实验而放松门禁。结果只能表述为“在共同趋势、无同期差异冲击和有限污染假设下的条件性证据”,不能包装成与良好随机实验同等的确定结论。下一阶段最好改变切换顺序或用新对象复现,以减少同一时间段偶然事件的解释空间。执行表还要登记每批切换的资格摘要、基线、版本、外部事件和回退时间,确保没有按近期表现临时挑选“容易成功”的线路。若某批因故障提前切换或延迟,按偏离计划处理并做敏感性分析,不静默归入正常干预。 发布结论注明共同趋势、无同期差异冲击和有限污染假设,方便后续新证据推翻。
- 追问 1:分阶段上线就是实验吗?
- 直答 1:不自动是,只有资格、顺序、对照、指标、护栏和分析计划事先明确才具备识别价值。
- 追问 2:共同趋势怎样检查?
- 直答 2:比较多个干预前时点的水平与斜率,并用伪干预检验是否提前出现“效果”。
- 追问 3:同期发生承运商故障怎么办?
- 直答 3:定界受影响对象,加入机制与敏感性分析;无法分离时降低结论或重新验证。
- 详情:跨境履约轨迹与异常恢复
- 问题(综合题):最小化采集如何落到实验字段和事件合同?
- 口述答案:我从问题和假设反推字段,不从现有大宽表倒推用途。先列资格、稳定随机单元、分配、暴露、主结果、护栏、偏差诊断和审计七类需要,每个字段写目的、是否直接必要、最低粒度、频率、来源、访问角色和保留期。无法映射到当前决策的问题字段默认不采;能由仓级、小时级或区间值回答的,不上传精确个人轨迹、原始位置或完整金额;能在端侧或业务系统聚合的,不复制原始明细。分配键优先使用专用假名,映射与分析数据分域保护,避免用手机号、姓名或可枚举哈希。采集合同还要说明同意或其他合法处理基础、告知、撤回、二次用途和共享边界;实验结束不代表数据可以永久保存,按分析、复核、审计和法律义务分别设期限,到期沿明细、缓存、索引、派生和导出删除。运行中监控新增字段、空值、未知枚举和访问量,防止开发为排障临时加的原始字段永久留下。若新假设需要旧合同之外的数据,重新做必要性和目的兼容评审,不把“科研”或“优化”当无限口袋。交付物包括字段最小化清单、被拒绝字段及原因、数据流、责任人和删除验证;具体法律结论需当地法规与组织制度确认,本篇只给工程控制框架。上线前用一批固定样本验证每个保留字段确实进入资格、估计、护栏或审计计算,被拒绝字段在事件、日志和导出中均不存在。合同变更通过差异评审和自动到期,任何临时旁路都有工单、访问限额与销毁证据,防止最小化只停留在设计表。
- 追问 1:多采一些以后可能省开发,为什么不行?
- 直答 1:未来用途不明确会扩大泄露、滥用和保留风险,也无法证明当前处理必要。
- 追问 2:聚合数据一定没有隐私风险吗?
- 直答 2:不一定,小群体、高维组合和稳定时间序列仍可能重识别,需要最小群体和访问控制。
- 追问 3:排障临时字段如何管理?
- 直答 3:限时、限人、工单审批、单独存储和自动到期,并审计是否真正删除。
- 详情:事件属性字典与数据契约
- 问题(综合题):同意、目的限制和二次使用如何设计成可执行控制?
- 口述答案:我不会把一段隐私文本当作全部控制,而是把同意或其他处理基础做成与数据合同关联的版本化事实。每个目的写处理主体、数据类别、对象、必要性、使用范围、保存期限、接收方和退出方式;需要同意时,界面应清晰、具体、自愿且可撤回,非必要分析不能与核心服务强捆绑。采集入口记录告知与选择版本,但不把同意理解为无限授权;新用途要比较与原目的的兼容性、对象合理预期、数据敏感性和风险,不能把仓内策略实验数据静默转为员工绩效,或把支付优化数据转为无关营销。撤回后停止基于该同意的后续处理,触发分配排除、数据删除或限制使用;若出于账务、审计或安全义务仍需保留部分数据,应单独记录依据、最小范围和期限,不能伪装为继续同意。对象进入和退出实验都要避免破坏业务权利,且退出原因不能用于惩罚性分析。工程上把目的标识传入采集、查询、导出和删除策略,权限请求必须选择目的,审计能回答谁在何时为哪个目的访问了什么。法律与员工关系等具体要求由法务和制度责任人确认,实验团队不能自行解释为合规。复盘同时检查同意覆盖、撤回处理时长、二次用途申请和越权例外。还要演练告知版本升级、撤回消息延迟和下游离线时的失败路径,确保入口不再采集、现有任务停止处理、导出被吊销且删除单可追踪。若某个下游无法执行目的或撤回控制,就不能在上线前把数据发送过去。 复盘对撤回失败和越界二次使用按事故管理,登记影响、责任与修复,而非只补说明文本。
- 追问 1:用户点击同意后能永久保存吗?
- 直答 1:不能,保存期仍受目的必要性、承诺、法律义务和撤回机制约束。
- 追问 2:撤回是否必须删除全部历史?
- 直答 2:取决于处理基础与法定义务,但应停止相应后续处理,并对保留例外做最小化和记录。
- 追问 3:内部二次分析需要审批吗?
- 直答 3:需要评估目的兼容、必要性、权限和风险,内部身份不等于用途无限。
- 详情:数据修订、删除与历史影响
- 问题(综合题):脱敏、假名化和匿名化如何区分并落地?
- 口述答案:脱敏是降低日常可见性,例如掩码、截断、泛化和区间化;假名化是用专用令牌替代直接身份,把映射和分析数据分域、分权、加密保存;二者都不等于匿名,因为拥有映射、可枚举标识或足够多行为属性时仍可能重识别。匿名化要求在合理可用手段下难以再关联个人,需要结合攻击者能力、数据稀疏度、外部数据和时间变化评估,不能只删姓名就宣布完成。实验中我优先生成实验专用假名,禁止直接用手机号哈希,因为号码空间可枚举;不同目的使用不同令牌域,避免跨项目串联。分析表按最小粒度保留资格、分配、暴露和结果,直接身份只在受控映射服务中用于撤回、删除和合规请求。查询默认展示聚合和区间,小群体、高基数维度和精确时间地点设置阈值、审批或禁止导出;导出带接收方、期限、水印和撤销能力。密钥轮换、令牌碰撞、映射访问和重识别尝试都进入审计,紧急解密限时且双人复核。删除时既删除假名明细,也处理映射、缓存、索引、派生和导出;若保留不可逆汇总,要验证无法再回到个人。最终我会明确“风险降低”而非“绝对匿名”,并让隐私责任人确认剩余风险。验收时构造已知身份、稀有组合和外部辅助信息做受控重识别评估,检查小群体查询、跨实验令牌和精确时间是否能串联;发现风险就进一步聚合、抑制或限制访问。评估方法、攻击假设和剩余风险版本化保存,数据结构变化后重新执行。 任何“匿名”标签都要有责任人、攻击假设和复审日期,不能由开发者自行命名后永久沿用。
- 追问 1:加盐哈希是否就安全?
- 直答 1:仍取决于标识空间、密钥保护和组合属性,通常只能算风险降低,不自动匿名。
- 追问 2:为什么不同实验要用不同令牌域?
- 直答 2:减少跨目的串联和一次映射泄露带来的全局关联风险。
- 追问 3:聚合到仓级就能公开吗?
- 直答 3:不一定,小仓、稀疏班次和精确时间组合仍可能指向个人或敏感业务。
- 详情:安全、数据分级与审计决策
- 问题(综合题):实验数据的访问控制和审计应怎样设计?
- 口述答案:我按职责、对象范围、数据敏感度、目的和时间共同授权,而不是只设“分析师”一个角色。普通分析默认访问假名化、最小字段和聚合结果;实验执行者可看分配与暴露质量,但不必看直接身份;支付、员工位置、原始设备信号和高风险导出需要 RBAC(基于角色的访问控制)叠加租户、仓、时间窗和字段级限制,并通过工单说明目的。高权限采用限时授权、双人审批和自动回收,生产紧急通道也不能绕过审计。每次查询、下载、共享、解密、权限变更、删除和例外都记录操作者、授权来源、目的、对象摘要、字段、时间、结果和接收方;审计日志与业务数据分域,防止管理员同时改数据和证据。控制还要覆盖笔记本、临时表、缓存、邮件和本地导出,不把数据仓权限当全链路完成。异常检测关注短时大量查询、跨仓跨租户访问、非工作时段原文查看、同人申请并批准、长期闲置权限和重复失败提权。发现越权先吊销会话和导出、保全证据、评估影响并通知责任流程,不能只补权限配置。定期复核“谁仍需要什么”,实验结束自动降权;审计保留本身也最小化,避免把敏感原文无限写入日志。真实角色矩阵、告警阈值和保留期需要组织证据核对。上线验收用四类账户做正反测试:普通分析只能看聚合,执行者不能解密身份,审批者不能自行使用权限,紧急角色到时自动回收;随后导出、撤权和删除各走一次完整审计。审计不可用时,高风险查询和导出默认拒绝或进入可靠缓冲,不能静默放行。
- 追问 1:管理员为何也不能免审计?
- 直答 1:高权限风险更高,免审计会让越权和证据篡改无法发现,应职责分离。
- 追问 2:只记录登录日志够吗?
- 直答 2:不够,还要记录目的、对象、字段、查询、导出、共享、删除和权限变化。
- 追问 3:实验结束后权限怎么处理?
- 直答 3:按结束事件自动回收临时权限,复核长期角色,并验证导出和临时副本到期。
- 详情:支付、履约与项目安全审计
- 问题(综合题):保留与删除如何覆盖明细、派生、缓存、导出和备份?
- 口述答案:我先按目的拆保留期限:实验运行需要分配、暴露和结果;结果复核需要冻结快照和分析版本;安全、账务或法律义务可能需要独立证据,但不能把最长义务无差别套给所有字段。每类数据登记责任人、起算点、期限、例外依据和删除方式,到期自动生成删除单。删除请求先验证主体与权限,解析实验专用假名和映射,再沿血缘找到原始明细、质量隔离、汇总、特征、缓存、搜索索引、临时表、导出和共享副本;能删除的幂等删除,需要保留统计的转为经评估的不可逆聚合。备份通常不适合逐条改写,则应隔离访问、设置到期消亡、保存删除清单,并保证任何恢复后先重放删除再对外服务。验证不能只看任务成功,要从服务查询、对象计数、输入摘要和派生总量检查残留,失败项有重试、年龄告警和人工责任人。审计保留请求、依据、执行结果和最小摘要,不继续保存被删除的原始敏感值。删除还可能改变历史指标,正式报表要记录修订版本、影响范围和不可重算边界,不能静默让历史漂移。若支付账务或安全调查有合法保留例外,应限制用途和访问,期限结束继续删除。最终状态可分在线完成、外部副本待确认、备份待到期和争议冻结,不能用一个“已删除”掩盖未闭环项。定期抽取已到期实验,从目录、查询、对象存储和导出接收方反向验证,发现孤儿副本就补血缘和责任人;再执行一次备份恢复演练,确认删除清单会在服务开放前重放。失败任务按年龄升级,任何永久例外都必须重新审批而非自动续期。
- 追问 1:删除后指标变了怎么办?
- 直答 1:记录修订版本和删除原因,必要时保留不可识别汇总,但不得为稳定曲线恢复个人明细。
- 追问 2:备份不能即时删除是否不合规?
- 直答 2:需按适用规则评估;工程上至少隔离、限期、不可常规访问,并保证恢复后重删。
- 追问 3:任务显示成功就完成了吗?
- 直答 3:没有,还要验证查询不可见、派生与导出已处置、失败和例外有责任闭环。
- 详情:数据删除、回填与版本化重算
- 问题(综合题):WMS(仓储管理系统)员工效率分析怎样避免演变成过度监控?
- 口述答案:我先把业务目的限定为验证流程、波次或设备策略,而不是建立个人全景画像。若问题是拥堵和正确交接,通常需要波次、任务、区域、班次、设备状态、完成时间和质量结果,不需要长期精确位置、连续移动轨迹或与工作无关的信息。设计时优先仓级、区域级和班次级聚合,个人标识使用专用假名,仅在安全事故、任务责任或撤回删除确有必要时由受控映射服务解析。必须向相关人员说明处理主体、目的、字段、期限、访问和申诉渠道,不能把参加流程实验作为不透明的绩效条件,也不能把为策略验证采的数据静默转为排名、处罚或其他不兼容用途。随机化按波次、班次或区域减少个人差异和共享资源污染,结果评价同时看正确性、安全和负荷,避免单一速度指标驱动危险行为。访问按仓、职责和时间窗限制,精确明细限时审批,导出带接收方与到期,查询和解密全审计。实验结束删除不再必要的个人级分配和轨迹,保留经评估的流程汇总;若劳动、安全或争议义务要求保留部分证据,单独记录依据和期限。复盘还检查员工反馈、是否出现规避行为、是否把成本转嫁给个人以及算法对不同班次的不公平影响。具体劳动与隐私要求需法务、员工关系和制度责任人确认,不能由技术团队单方宣布合规。验证阶段按班次与岗位检查结果和护栏,不对小群体公开排名;若某类人员负荷或安全事件恶化,即使总体时长改善也停止扩面。申诉、更正和人工解释应有路径,错误身份合并或设备共享不能直接归责个人,相关修订与访问同样写入审计。
- 追问 1:只用工号哈希是否足够?
- 直答 1:不足,班次、区域和时间组合仍可识别个人,且目的、权限和期限没有消失。
- 追问 2:效率实验能用于绩效吗?
- 直答 2:不能默认二次使用,需要独立目的、必要性、公平性、告知和制度评审。
- 追问 3:怎样减少个人数据?
- 直答 3:优先波次、区域和班次聚合,仅在不可替代的责任或安全场景保留受控个人映射。
- 详情:WMS(仓储管理系统)仓内作业与审计
- 问题(综合题):支付实验中的敏感数据如何最小化、对账和删除?
- 口述答案:支付实验首先服从资金正确性和法定处理边界,不能为提高转化把完整账号、凭据、原始身份和无关行为复制到实验表。分析实体用稳定支付单假名,保留资格、分配、暴露、渠道类别、必要金额粒度、状态版本、时间窗和护栏;直接身份、银行卡信息、渠道密钥、完整回调和账务原文留在权威系统,通过受控接口返回核对结果。主指标只接收可核对状态,未知态、重复扣款、金额币种差异、退款与冲正单列,实验分析不能改写账务事实。访问按职责和对象范围控制,普通分析看聚合和假名明细,原文查单需工单、限时授权和审计;导出限制字段、行数、接收方和期限。保留期按实验复核、争议、账务和法律义务拆分,不能因账务数据需长保留就让所有行为字段跟着永久保存。对象撤回或到期删除时,实验侧沿分配、暴露、指标、缓存和导出删除;权威账务若有独立保留义务,继续按该目的最小保存并隔离实验用途。删除导致实验历史不可复算时,记录版本、影响和已删除范围,不恢复敏感明细追求曲线稳定。任何资金护栏或越权访问触发停验、止损、查单、对账和审计调查;没有原始审批和对账记录,所有“提升”仍是 E0。验收还要用虚构测试身份走查询、导出、撤权和删除,证明分析侧无法反查账号、实验权限不能写账务、到期任务能传播到缓存与文件。对账接口只返回最小状态与差异码,详细原文留给独立资金处置流程,防止实验人员借排障扩大权限。
- 追问 1:为什么实验表不能保存完整回调?
- 直答 1:它可能含身份、签名和无关字段,分析只需受控抽取的必要状态与核对结果。
- 追问 2:账务必须保留是否意味着不能响应删除?
- 直答 2:不意味着,应区分法定义务与实验用途,删除无必要副本并限制保留数据的用途和访问。
- 追问 3:实验可以直接补账吗?
- 直答 3:不可以,补账由权威账务流程、审批和对账执行,实验只观测事实与护栏。
- 详情:取消退款、冲正、对账与结算
- 问题(综合题):怎样运行一次“发现—假设—干预—验证—复盘”决策闭环?
- 口述答案:发现阶段先验证数据资格:冻结指标、合同和水位,做源到明细、汇总和服务守恒,排除埋点、迟到、回填与结构变化,再评估业务影响和可逆止损。假设阶段并列多个机制,选择可干预且可证伪的一项,写对象、干预、对照、主指标、护栏、MDE(最小可检测效应)、替代解释和否定条件。干预阶段选择随机化单元与分层,规划样本和完整周期,记录资格、分配、暴露与结果,通过目的、同意、最小采集、权限、保留和回退门禁;高风险不可随机时改用限定灰度或准实验,并降低结论强度。验证阶段先检查 SRM(样本比例不匹配)、数据质量、污染、差异性缺失和停止规则,再报告 ITT(意向处理分析)的绝对效应、相对效应、置信区间、多重检验、护栏和异质性,不把 p-value(显著性概率值)当上线按钮。决策会议比较收益、最坏损害、成本、可推广性和可逆性,合法结果包括采纳、拒绝、继续验证和限定灰度。复盘保存“当时所知”、预测、未知、审批、停止与实际机制,避免结果偏见;行动项有责任人、期限和验证证据,下一轮演练复核关闭。最后回收权限、处置导出和到期数据,把新异常重新送回发现阶段,闭环才真正结束。每阶段设置明确门禁:数据不可信不进假设,假设不可证伪不进干预,回退和合规未验证不启动,完整窗口未结束不决策,行动项与删除未复核不关闭。这样即使结果为负,也产出被否定机制、节省投入和改进后的下一轮合同,而非只有“上线成功”一种结局。
- 追问 1:哪个阶段最容易被跳过?
- 直答 1:数据资格和复盘常被跳过,导致错误现象进入实验、偶然结果又被包装成经验。
- 追问 2:拒绝方案是否算失败?
- 直答 2:不算,可靠否定假设并停止错误投入是有价值的决策结果。
- 追问 3:闭环完成证据是什么?
- 直答 3:决策可追溯、业务影响收敛、行动项复核、权限回收和到期删除均有证据。
- 详情:指标树、行动与经营闭环
- 问题(综合题):实验结果不显著、方向反转或护栏失败时如何决策?
- 口述答案:我先区分证据不足、假设被否定和实验失效。结果不显著时看置信区间:若区间很宽且仍包含有价值收益与重大损害,说明样本、方差或执行不足,只能继续验证或停止投入,不能说两组一样;若区间很窄并排除 MDE(最小可检测效应),可以合理拒绝该业务假设。方向反转先检查预定义分群、时间、新奇效应、结构变化、迟到和多重检验,不能事后只挑正向人群;若完整样本仍显示有害,按回退规则终止。护栏失败优先级最高:资金、库存、安全、隐私等硬失败即使主指标很好也停验、止损和保全证据;软护栏则冻结扩面,验证数据资格、持续时长与业务影响。若出现 SRM(样本比例不匹配)、大规模污染、组间测量不同或差异性缺失,结论不是“干预失败”,而是实验没有因果解释资格,修复基础设施后用新样本重启。复盘记录原假设为何不成立、哪个机制或执行环节导致结果、是否有探索性发现值得新实验,以及已经产生的业务副作用如何恢复。对外表达同时披露负结果和停止原因,不通过改窗口、删样本或换主指标制造成功。真实项目没有原始实验和护栏记录时,只讲方法与 E3 演练。决策表会把四类状态分别绑定动作、责任和再次启动条件,并估算继续采样的机会成本与风险暴露;若新增样本无法显著缩窄关键区间,就停止而非惯性续跑。所有负结果进入可检索登记,后续团队启动相似方案前必须复用,避免重复消耗同类风险。 最终会议纪要明确选择了什么、放弃了什么、依据是什么以及何时重新评估,避免负结果失踪。
- 追问 1:不显著可以追加样本直到显著吗?
- 直答 1:不能随意追加,应按预设序贯规则或形成新版本计划,否则错误率失真。
- 追问 2:一个分群正向能挽救总体负向吗?
- 直答 2:只有预定义且交互可信时才可限定复验,事后分群不能直接挽救。
- 追问 3:护栏失败后还分析主结果吗?
- 直答 3:可用于事故与机制复盘,但不能拿正向主结果支持上线。
- 详情:异常发现、修复、公告与复核
- 问题(综合题):面试中如何讲实验项目而不虚构真实结果?
- 口述答案:我会在开场主动划证据边界:简历和现有项目材料能证明业务主题与候选落点,标为 E2;为了展示计算而构造的基线、样本、阈值和效应全部标 E3;没有原始分配、实验配置、审批、事件明细、分析脚本和复盘记录支持的线上提升、事故规模与制度执行标 E0。然后按背景与不变量、问题资格、假设、设计、运行、失败、验证、隐私和决策九步讲。比如支付先守资金可核对,WMS(仓储管理系统)先守库存与正确交接,IoT(物联网)降噪先守严重风险不漏;说明随机化单元为何选择账户、波次、队列或站点,怎样用 MDE(最小可检测效应)和统计功效规划样本,怎样分开分配与暴露并主报 ITT(意向处理分析)。最能体现深度的是失败边界:SRM(样本比例不匹配)如何停解释,污染和幸存者偏差如何诊断,资金、安全与隐私护栏如何先停后审,删除如何传播到派生和备份。结果只用 E3 数据现场计算效应、区间和决策,不说“我们提升了多少”;面试官追问真实数字时,我说明需要哪些监控、账务、事件和审批证据才能升级。最后讲采纳、拒绝或继续验证的理由,以及权限回收、保留删除和行动项复核,让可信度来自方法、边界和可复算证据。我还会主动给一个反例和撤销条件,例如主指标上升但资金护栏失败时必须回退,展示判断不是只会追正向曲线。对个人贡献则落到自己能证明的合同、评审、埋点、排障、恢复或审计产物,并明确团队责任,避免把候选制度和集体成果全部据为己有。
- 追问 1:不报真实提升会不会显得项目弱?
- 直答 1:不会,可证伪设计、失败边界、计算和取证路径比无证据比例更可信。
- 追问 2:哪些可以说成真实事实?
- 直答 2:只有简历、源码、配置、原始数据或可复现记录直接支持的内容。
- 追问 3:如何回答“你具体做了什么”?
- 直答 3:只讲自己能证明的合同、分配、校验、排障、评审或恢复产物,不把候选制度归为个人成果。
- 详情:项目事实映射与证据边界
- 问题(综合题):请用一条主线总结实验、隐私、合规与指标决策闭环。
- 口述答案:我的主线是“先证明问题与数据有资格,再用最小、可逆、合规的干预取得证据,最后把不确定性写进决策”。从发现开始,冻结指标实体、事件、窗口、分母、去重、迟到、版本和权威源,做质量守恒并区分真实变化与数据异常。把现象转为可证伪假设,明确对象、干预、对照、机制、主指标、护栏、MDE(最小可检测效应)和否定条件。按共享状态选择账户、波次、队列、仓或站点作为随机化单元,必要时分层并按簇相关修正样本;用基线、方差、统计功效、资格率、暴露率和完整业务周期规划执行。运行时分别记录资格、分配、暴露、结果和副作用,主报 ITT(意向处理分析),持续监控 SRM(样本比例不匹配)、新奇效应、幸存者偏差、污染、数据质量与安全护栏,预定义停止和回退。分析同时给绝对与相对效应、置信区间、p-value(显著性概率值)边界、多重检验和可推广范围;相关观察只生成假设,因果强度取决于随机或可信反事实设计。隐私从最小化采集、同意和目的限制开始,贯穿脱敏、假名化、访问、导出、保留、删除和审计。决策可以采纳、拒绝、限定灰度或继续验证,复盘保存当时证据、关闭行动项、回收权限和到期数据。所有项目映射为 E2,数字为 E3,真实结论无证据时为 E0。最终交付不只是一张结果表,而是问题与假设版本、分配和样本清单、效应与护栏报告、隐私审批、决策记录、回退证据和删除审计组成的证据包。任何一环缺失都降低结论等级;新业务周期、规则或数据合同变化后重新进入发现阶段,不把一次实验变成永久真理。
- 追问 1:整条主线最重要的硬门禁是什么?
- 直答 1:数据资格、资金库存安全、隐私目的与权限任一失败,都停止扩面和高风险决策。
- 追问 2:最常见的统计错误是什么?
- 直答 2:事后改指标、连续偷看、多重检验不治理、把未显著当等价和忽略分配失配。
- 追问 3:最常见的隐私错误是什么?
- 直答 3:以“以后可能有用”全量采集,把假名化当匿名,并忽略导出、派生、保留和删除。
- 追问 4:闭环何时真正结束?
- 直答 4:决策和业务影响收敛、行动项复核、权限回收、数据到期处置与审计都完成时。
- 详情:指标语义、事实与决策入口
