夜雨聆风学习资料网

ARTICLE · 1154165

AI Agent #19

AI Agent #19
请自行验证是否准确哈~
声明:仅供参考,应该没有任何“原题”。

AI Agent · 单位 U19(统计显著性:A/B 实验、功效与多重比较)

本段主题:把"谁更好"变成可信结论——两比例检验、最小可检测效应与样本量、多重比较校正(Bonferroni/BH)、实验设计与 SRM/混淆、序贯检验与 peeking、方差缩减(CUPED)、分群异质性与交互、两类错误与 PPV、至少一次假阳的概率、在线实验平台系统设计。全部以"Agent 版本上线决策"为场景。

题目编号:TRACK-03-U19-Q01

  • 题型:笔试 | 考点:评测 / 两比例检验 / z 统计量
  • 题干:对照版 Agent 与新版各跑 400 次任务:对照成功 120,新版成功 152。用两比例 z 检验判断新版是否显著更好(α=0.05 双侧)。(a) 合并比例与标准误;(b) z 值与双侧 p;(c) 结论。
  • 假设与边界:两组独立、任务同分布;大样本正态近似(各 np、n(1−p) ≥ 5);双侧检验;两比例用合并方差口径。
  • 解析:(a) p̂1=0.30、p̂2=0.38;合并 p̄=(120+152)/800=272/800=0.34;SE=√(p̄(1−p̄)(1/n1+1/n2))=√(0.34×0.66×(1/400+1/400))=√(0.2244×0.005)=√0.001122=0.033496。(b) z=(0.38−0.30)/0.033496=0.08/0.033496=2.388;双侧 p=2(1−Φ(2.388))=2×0.00846=0.0169。(c) p=0.0169<0.05,拒绝原假设,新版显著更好。
  • 参考答案:(a) p̄=0.34,SE=0.0335;(b) z=2.39,p≈0.0169;(c) 显著(新版更优)。
  • 验算/自检:另一种口径——用非合并(未池化)SE:SE=√(0.3×0.7/400+0.38×0.62/400)=√(0.000525+0.000589)=√0.001114=0.033377,z=0.08/0.033377=2.397,p≈0.0165,与池化口径接近,结论一致。边界:若新版 148(差 0.07),z=(0.37−0.30)/0.0335≈2.09,p≈0.037 仍显著但接近临界。
  • 常见错误:用单侧却按双侧解读;SE 用单组而非两组的组合;把 p 值当成"新版更好的概率"。
  • 评分要点:SE=0.0335;z=2.39;p≈0.017;结论显著。
  • 追问/变形/还能这样考:换成等价的置信区间方法看是否包含 0;配对设计(同任务上比较)如何更高效;贝叶斯两比例后验方法与频率派结论对照。

题目编号:TRACK-03-U19-Q02

  • 题型:笔试 | 考点:评测 / 最小可检测效应与样本量 / 功效
  • 题干:基线成功率 0.30,希望以 80% 功效、α=0.05 双侧检测出提升到 0.33(绝对 3 个百分点)。求每组所需样本量,并说明总样本量。
  • 假设与边界:两组等样本量;正态近似;公式 n/组 = (z_{α/2}+z_β)²[p1(1−p1)+p2(1−p2)]/(p2−p1)²;z_{α/2}=1.96、z_β=0.8416。
  • 解析:(z_{α/2}+z_β)²=(1.96+0.8416)²=(2.8016)²=7.849。p1(1−p1)=0.3×0.7=0.21;p2(1−p2)=0.33×0.67=0.2211;和=0.4311。Δ²=(0.03)²=0.0009。n=7.849×0.4311/0.0009=3.3837/0.0009=3759.7→3760/组。总样本≈7520。
  • 参考答案:每组约 3760,两组共约 7520。
  • 验算/自检:缩放校验——效应量减半(Δ=1.5pp)时 n 变为 4 倍(≈15040/组),符合 n ∝ 1/Δ²;另一种口径——用 Cohen's h 近似,h=2(arcsin√0.33−arcsin√0.30)≈0.0646,按 n/组=2(z_{α/2}+z_β)²/h²=2×7.849/0.004173≈3762,与精确比例公式的 3760 一致(注意该公式含因子 2,漏掉它会把样本量算成约一半)。
  • 常见错误:忘记 z_β(只按 α 反解);Δ 用相对提升而非绝对差;忘记向上取整;忽略流失/无效任务需再上浮。
  • 评分要点:3760/组、7520 总;给出 n∝1/Δ² 校验;区分绝对/相对提升。
  • 追问/变形/还能这样考:不等分组(1:2)如何配平样本量;预注册 MDE 防止事后挑效应;用历史成功率估 p 的稳健做法。

题目编号:TRACK-03-U19-Q03

  • 题型:笔试 | 考点:评测 / 多重比较校正 / Bonferroni 与 BH
  • 题干:同时把 20 个 Agent 变体与基线比较,逐次检验 α=0.05。20 个 p 值升序前几项为 0.001, 0.008, 0.012, 0.020, 0.030。(a) 独立检验下的族错误率 FWER;(b) Bonferroni 阈值;(c) 用 BH 在 FDR=0.10 下拒绝哪些。
  • 假设与边界:20 个检验相互独立(近似);FWER=1−(1−α)^m;Bonferroni=α/m;BH:找最大 k 使 p_(k) ≤ (k/m)·q。题中只给出最小的 5 个 p 值,其余 p 值均不满足各自 BH 阈值(否则 k* 可能更大)。
  • 解析:(a) FWER=1−0.95^20=1−0.3585=0.6415。(b) Bonferroni=0.05/20=0.0025,只有 p=0.001 通过。(c) BH 阈值 (k/20)×0.10=0.005k:k=1→0.005(p=0.001 ≤ ✓)、k=2→0.010(0.008 ✓)、k=3→0.015(0.012 ✓)、k=4→0.020(0.020 ✓)、k=5→0.025(0.030 ✗)。最大 k*=4,拒绝前 4 个(0.001/0.008/0.012/0.020)。
  • 参考答案:(a) ≈0.6415;(b) 0.0025,仅 p=0.001 显著;(c) BH 拒绝 4 个。
  • 验算/自检:交叉核对——BH 明显比 Bonferroni 宽松(拒绝 4 个 vs 1 个),符合"BH 控 FDR、Bonferroni 控 FWER"的直觉;边界复算:若 20 个变体强正相关(同一底座只改提示词),实际 FWER 远小于 0.6415,但 Bonferroni 仍过保守,此时更宜用分层/预注册少量变体。
  • 常见错误:20 个变体不校正直接挑最小的 p;把 BH 阈值写成 q/m 常数;把 FDR 与 FWER 混用;忽略变体间相关性对校正强度的影响。
  • 评分要点:FWER≈0.64;Bonferroni=0.0025;BH 拒绝 4 个;FDR/FWER 区分。
  • 追问/变形/还能这样考:变体间相关时用更有力的方法(如分层 gatekeeping);把"选最优变体"本身当作选择偏倚(winner's curse);预注册变体集减少多重比较。

题目编号:TRACK-03-U19-Q04

  • 题型:面试 | 考点:评测 / 实验设计与混淆控制 / SRM 与随机化
  • 题干:设计一次 Agent 版本上线的在线 A/B 实验。如何随机化、如何保证无混淆、如何发现"样本比例失衡(SRM)"等隐患?
  • 假设与边界:线上流量可分流;任务/请求可哈希分桶;无唯一答案,考察思路。
  • 解析:随机化单位——按用户/会话/任务哈希分桶(同一语义单元内一致),避免同一任务跨组导致污染。SRM 检查:观测分桶比例与设计比例(如 50/50)应一致,用卡方检验,p<0.001 报警(说明分流 bug)。混淆控制:同时间窗、同流量渠道、同工具/数据版本;慢启动/爬坡避免与系统负载耦合;预注册主指标与 MDE 防事后挑选。
  • 参考答案:要点——① 哈希分桶且与随机种子绑定,可复现;② SRM 卡方检验作为守门指标;③ 组间仅实验变量不同(数据快照/工具版本固定);④ 预注册主指标与 MDE,次指标仅探索;⑤ 爬坡灰度并对早停设规则(接 Q05)。
  • 验算/自检:SRM 数值例——设计 50/50,某日 A 组 10200、B 组 9800,期望各 10000,卡方 = (200²/10000 + 200²/10000)=4+4=8,df=1,p≈0.0047,未达 0.001 报警线(暂不报警但需关注);若 A=10600、B=9400,卡方=(600²/10000)×2=72,p<1e−16,立即报警。边界:若分流在任务粒度但指标在用户粒度,会出现伪 SRM,需统一粒度。
  • 常见错误:只报业务指标不做 SRM 检查;随机化粒度与指标粒度不一致;组间工具/数据版本不同;事后挑显著指标。
  • 评分要点:随机化单位与一致性;SRM 卡方守门;混淆控制清单;预注册。
  • 追问/变形/还能这样考:分层随机化(按流量渠道/任务类型);交错实验(switchback)适用于强时间效应;样本比例失衡与真实流量变化的区分。

题目编号:TRACK-03-U19-Q05

  • 题型:面试 | 考点:评测 / 序贯检验与 peeking / 早停与校正
  • 题干:实验中每天看一次结果,一见显著就停(peeking),会有什么问题?如何做合法的序贯检验与早停?
  • 假设与边界:多次查看数据;无唯一答案,考察思路;关注 I 类错误膨胀与功效损失。
  • 解析:每次查看都是一次检验,多次"显著性机会"会抬高假阳率。粗略(独立多次查看)下 5 次查看的真实假阳率 ≈1−0.95^5=0.226,远超 0.05。防治:① 固定样本量、只在结束时检验(最简);② 序贯检验(SPRT、组序贯,用 alpha-spending 分配各次查看的 α);③ 自适应设计(按信息量分配 α);④ 贝叶斯决策规则(后验概率阈值,天然支持随时查看)。
  • 参考答案:问题=假阳率膨胀(5 次查看约 0.226);做法——固定时长不偷看,或组序贯把 α 按查看次数切分(如 O'Brien-Fleming 早期极严、后期放宽),或采用"至少观察满最小样本量 + 预注册早停规则"。
  • 验算/自检:数值核对——若用 Bonferroni 均分 5 次,每次 α=0.01 可在 FWER≈0.05 下控制(保守);Šidák 每次阈值 1−0.95^{1/5}=0.0102(略宽)。边界:若 5 次查看高度相关(同批数据),实际膨胀 <0.226,但无法精确用独立乘积刻画,须用组序贯方法。
  • 常见错误:天天偷看一见显著就停;把"随机化"当"无关紧要";用独立乘积公式精确声称 0.226(那是上界)。
  • 评分要点:说明假阳膨胀;给出合法早停机制(固定时长/组序贯/alpha-spending/贝叶斯);数值示例。
  • 追问/变形/还能这样考:SPRT 的期望样本量与阈值设定;把 A/B 与多臂老虎机(bandit)在探索代价上的权衡;监管/合规场景为何偏好固定样本。

题目编号:TRACK-03-U19-Q06

  • 题型:面试 | 考点:评测 / 方差缩减 / CUPED 与协变量
  • 题干:A/B 实验指标方差大、样本量吃紧。如何用实验前协变量做方差缩减(如 CUPED)?给出估计式、方差缩减量,并说明前提。
  • 假设与边界:有实验前可观测协变量 X(如历史成功率),与结果 Y 相关;线性调整;无唯一答案,考察思路与推导。
  • 解析:CUPED 用实验前协变量把 Y 调整:Y_adj=Y−θ(X−X̄),其中 θ=cov(Y,X)/var(X)。调整后方差变成 var(Y_adj)=var(Y)(1−ρ²),ρ 是 Y 与 X 的相关系数。方差缩减比例=1−(1−ρ²)=ρ²。等价地,达到相同功效所需样本量乘 (1−ρ²)。
  • 参考答案:估计式 Y_adj=Y−θ(X−X̄),θ=cov/var;方差降为原来的 (1−ρ²);所需样本量降为 (1−ρ²) 倍。示例:ρ=0.6 → 方差降 36%,样本可降 36%。
  • 验算/自检:数值核对——ρ=0.6 时 1−ρ²=0.64,样本乘 0.64(省 36%);ρ=0.8 时 1−ρ²=0.36(省 64%)。边界:ρ=0 则无收益(θ=0);若协变量受实验影响(post-treatment),会引入偏差,不能用;协变量的分布要跨组可比(随机化保证)。
  • 常见错误:用实验后变量做协变量(引入偏差);把 θ 在实验组/对照组分别估(应合并估);协变量与分组相关(违反随机化)。
  • 评分要点:调整式与 θ;ρ² 方差缩减;样本量乘 (1−ρ²);协变量须为实验前且组间可比。
  • 追问/变形/还能这样考:多协变量(回归/ML 调整);CUPED 与分层随机的异同;把方差缩减类比"用历史因子做对冲"(跨赛道直觉)。

题目编号:TRACK-03-U19-Q07

  • 题型:面试 | 考点:评测 / 分群异质性与交互 / 辛普森悖论
  • 题干:整体上新版显著更好,但拆到每个任务难易层都不显著甚至更差,为什么?如何正确地做分群分析避免误判?
  • 假设与边界:分群后样本变小;分群检验也构成多重比较;无唯一答案,考察思路。
  • 解析:可能原因——辛普森悖论(某层在两组中的样本占比不同,混合时权重被扭曲);或分群后样本太小、功效不足导致"不显著≠无效"。正确做法:先看整体(预注册主指标),分群仅作探索;若做分群推断,须对多重比较校正,并报告每层样本量与区间;差异的显著性应检验"交互项(treatment×group)"而非逐层单独看。
  • 参考答案:整体显著 + 每层不显著,常见于分群功效不足,未必矛盾;判断异质性要检验交互效应:拟合 Y~treatment+group+treatment×group,交互项显著才说明效果因群而异;同时校正分群多重比较。
  • 验算/自检:数值直觉——整体每组 n=400 时 SE≈0.0335;若拆 4 层每层 n=100,SE≈0.067,效应 0.08 的 z 降到 ≈1.2(不显著),说明是小样本功效问题而非真实无效应。边界:若出现辛普森反转(整体 A>B、各层 B>A),须检查分层变量在两组的分布是否失衡(做基线/SRM 校验):随机化下多为偶然失衡或小样本噪声,若失衡显著且系统性才提示分流 bug。
  • 常见错误:把"分层不显著"当作"整体显著是假";不做交互检验就宣称异质性;分群上不校正多重比较;忽视分群样本量。
  • 评分要点:解释功效不足与辛普森两种可能;用交互项检验异质性;分群多重比较校正;辛普森反转提示分流问题。
  • 追问/变形/还能这样考:预注册的亚组分析;用收缩/层次模型稳定小层估计;把分群结论用于"定向上线"的风险。

题目编号:TRACK-03-U19-Q08

  • 题型:逻辑概率 | 考点:评测 / 两类错误与 PPV / 基数效应
  • 题干:团队测很多 Agent 改进想法,其中 10% 是真实有效。检验做到 α=0.05、功效 0.80。(a) 一个"显著结果"是真实有效的概率(PPV)是多少?(b) 若真实有效占比升到 50%,PPV 变多少?(c) 说明 PPV 对基率的敏感性。
  • 假设与边界:各检验独立;"显著"来自 α(假阳)或功效(真阳);基率 π 为真实有效占比;随机变量为检验结果二值。
  • 解析:PPV = 功效×π /(功效×π + α×(1−π))。(a) π=0.1:= 0.8×0.1/(0.8×0.1 + 0.05×0.9) = 0.08/(0.08 + 0.045) = 0.08/0.125 = 0.64。(b) π=0.5:= 0.4/(0.4 + 0.025) = 0.4/0.425 = 0.9412。(c) PPV 随基率 π 单调上升:低基率(探索满地撒网)时即使显著也有高假阳占比。
  • 参考答案:(a) 0.64;(b) 0.941;(c) 基率越低,显著结果越可能为假阳。
  • 验算/自检:交叉核对——FDR=1−PPV:π=0.1 时 0.36,π=0.5 时 0.059。边界:若 π→0,PPV≈(功效/α)·π→0(几乎全假阳);若功效→1 且 α→0,PPV→1。也可用 1000 次检验举例:80 真阳、45 假阳 → 80/(80+45)=0.64 ✔。
  • 常见错误:认为 α=0.05 就意味着"显著的有 95% 是真的";忽视基率;把功效与 PPV 混同。
  • 评分要点:0.64、0.941;PPV 公式与 FDR 关系;基率敏感性。
  • 追问/变形/还能这样考:提高功效或降 α 对 PPV 的影响;预注册减少"低基率"检验;把这套逻辑用到回归测试门禁的假阳预算(接 U20)。

题目编号:TRACK-03-U19-Q09

  • 题型:逻辑概率 | 考点:评测 / 至少一次假阳与 Šidák 校正 / 监控看板
  • 题干:一个监控看板每天看 3 个共享指标,任一越界即告警,各指标在无异常时以 α=0.05 独立触发。(a) 每天至少一次误报的概率;(b) 用 Šidák 校正后的每指标阈值;(c) 若改为看 10 个指标,阈值与误报率各是多少?
  • 假设与边界:各指标检验独立、无异常时假阳独立;Šidák:α_adj=1−(1−α)^{1/m};对比 Bonferroni α/m。
  • 解析:(a) m=3:P(至少一次)=1−0.95³=1−0.857375=0.142625。(b) Šidák:α_adj=1−0.95^{1/3}=1−0.983049=0.016951。(c) m=10:P(至少一次)=1−0.95^{10}=1−0.598737=0.401263;Šidák 阈值=1−0.95^{0.1}=1−0.994884=0.005116(Bonferroni 为 0.005)。
  • 参考答案:(a) 0.1426;(b) ≈0.01695;(c) m=10 时误报率 0.4013,阈值 ≈0.00512。
  • 验算/自检:交叉核对——Šidák 略大于 Bonferroni(0.01695 vs 0.01667;0.00512 vs 0.005),符合"Šidák 更紧(更少保守)"的结论。边界复算:m=1 时 α_adj=0.05(无校正);m 很大时比值 Šidák/Bonferroni→1。
  • 常见错误:多指标看板不做校正;把 Bonferroni 当成唯一解;认为指标相关时仍按独立算(相关时真实误报率更低,但方向判断仍成立)。
  • 评分要点:0.1426、0.01695、0.4013/0.00512;Šidák 与 Bonferroni 对比。
  • 追问/变形/还能这样考:指标相关时的有效独立数估算;把校正阈值与 SLO/错误预算联动的告警策略(接 U20);静态阈值 vs 自适应阈值。

题目编号:TRACK-03-U19-Q10

  • 题型:扩展延伸 | 考点:评测 / 在线实验平台系统设计 / 容量与失败模式
  • 题干:设计一个"Agent 版本 A/B 实验平台":支持分流、SRM 守护、指标计算、序贯检验、方差缩减与显著性报告。请给出容量估算、失败模式与权衡旋钮。
  • 假设与边界:日均 50 万次任务请求;同时运行 ≤10 个实验;指标按天聚合;须可复现与可审计;系统设计题,无唯一答案。
  • 解析:容量估算——50 万请求/日,每次分流≈微秒级哈希;请求级事件日志 50 万行/日,行~200B ≈ 100 MB/日 → 月~3 GB,年~36 GB(含压缩更低)。指标计算:10 实验 × 若干指标 × 每日一次聚合,作业量极小,可批处理。SRM 守护:每日每实验一次卡方 ≈ 秒级。失败模式——① 分桶哈希不随机导致 SRM;② 分流粒度与指标粒度不一致产生伪 SRM;③ 指标口径跨天变化(归因窗口变化)致结果断层;④ 序贯检验未实现却按天宣称显著;⑤ 方差缩减协变量泄漏(用了实验后变量);⑥ 变体相互干扰(同用户跨实验串扰)。权衡旋钮——分桶粒度、实验并发上限(防串扰)、检验方式(固定样本 vs 组序贯)、是否启用 CUPED、指标聚合频率。
  • 参考答案:给出数字(50 万事件/日≈100 MB/日、年≈36 GB、指标作业秒级)、≥5 失败模式及防护(哈希种子可复现+SRM 卡方报警、统一粒度、归因窗口冻结、组序贯 α 分配、协变量 pre-treatment 校验、实验互斥层),以及粒度/并发/检验法/CUPED/聚合频率五个旋钮。
  • 验算/自检:容量复算——50 万×200B=10^8 B=100 MB/日;×365=36.5 GB/年 ✔。失败模式自检——每条给可观测信号(SRM 卡方 p、伪 SRM 检测、口径版本号、α 消耗曲线、协变量时点校验、跨实验串扰度量)。
  • 常见错误:不做 SRM 守护;偷看结果不校正;用实验后协变量做方差缩减;实验之间无互斥导致干扰。
  • 评分要点:容量含数字;≥5 失败模式;旋钮可执行;强调 SRM 与合法序贯。
  • 追问/变形/还能这样考:与离线评测(U16–U18)结论不一致时如何排查;多臂 bandit 与固定 A/B 的取舍;把实验元数据纳入可复现审计链。

相关学习资料