AI 产品经理手册
第一章 综合考试题(答案见另外一篇推送)
(第一节 ~ 第五节)
时间:120 分钟 满分:100 分
一、选择题(共 10 题,每题 1 分,共 10 分)
每题只有一个正确选项,将答案字母填写在题后括号内。
1. 关于"评测六要素",以下哪个选项完整且正确?( )
A. Task、Dataset、Rubric、Metric、Judge、Evaluator
B. Task、Dataset、Rubric、Metric、Judge、Protocol
C. Task、Dataset、Rubric、Metric、Judge、Benchmark
D. Task、Sample、Rubric、Metric、Judge、Protocol
2. 以下哪个说法最准确描述了"Rubric"与"Metric"的关系?( )
A. Rubric 负责整份 Dataset 的汇总,Metric 负责单条 sample 的判断
B. Rubric 和 Metric 是完全相同的概念,只是命名不同
C. Rubric 定义单条 sample 怎么判;Metric 定义整份 Dataset 怎么汇总、设门槛、驱动决策
D. Rubric 只用于自动化评测,Metric 只用于人工评测
3. 大模型时代"评测"的正确定位是?( )
A. 仅作为上线前的质量守门员,确保产品达标才上线
B. 评测是需求定义本身,应前置到产品设计阶段
C. 评测主要依赖线上 A/B 实验,离线评测意义有限
D. 评测应在研发完成后作为验收标准,不影响需求定义
4. 一个"合格的 Sample"需要包含哪四个核心要素?( )
A. user_profile、context、query、label
B. user_profile、context、query、expected_output
C. scene_tag、context、query、expected_output
D. user_profile、difficulty、query、expected_output
5. Dataset 的核心质量指标是什么?( )
A. size(数据规模),越大越好
B. accuracy(标注准确率),越高越好
C. coverage(覆盖率),结构化覆盖优先
D. diversity(多样性),越多样越好
6. 关于 LLM-as-a-Judge 的偏见,以下哪项描述有误?( )
A. 位置偏见:模型倾向偏好出现在某位置的回答
B. 冗长偏见:模型倾向给更长的回答打更高分
C. 自我偏好:模型倾向给与自身风格相似的回答更高分
D. 权威偏见:模型倾向给权威机构出品的内容更高分
7. Rubric 三层结构中,具有"一票否决"权的层级是?( )
A. 质量维度(Scoring Dimensions)
B. 体验偏好(Nice-to-have / Preferences)
C. 红线(Redlines / Must-pass)
D. 合规层(Compliance Requirements)
8. MT-Bench(2023)验证 GPT-4 作 Judge 与人类标注的相关性约为多少?( )
A. 60%+
B. 70%+
C. 80%+
D. 95%+
9. 关于 Dev Eval 与 Test Eval 的正确描述是?( )
A. Dev Eval 用于上线认证,每半年更新;Test Eval 用于日常迭代,每季度更新
B. Dev Eval 用于迭代,每季度更新 30%~50%;Test Eval 用于认证,每半年更新,访问严控
C. Dev Eval 和 Test Eval 完全相同,区分意义不大
D. Dev Eval 只测红线场景;Test Eval 只测高频场景
10. 以下哪个 Benchmark 采用"持续滚动更新"机制以防止数据污染?( )
A. MMLU
B. HumanEval
C. LiveCodeBench
D. GSM8K
二、填空题(共 15 题,每空 1 分,共 15 分)
第 1~10 题:根据教材内容填写空白处,多个空请依次填写。
第 11~15 题:根据公式或数学定义填空。
1. 可执行的需求公式为:可执行的需求 = ________(Samples + Context)+ ________ + ________
2. 在 Agent 时代,评测范式从 eval ________(评最终答案)升级到 eval ________(评整条决策轨迹)。
3. Rubric 三层结构按优先级从高到低依次为:________(一票否决)> ________(评分维度)> ________(加分项)。
4. Dataset 三层分布结构:第一层 ________(占主体);第二层 ______________(红线兜底);第三层 ________。
5. 好的 Metric 组合包含三类:________ Metric(守门)+ ________ Metric(能力)+ ________ Metric(感受)。
6. 标注一致性 Cohen's Kappa(κ)值在 ______ 到 ______ 之间被认为显著一致(行业达标);低于 ______ 则不可用。
7. 评测体系的三种衰减类型:题库 ______、裁判 ______、北极星 ______(即 Goodhart 定律)。
8. Sample 的三大来源渠道:① 从 Task 定义直接拆;② __________________(脱敏、还原上下文);③ __________________(红线场景必须人工审核)。
9. GPQA Diamond 包含 ______ 道 PhD 级题目,非专家联网答题正确率仅约 __________。
10. 在 Pairwise 评测中,消除位置偏见的方法是同时做 ________ 和 ________ 两次评测;AlpacaEval 2.0 用 ______________ 指标来抑制冗长偏见。
— 以下为公式 / 数学定义填空 —
11. F1 分数的计算公式为:F1 = ____ × Precision × Recall /(Precision + ________)。当 Precision = Recall = 0.8 时,F1 = ______。
12. ROUGE-N 评估的是生成文本与参考文本的 n-gram ________ 率(覆盖方向);BLEU 评估的是 n-gram ________ 率(命中方向)。两者关注方向相反,因此评测开放生成任务时不能仅凭其中一个指标下结论。
13. Pass@k 是代码生成评测指标,含义是在 k 次生成中至少有 ____ 个解通过单元测试的概率;当 k=1 时,Pass@1 等价于普通的 __________。
14. Bad Case Pass Rate = 新版本通过的 ________________ 样本数 / 旧版本 ________ 样本总数。若总分提升但该指标 ________,应警惕"刷榜"而非真实改进。
15. Cascade Judge(级联评审)的核心思路是:先用 ________(低成本)模型快速过滤高置信度 case,仅将 ________ case 送给强模型精判,以此降低评测总 ______。
三、判断题(共 10 题,每题 1 分,共 10 分)
正确的打"√",错误的打"×",填写在题后括号内。
1. 在 AI 产品时代,PRD 已经完全失效,应被评测体系完全替代。( )
2. "Sample 就是 Query",一条裸 Query 可以直接作为合格的评测 Sample 使用。( )
3. 1000 条同质化数据集的质量,优于 200 条结构化、有层次覆盖的数据集。( )
4. BLEU / ROUGE 是通用质量评测指标,可以衡量模型回答是否"好"。( )
5. 安全性违规应使用扣分逻辑处理,而不应采用"一票否决"机制。( )
6. Eval 数据绝不能直接进入训练集,但 eval 揭示的失分模式可以作为构建训练数据的信号。( )
7. 在搜推时代,产品效果的主要监督信号来自用户点击、停留、转化等行为数据。( )
8. LLM Judge 做 Pairwise 评测时,应同时做 A→B 和 B→A 两次,以消除位置偏见。( )
9. 通用 Benchmark(如 MMLU)分数高,就代表模型在业务场景中表现好,可替代业务 eval。( )
10. 当离线 eval 分数连续两个版本高于基线但线上体验无改善时,应触发熔断机制,暂停 eval 上线门禁。( )
四、概念解释题(共 5 题,每题 3 分,共 15 分)
用简洁准确的语言解释下列概念,要求切中要点,不超过 5 句话。
1.(3 分)【Goodhart 定律】请解释 Goodhart 定律的含义,并说明它在 AI 评测体系中是如何体现的。Dev Eval 与 Test Eval 的分离设计如何缓解这一问题?
2.(3 分)【离线-线上拟合】什么是评测"拟合"(离线-线上拟合)?评测体系拟合失灵时有哪三个典型信号?
3.(3 分)【Fluke Success 与 Trace 评测】解释"Fluke Success"(侥幸成功)的含义,以及 Agent 评测为何需要从 eval answer 升级到 eval trace。Agent Rubric 三层结构是什么?
4.(3 分)【F1 vs Accuracy 适用场景】F1 分数和 Accuracy 各自适用于什么类型的评测场景?在类别严重不平衡的数据集中,为什么不能只用 Accuracy 作为核心指标?请举一个评测场景说明。
5.(3 分)【评测运营闭环】什么是"评测闭环"?请说明一个完整的运营评测闭环应包含哪些关键环节,以及缺乏闭环时评测体系会退化成什么状态。
五、简答题(共 5 题,每题 4 分,共 20 分)
结合教材内容作答,要点清晰,适当举例。
1.(4 分)请解释"评测即需求,评测即产品"的含义,列举评测六要素,并说明六要素与传统需求模型(理想态 / 现状 / 需求)之间的对应关系。
2.(4 分)什么是 Dataset 三层分布结构?为什么只测高频场景是不够且危险的?请结合具体反面案例说明。
3.(4 分)请说明 LLM-as-a-Judge 的三种主要偏见及各自解法,并描述 Judge 选型决策的两个核心维度。
4.(4 分)什么是 Bad Case Pass Rate?它相比总体 Pass Rate 有什么优势?请描述 Bad Case 回流管道的完整流程(不少于 5 个步骤)。
5.(4 分)评测结论如何指导不同类型的模型训练改进?请说明至少 4 种对应关系,并解释为什么评测是 ML 流程的"上游定向器"而不只是下游检查工具。
六、代码实战题(共 30 分)
题目:本地部署 Ollama,运行 MMLU Benchmark 并对比官方结果
请在本地完成以下五个步骤,并截图或文字说明每步的执行结果:
参考:主流小模型官方 MMLU 数据(5-shot,FP16)
注意:Ollama 默认 INT4 量化,本地得分通常比官方 FP16 低 2~5 个百分点,属正常现象。--num_fewshot 5 为标准设置,请勿改为 0。
答题区(请粘贴关键截图或文字说明):
分值汇总
答案见另外一篇推送文章!!!!!
夜雨聆风