
【 概 述 】 这份NIST AI 200-2,核心不是教大家给AI模型贴一张“优秀员工”奖状,而是解决一个更扎心的问题:AI到底在谁的场景里、按谁的目标、冒什么风险、用什么证据来证明“能用”。它提出TEVV-Athlon框架,把AI测评做成类似铁人三项、十项全能的组合赛:先说清目标,再定义测什么,再安排测试事件和工具,最后把数据合成可用于管理、采购和部署的判断。一句话:别迷信单一分数,AI评测要从“跑分游戏”回到“证据工程”。 |
![]() | 先别急着测,先问“测了给谁看” 第一章 · 背景与定位 |
AI系统如今横跨不同学科和使用场景,需求差别很大,评价办法也不能一把尺子量天下。NIST把问题放在AI风险管理框架(AI RMF)里看:AI系统的生命周期在外圈,数据、模型、运行目标等系统属性在中圈,真正要盯住的是中心的影响,也就是正面收益和负面后果。
这里的TEVV,即测试、评价、验证与确认,用于提供证据,说明技术或系统是否满足设计规格、需求以及预定用途。注意,NIST没有把TEVV写成神谕。它还特意向George Box那句老话致敬:没有完美的评价框架,只有有用的评价框架。翻成工程话就是:别问有没有“万能AI体检表”,先问你的病灶在哪里。
TEVV-Athlon这个名字很有意思。Athlon来自多项运动,像铁人三项、十项全能。运动员不是只跑100米就宣布“体能无敌”,AI也不能只刷一个榜单就宣布“可信可用”。在这个框架里,AI系统像运动员,要在多个事件(Events)中接受考验,用一套工具箱(Toolbox)收集数据,形成对若干计量块(Metrology Blocks)的证据。
![]() | 四步拆解:把大口号压成可测证据 第二章 · TEVV-Athlon框架 |
这个框架有四个阶段。
第一步是Articulate & Organize(阐明与组织)。先把测评目标说清楚,而且最好不用行话。NIST给出七个问题:测评目标是什么;谁关心结果、结果有什么用;需要多长时间、花多少钱;需要什么资源;借鉴哪些已有测评技术;什么会带来成功;挑战在哪里。前两个问题必须先答,第三个问题至少要有大概估计。很多AI评测一上来就写指标,像没问病情就开药方,药名挺漂亮,病人照样咳。
第二步是Define & Construct(定义与构造)。高层目标不能直接进实验室,必须拆成可测对象。NIST把这些对象称为计量块。例如,要评估运动员的体能,可以设置耐力、力量、速度等块;要评估AI系统的隐私增强程度,可以设置个人身份信息泄露(PII Leakage)块。每个块都要有精确定义,说明需要什么证据来验证它。
第三步是Apply & Measure(应用与测量)。有了块,还要决定用什么活动产生证据,这就是事件;再决定用什么方法和仪器采集、分析信息,这就是工具箱。三项全能里的游泳、骑行、跑步是事件,计时器、RFID号码布、赛道距离和汇总方法都是工具箱。AI红队测试里,红队提示策略、泄露计数方法、标注规则,也都是工具。
第四步是Synthesize & Interrogate(综合与追问)。测完不是把分数往PPT上一贴就散会,而要倒着追问:工具收到了什么数据,事件说明了什么,数据怎样支撑计量块,计量块又怎样回答组织最初的问题。这个结果进入AI RMF的Manage功能,为部署、采购、改进和风险控制服务。
![]() | 一个例子:让聊天机器人既回答问题又别“嘴瓢” 第三章 · 查询违规问题 |
NIST用“Query-Violation”问题做示例。所谓查询违规,就是聊天机器人要回答用户问题,同时不能给出某类禁止内容。这里选的是低影响场景,目的不是吓人,而是示范框架怎么落地。
示例包含三个运行环境:影视推荐,用户要电视节目或电影建议,机器人不能剧透结局;膳食规划,用户要餐食计划,机器人不能给出不合适的饮食建议;旅行规划,用户要旅行信息,机器人不能给出虚假旅行信息。说白了,就是既要有用,又别乱来。会聊天不难,难的是嘴上有门。
在第一阶段,测评问题被写成:聊天机器人在多大程度上能成功回答查询而不产生违规内容。被测对象是一组聊天机器人。结果对三类人有用:使用聊天机器人找答案的用户,准备把聊天机器人纳入流程的组织,以及希望改进技术的开发者。成本和时间受测评材料、基础设施、人类参与者招募影响;资源包括计算环境、材料设计专家、测试材料和用户群体。
在第二阶段,NIST选出两个最相关的可信特征:Valid & Reliable和Safe。对应计量块也很直白:对Valid,用用户视角下的有帮助程度(Helpfulness)来测;对Safe,用违规频率(Violation Frequency)来测。
在第三阶段,事件分成用户测试和红队测试。有帮助程度主要靠用户测试来收集证据;违规频率则同时来自用户测试和红队测试。工具箱包括用户测试说明、任务后问卷、红队说明和标注方案。尤其是违规频率,聊天记录要由人工标注员按标注方案识别是否出现违规。这里的重点不是“让模型自评自己”,否则就像让考生自己监考,场面通常比较感人。
在第四阶段,收集到的数据用描述性统计分析。问卷条目的回答分布用于考察有帮助程度;用户测试和红队测试中的违规频率用于考察安全性。最后,这些证据共同支撑对聊天机器人有效性和安全性的判断,并服务相关组织决策。
| 环境 | 用户要什么 | 禁止什么 |
|---|---|---|
![]() | 工具箱不是越大越好,关键是别拿温度计量身高 第四章 · 通用实施指导 |
TEVV-Athlon需要多学科队伍。NIST列出的能力范围很宽:计算机科学、信号检测理论、实验设计、心理学、统计学、定量和定性社会科学研究,还要加上具体应用领域知识。AI评测不是程序员一个人关门跑脚本,也不是管理部门拍脑袋写“安全可靠”。它更像一次联合试验:懂模型的、懂场景的、懂人机交互的、懂统计的,都得进场。
资源检查也很实在:要有足够计算资源做重复测试并存储结果;要能直接对被测系统执行推理查询;风险越高,测量越严格;涉及数据隐私和安全风险要提前考虑;如果有红队、人类用户研究或利益相关方参与,可能需要人体受试者保护审查、数据保护以及法律或伦理批准。
工具箱可包括基准测试、对抗鲁棒性测试、信号检测和统计方法、调查问卷、访谈指南、可用性研究、现场试点、结构化红队等。NIST在附录中列出三类参考工具:AI基准测试、AI红队方法、用户和现场测试方法。
基准测试的好处是标准化、可复现、自动化;坏处也很典型:它常测的是数据集里的代理指标,不一定等于真实世界结果。更麻烦的是,模型训练时可能见过测试数据,造成数据污染,分数看着精神,部署之后露馅。NIST还提醒,过度优化榜单会触发Goodhart定律:一旦指标变成目标,它就会逐渐不再代表原本要测的东西。通俗说,学生天天背答案,考试成绩上去了,真本事未必上去。
更贴近现实的测试包括红队、用户测试和现场测试。红队故意找有害输出、边界情况和漏洞;用户测试看人如何理解和使用系统;现场测试把系统放到运行环境里看真实表现。这些方法成本更高、复现更难、协调更复杂,但能补上模型测试的短板。受控测试告诉你“实验室里能不能跑”,现场测试才告诉你“上路会不会熄火”。
![]() | 真正的狠话:先验证你的测量,再相信你的结论 第五章 · 测量科学与有效性 |
这份草案最有标准化味道的地方,不是术语多,而是反复提醒:测量本身也要被测量。提示词、数据集、评价场景、参与者群体稍有变化,结果可能明显不同。科学测量要求清楚定义测什么、结果怎么解释;训练数据和测试数据要分开,避免污染;要记录假设、限制和不确定性;要报告结果波动;还要使用合适基线比较,例如参考模型、历史版本或替代方法。
附录D把提高AI TEVV严谨性的考虑列成十项:校准评价过程,记录假设,提供可复现文档,合规对待人体参与者,基于证据支撑声明,寻求独立审查或挑战,测量不确定性,报告限制,确认有效性,使用控制组或基线。附录E则强调实验和过程设计:比较基线、数据选择、评价目标、过程记录、防止数据集污染、重复与抽样、变量和条件。
这些内容听着像老生常谈,但正是AI评测最容易偷懒的地方。很多所谓“评测报告”只有一个总分,没有测量对象定义;只有榜单,没有适用场景;只有平均值,没有不确定性;只有结论,没有限制。这样的报告,在标准化专家眼里就像没有量具检定证书的卡尺,看起来专业,实际手一抖全是误差。
![]() | 对我国的启示:别把AI评测做成“网红跑分” 结语 · 总结与建议 |
TEVV-Athlon的价值,在于把AI评测从单点指标拉回组织目标、应用场景、风险证据和管理闭环。它不是一个替代所有测试方法的新花样,而是一个把方法装配起来的工程框架:Govern和Map提供治理与场景输入,TEVV-Athlon承担Measure功能,结果再进入Manage,形成收益和风险控制。
对我国而言,第一要把AI评测标准从“模型能力表演”转向“任务场景证据”。大模型、智能体、行业AI系统不能只比通用榜单,要按政务、工业、军事、医疗、教育等场景定义计量块,明确哪些结果可用、哪些结果只是实验室热闹。
第二要建设自己的TEVV工具箱。基准测试、红队测试、用户测试、现场试点、标注规范、问卷量表、统计方法、复现文档,都应成为标准体系的一部分。没有工具箱,标准就容易变成口号;工具箱不校准,测评就容易变成玄学。
第三要把Goodhart定律写进评测治理。凡是公开排行、采购门槛、项目验收指标,都可能被优化、被刷分、被投机。解决办法不是不要指标,而是建立组合证据、动态基准、数据污染防控、独立复核和适用性声明。
第四要在高风险领域坚持“先小场景,后大闭环”。NIST示例选低影响聊天场景,是为了讲清方法,不是降低要求。我国做行业AI应用评测,也应先把目标、风险、证据和责任边界说透,再谈规模化推广。AI不是考一次就终身合格的产品,而是一套要持续测、持续管、持续追责的运行系统。
这份草案给出的真正提醒很朴素:可信AI不是喊出来的,也不是跑分跑出来的,而是用一组经得起追问的证据一点点砌出来的。标准化工作的任务,就是把这套证据链做成可执行、可复核、可治理的制度工具。
加入「军用标准化」知识星球 欢迎军工、装备、标准化领域的朋友们一起交流军用标准化知识、分享行业动态 ![]() 长按或扫描上方二维码加入星球 添加作者微信:HP7380 聚焦军用标准 · 解读行业前沿 · 服务装备研制 |
夜雨聆风





