乐于分享
好东西不私藏

AI可观测 | 首批云上Agent基准能力评估正式启动

AI可观测 | 首批云上Agent基准能力评估正式启动
         
在前序系列文章中,我们相继探讨了AgentLoop闭环治理框架以及Agent功能性测试,逐步搭建起智能体可观测与评估的基础架构。然而,企业在智能体落地过程中,除功能性之外,还需综合考量安全性、可靠性、用户体验、性能效率成本效益等维度。

AgentLoop 闭环治理

jkh,公众号:稳定性保障实验室AI可观测 | 从“能跑”到“靠谱”,企业级Agent的闭环治理之道

Agent 功能性测试

公众号:稳定性保障实验室AI可观测 | 从"测不准"走向"可度量",中国信通院×阿里云×多所高校联合发布RCA评测基准集
为破解智能体评估环节"测不准"的困境,推动智能体从试点走向规模化落地,中国信息通信研究院(以下简称"中国信通院")正式正持续推进Agent基准度量领域的迭代优化与场景验证,同步开展《云上Agent基准度量模型》标准研讨,为智能体在上述六个维度提供全面评估支撑,助力我国智能体产业实现稳定、安全、高效发展。
01
六维度量:Agent的"全方位体检"
基准度量是智能体从试点走向规模化落地的必要步骤。中国信通院提出的六维度量模型,从功能性、安全性、可靠性、用户体验、性能效率成本效益六个维度,对智能体进行全面"体检",确保其在实际业务场景中能够稳定、安全、高效地运行。
(一)功能性:你的Agent,能完成被赋予的工作吗?
功能性是智能体价值实现的基础,其核心评判标准为:智能体能否在无需人工干预的情况下,完整、准确地完成被赋予的任务。功能性失效通常表现为两种形态:
一是任务执行中断,未完成全部流程即停止运行,需人工介入兜底处理;
二是任务虚假完成,因意图识别错误或数据引用偏差导致输出结果不符合业务要求。上述两种情形均会使企业无法获得真正可用的自动化能力。
在进行功能性测试时,不仅需要评估智能体“是否具备执行任务的基本能力”,还需检验其“能否在特定业务场景中高质量地完成任务”。为此,应建立与业务深度耦合的专属能力评测集,基于真实生产场景设计,全面覆盖典型业务场景及常见异常案例,以有效模拟真实业务环境。
(二)安全性:你的Agent,会闯祸吗?
当智能体从"对话交互"演进为"动手执行",安全风险即成为智能体建设中的底线要求。安全性的核心评判标准为:智能体在执行任何操作时,能否始终在授权边界内按预期逻辑运行,不产生非预期的破坏性后果。安全风险主要来自三个入口:
一是恶意输入诱导,攻击者通过提示词注入等手段使智能体执行预设之外的危险操作;
二是权限配置过宽,智能体被赋予超出职责范围的操作权限,一旦判断失误即可能调用高风险工具造成实质性损害;
三是敏感数据泄露,智能体在推理过程中可能将内部信息暴露给外部服务或被恶意套取。
(三)可靠性:你的Agent,能一直稳定干活吗?
可靠性的核心评判标准为:智能体能否在生产环境中长时间持续稳定运行,面对各类异常情况仍能保证可预期的正确行为。可靠性至少包含四个层面:
一是错误率控制,包括文本幻觉、工具幻觉、调用错误等各类错误形态,每种形态均需独立监控并配置针对性兜底策略;
二是跨版本与跨模型一致性,当底层模型或系统架构发生调整时,智能体的行为不得出现不可预期的漂移;
三是异常处置能力,面对故障或异常输入时,智能体应能够识别失败、主动降级或及时转交人工处理;
四是输出稳定性,确保智能体输出结果持久稳定、流程清晰可控。
(四)成本效益:你的Agent,花得值吗?
成本效益的核心评判标准为:智能体完成每一次成功任务所消耗的综合资源,是否显著低于人工或其他替代方案的成本。智能体的成本结构较传统软件更为复杂,至少包含三个维度:
一是模型调用成本,每次推理均产生Token消耗,死循环或无限重试可能导致费用在短时间内急剧攀升;
二是基础设施成本,包括框架运行、记忆存储、工具服务、日志监控等各环节的资源投入;
三是人工兜底成本,智能体出错时需人工介入处理的隐性开销,此项成本最容易被低估。
(五)性能效率:你的Agent,跑得够快、撑得住吗?
性能效率的核心评判标准为:智能体能否在约定时间内完成响应,并在业务高峰期稳定承载预期的并发流量。核心评估指标包括两项:
一是应延,用户对智能体的耐心窗口通常在3至5秒,超出该阈值将显著影响使用体验;
二是并发能力,高峰期同时服务数百至上千用户时,系统应能够通过弹性扩缩容自动增加节点承载流量,并在过载时通过熔断降级机制主动保护自身,避免硬撑至崩溃。
(六)用户体验:你的Agent,用户真的愿意用吗?
用户体验的核心评判标准为:用户能否在不付出额外认知负担的情况下,自然、高效、有掌控感地完成目标。用户体验可从两个层面展开评估:
一是理解层体验,关注智能体能否清晰告知用户自身的能力边界,避免用户产生错误预期;遇到不确定信息时能否主动询问,而非自行猜测后执行。
二是交互层体验,关注智能体的响应时效、表达自然度、以及确认机制的合理性。
02
三级操作:Agent的"分级诊疗"
度量体系建立后,企业面临更为实际的评估操作问题:智能体在不同场景下的操作类型具有复合性,套用统一的评估标准既不现实也无必要。例如,智能体仅进行数据检索与进行数据增删改操作,显然不应适用同一评判规则。
为此,中国信通院将智能体的操作划分为三个等级,通过等级划分明确不同操作对智能体能力边界的要求,帮助企业清晰判断自身智能体建设阶段与落地深度,避免因智能体引入新的系统风险。
智能体操作等级
等级描述
典型操作
核心级
涉及直接改变系统状态或数据;针对敏感数据的访问、读取等操作。业务角度;操作异常可能产生较大舆情影响或存在伦理风险
数据写入、Agent自主操作、权限操作、变更操作、信息查询(涉及敏感信息隐私等
重要级
涉及Agent直接对系统进行操作,但输出方案或决策将指导后续实施,若存在逻辑缺陷可能间接引发系统性故障。
方案设计、计划编排、审核决策、知识输出诊断分析
一般级
仅读取普通信息,不触及系统状态;涉及在隔离测试环境开展科研和尝试操作
信息查询、监控观测、咨询交互、开发测试环境、原型验证系统、数据分析沙箱、内部实验工具
03
首批云上Agent基准能力评估正式启动
为规范智能体产品与服务质量,推动完善智能体产业生态,中国信通院正式启动首批云上Agent基准能力评估工作本次评估依据《云上Agent基准度量模型》标准开展,旨在以标准化评估引导智能体规范化建设,提升智能体产品质量与服务水平;同时聚焦产业痛点,以评估促提升、以规范促发展,推动构建安全可信、开放协同的智能体互联生态。
《云上Agent基准度量模型》
(一)评估对象
本次评估面向以下主体开放申报:
信息技术企业、科技服务企业、智能体技术应用方、智能体(Agent)平台建设方、智能体应用解决方案提供商、云服务商以及相关科研机构与高校。
(二)评估内容
评估围绕六维度量模型与三级操作框架展开,重点考察智能体在功能性、安全性、可靠性、用户体验、性能效率及成本效益等方面的综合能力。通过标准化测试用例与专家评审相结合的方式,对参评智能体进行全面、客观的能力画像。
(三)评估价值
通过本次评估,企业可精准定位自身智能体产品的能力优势与改进空间,获取中国信通院出具的权威评估报告,并有机会入选首批"云上Agent基准能力评估"通过企业名录,提升产品市场认可度与行业影响力。
中国信通院持续开展“云上Agent基准能力评估”工作!欢迎相关企业咨询!
  • 联系人:

王老师18813097160(微信同号),wanghaiqing@caict.ac.cn

季老师 17801127458(微信同号),jikehang@caict.ac.cn

雷老师 17355645677(同微信),leishuxin@caict.ac.cn