ARTICLE · 1143183
AI Agent 评测有一个根本性的问题:benchmark 和真实体验之间有条鸿沟
AI Agent 评测有一个根本性的问题:benchmark 和真实体验之间有条鸿沟
AI Agent 评测有一个根本性的问题:benchmark 和真实体验之间有条鸿沟。
现在的 Agent 评测基本靠任务完成率、步数、成功率这些指标——本质上是「它能在实验室里跑通几个预设关卡」。但真实用户遇到的是另一套东西:模糊的需求、错误的假设、中途改方向、上下文噪声……#AI
广东,57分钟前,