ARTICLE · 1066244
插件越来越多,Agent真的变强了吗?
读到 Claude Code 的插件评估文档时,最触动我的是一个朴素的问题:如果不装插件,Agent 也能完成任务,那么插件究竟贡献了什么?官方通过有插件与无插件的对照运行,观察分数差异,也将技能触发等流程指标与结果评分区分开来。这给了我开发 Plugin Value Lab 的直接启发。
插件介绍通常擅长展示能力:能调用哪些工具,覆盖多少场景,怎样完成一次漂亮的演示。但用户真正需要判断的是:在自己的任务里,它是否值得使用?功能可用、结果正确、带来增益,是三个需要分别回答的问题。
我希望做一款面向多种 Agent 的插件功能与价值评估工具,并把科研作为深入探索的方向。先从 Claude Code 和 Codex 出发,让不同宿主中的运行记录能够接受一致的证据审查。
跨宿主的困难远不止接通接口。模型、权限、数据访问和运行环境都会影响结果。如果一组能读取资料,另一组不能,分数差异首先反映的是访问条件。合理的比较,需要先在各自宿主内建立可比基线,再讨论收益能否迁移。
科研让这个问题更加具体。一张差异表达表可能格式完整、解释流畅,却使用了错误的独立样本单位;一个显著的 p 值,也可能来自伪重复。仅凭回答是否像专家,很难识别这些错误。
因此,Plugin Value Lab 0.5.0 开始深入产物本身:在限定的样本级数值和冻结设计下,重算效应、精确检验与多重校正,检查配对、样本覆盖和结论一致性。它能够核验一部分计算契约;供体身份、实验设计与生物学解释,仍需要真实材料和专业判断。
这里还有一个容易混淆的层次:科研结果具有统计显著性,并不意味着插件具有显著收益。插件正确计算出“不支持当前结论”,同样可以完成任务;而它是否优于基线,需要另一套针对插件贡献的研究。
评估规则也必须容纳双向错误。证据不足时应当拒绝过度推断,证据充分时也不能靠一概拒答获取高分。调用过工具、遵循过流程,可以帮助解释行为,但不能替代结果正确性。
价值还必须落到投入上。我更关心每百次任务净增加多少成功,挽救多少基线失败,又引入多少新失败;完成一次合格结果,需要多少模型费用、重试和人工修正。未知费用应保留为未知,估价与结算应分别记录。
样本规模同样决定结论的分量。少量重复适合发现故障,却难以支撑广泛有效的主张。反复运行同一道题,也不会自动增加任务的代表性。评估需要预先确定有意义的提升幅度,并在未见任务上验证。
我希望这些判断能够离开开发者的电脑。方案、版本、原始记录、失败和验证材料应一起保存,让别人有条件重新计算、提出异议。回放可以检查计算是否一致,却不能替代新一轮真实执行,更不能凭文件摘要证明事实真实。
目前,已安装版本的工具调用、科研产物检查和离线回放已经跑通。这建立了功能可用性的证据;真实跨宿主收益、科研用户收益和独立复核,仍是后续需要完成的工作。
下一步,我想先与科研插件作者完成小而完整的改进循环:定位一次失败,修复一个行为,在保留任务上复测,并记录实际代价。长期值得积累的是经授权的真实错误案例、专家审阅的判据,以及能够被他人复核的研究。
更远处,Epistemic Plugin Arena 可以成为一个后续构想,探索 Agent 何时调用工具、何时补充证据、何时停止推断。它尚待公开规范、实现和验证。
当插件越来越容易被制造,我们是否也愿意投入同样的精力,认真回答:它在什么条件下帮助了谁,又有哪些地方仍然没有帮助?