夜雨聆风学习资料网

ARTICLE · 1157893

AI工具能力边界:明说做不到什么,比宣称全能可信10倍

AI工具能力边界:明说做不到什么,比宣称全能可信10倍

上周我给一个 Agent 装了套去水印工具。它 README 写了 17 种格式、20 个后端,我照着装,跑了,出图,一切正常。

直到我想知道"它到底检查了什么"。翻遍文档,没有一段话告诉我:哪些是硬保证,哪些是尽力而为,哪些根本没做。

我后来去看它的测试目录,才发现它有答案,只是没写在文档里。

AI 工具的能力边界,比它宣称能做什么,可信 10 倍。

这件事,我盯着 30 多个 AI 工具项目看了很久,越看越确定。

什么是"能力边界自披露"?

就是工具主动告诉你三件事。

第一件:我装了哪些后端。不是默认都有,是报给你听。第二件:我做到什么程度。硬保证是保证,尽力是尽力,没做就明说,三档分开。第三件:我做不到的,谁来兜底。外部工具,还是你自己判断。

功能层是同质化的。"能出图""能去水印""能跑 119 个测试",这些每个工具都喊。

治理层才是分水岭——说清楚自己做不到什么,绝大多数工具做不到。

archify,66k 星,MIT。Agent Skill 里最狠的"可验证渲染"。

我 9 月 23 日在 iSH 上真跑过。doctor 四项全过,真实 spec 出图 820KB 自包含 HTML,validate 零告警。

但它最值钱的不是能出图,是它明说了什么。

  • • 82 条 rule code,零条查语义。它验几何、验模式、验制品完整性,图说得对不对不在它的范围
  • • CI 用真实 Chrome 加 ffmpeg 解码导出 WebM 逐帧比对,但那是验证动画,不是验证内容
  • • 唯一一道语义闸门是人工视觉审查,没做就报「未执行」,不许升级成「通过」

它不是"全都能做"。它是"我验过这几层,那层没验,明说"。

watermarks-remover,23.7k 星(23734),MIT。我去它源码里核对过,5 条治理证据在源码里都能找到对应文件或端点。

  • • `references/ethics.md` 显式分四段:该做的、不该做的、报告诚实、责任使用
  • • `/capabilities` 端点,报哪些后端在线,文档写明只在后端在线时才推荐该能力
  • • `tests/test_c2patool_report.py` 覆盖报告生成,可验证动作和尽力而为动作分档
  • • `stealer/` 目录 6 文件,做闭环测量:自己种水印、自己移除、测残留,每轮标注跑了哪几层
  • • PostToolUse 钩子永远跑,但文档诚实写明没有 hook 能改写聊天消息

它最狠的一句:"layer-A-only 分数绝不被读成全流水线分数。" 不让你把局部通过当成整体通过。

Vercel Skills,30.6k 星,`npx skills add` 一行装到 73 个 Agent。

它的 SKILL.md 规范(agentskills.io)里,"能力边界"是可选字段。

绝大多数 Skill 没填。

我翻过 7 个主流 Skill,没有一个在 frontmatter 里写「这个 Skill 做不到什么」。默认假设变成了:没写,就是全都能做。

这是行业默认假设的反面。你看到一个工具文档里全是"能做 A、能做 B、能做 C",没有一段"做不到什么、什么情况会降级、谁来兜底"。别假设它全能,多半是没写,不是没有。

下次接任何工具、写任何 Skill,10 分钟过一遍。

#
检查项
标准
范例
1
能力端点
有没有"我装了哪些后端"的自报告接口,且只在 present 时推荐?
watermarks-remover `/capabilities`
2
证据分层
报告是否把"可验证 / 尽力 / 没做"分档?
archify 布局层 vs 语义层
3
降级行为
缺依赖时是静默失败,还是明说"够不到哪一层"?
watermarks-remover 语义化退出码
4
闭环测量
有没有"自己种缺陷→修→测修复度"的 fixture?
watermarks-remover `stealer/`

一条都没打勾,不代表工具坏——代表它没披露。 你没披露,我就只能猜,猜的成本你出。

讲这些之前,先自曝一个坑。

9 月 18 日我给自己的评测门禁给 archify 打分,出来 71/100 PASS。但 meta-skill 层只有 31/100。

根因:我的 FME/HAB 正则全用中文(因为/根因/兜底),archify 的 SKILL.md 是英文,只命中 `fallback` 一个词,1/10。

实际 archify 的失败机制编码是全库最强——禁止非零退出称成功 + iteration budget + 2 轮不改善即停并如实报告。

我用了"能力边界"的尺子量它,却量错了语言。这条没写进工具里,是我自己的盲区。

功能层是同质化的,治理层才是分水岭。

4 条清单,10 分钟,判断一个工具值不值得信。

你手上装的那个工具,有告诉你它做不到什么吗?

在评论区说一个你踩过"文档没写=我以为全能"的坑,我下篇拆。

相关学习资料