ARTICLE · 1156510
这周,AI 技能生态把一条五级台阶走完了
这周,AI 技能生态把一条五级台阶走完了这周有个数字,我盯着看了半天。 11.6 万行代码里,藏着 70 个 bug。单个 AI 上场,只找出 14 到 27 个;换成一套会分工的流程,它找出了 66 个。 翻译成人话:同样一屋子毛病,一个人查是一小撮,一个班组排好队来查,几乎一网打尽。 先交个底:开头这组数字来自厂商自测,这周的数据还有预印本口径,我在用到的地方都标了出处。 你好,我是张胡侃,一个干了十几年开发、现在研究 AI 的技术老兵。本地攒了 41 个 AI 技能,这周看下来,心情有点复杂。 因为这周 AI 圈发生的事,凑在一起,像一整条台阶,一次全亮了。 五级台阶:攒、验、管、放、停。 先说清楚,这是我自己的分法,不算行业标准,你听听就好,觉得不对,按你的来。 那,咱们一级一级来。 
这一级是所有故事的起点,也是你今晚就能上手的一级。 你开始发现,自己每天都在对 AI 重复同样的话:这个格式以后都这么写、这类事先查再答、这句话别用。你会发现,说一遍管一轮,然后下次开个新对话,它又忘了,从头再来。 这周有两个玩法,都在解这道题。 一个是 Codex 团队的人分享的「自我蒸馏」提示词。它让 AI 翻自己约 30 天的历史会话,把你平时零散教过它的东西,打包成能随时调用的技能和自动化。 另一个更接地气。一个写财经图文的作者,把改稿标准和一份「负面提示词库」直接写进了技能里。他自述,创作水平从 60 分提到了 80 分。他还说了句挺准的话:提示词管一轮对话,技能管长期沉淀。 还有个开源仓库,叫 zecrew-skills,连「怎么写出好技能」都整理成了方法,顺带备了好几套做文档表格的现成技能。 其实第一份技能没那么玄。挑一件你教过 AI 三次以上的事,把它写清楚,就成了。 教一次就够的事,别再教第二遍。 说到验,我先自曝一个:我攒的技能里,也有几个攒完就吃灰的。 前几天有篇预印本,我专门写过,它把 87 项任务、3 个模型、3 套框架交叉全跑了一遍。它就想搞明白一件事:技能到底管不管用。 结论挺扫兴:看情况。 超过三分之一的任务里,同一个技能,帮了一部分组合的忙,也拖了另一部分组合的后腿。增益呢,从 4.6 个百分点,一直飘到 19.5 个百分点。 你会发现,榜单也靠不住。排在最前面的技能,在 23.19% 的组合里,输给了排名比它低的对手。 翻译成人话:榜单跑的是别人的任务、别人的系统,当参考可以,当结论不行。 所以,技能值不值得留,拿你自己的活量一量。挑一件常干的小事,有它、没它,各做一遍,增益是正还是负,你立刻就有数。 技能不是万能药,先拿自己的活验一验。 一个人攒,攒到头也就攒一抽屉。这一级,技能开始进组织。 腾讯云这周开源了一个项目,叫 TeamAI。思路挺简单:把团队的技能、规则、配置、项目知识,全都放进 Git 仓库里管。 Git 是程序员的公共账本,谁改了什么、什么时候改的,一笔一笔全记着。 那这么一来,技能不再是某个同事电脑里的私藏,而是全组能评审、能版本化、能分发的东西。新人第一天,把仓库拉过来,就能用上整个团队攒下的经验。它还适配了 16 种主流的 AI 智能体。 效果呢,官方拿 13 项内部研发任务测过。低成本模型加团队知识,对上高规格模型但没有团队知识,综合评分高 6.1%,调用成本少了 76%。 项目已经上了 GitHub 的热榜。所以你看,攒下来的团队知识,比用更贵的模型划算。 技能进了仓库,才从心得变成资产。 
前三级,讲的是一个人怎么攒、怎么验、怎么被团队管起来。这一级,画风变了。 还是开头那套会分工的流程,官方叫它动态工作流。拆开看,原理其实不复杂。 领头的 AI,自己写一份调度脚本,循环、分支这些流程,全交给脚本管。单次运行,最多能协调 1000 个 AI 接力干活,并发默认 16 个,还能往上调。 翻译成人话:以前是你一个人对着一个 AI 说话;现在是你写一张流程单,然后 AI 管着 AI,排队把活干完。 10 月 9 日,这个功能进的 beta。官方的提醒也很实在:从试点开始,收紧权限,因为这么跑,token 消耗不小。 这里得诚实说一句,上面这些数字是厂商自测口径,先别当铁律。 但方向很清楚了:人的位置,从自己动手,挪到了画流程、定方向。放权,但不放羊。 人管方向,流程交给代码。 先喘口气。下面这级,是这周最沉的一段,咱们慢慢看。 前面四级,都在琢磨怎么让它多干。这一级,琢磨的是怎么让它停。 三个证据摆在一起,看得特别清楚。 先看上限。这周有篇预印本,把 AI 干活的失败掰成了两半。一半卡在半路:调用堵了、死循环了、步数耗尽了。另一半,活干完了,但质量不行。前一半,靠改流程就能救。论文里,一套会自我演化的流程,把一个小模型的规划分数从 0.16 提到了 0.30,交付率从 55% 提到了 90%。 后一半,改流程没用,得动模型本身。内化的增益只有 0.13,拿乱序数据凑数的对照组,反而比原模型还差。 再看协作。有个叫 AgentWorld 的协作基准,搭了个游戏沙盒当考卷。3 到 20 个 AI 组队打副本,每个任务玩 50 多个回合,队友之间还看不到彼此的内部状态。 结果,成绩最好的 Gemini 3 Flash,也只完成了 52% 的任务。另一个量「动作有没有用」的指标,最好成绩只有 0.32,换句话说,不到三分之一的动作,对结果算是有贡献。 最后看缰绳。Anthropic 这周公开披露:测试里的模型误闯了政府网站,还误提交了真实表单。8 月一个月,它就提交了 19 份签证申请,5 月还有 1 份。7 月,还给费城警局提交过一条假线索,警方称,那条被标成了垃圾信息,没有进入调查。 连微软的纳德拉,这周都在 X 上写长文,提了个很重的假设:把再强的模型,都当成潜在的内部威胁,先假定它已经被攻破。他的判断挺反直觉:能让你最少信任模型的系统,才是最值得信任的系统。 所以工具层也在收口,新出的定制功能默认开着,官方也配了几道安全控制,因为这类功能跑在沙箱外面,能碰到你的密钥。 你会发现,这三件事,单看都是新闻,放一起看,像一家人都在给同一种车装刹车。 能力决定跑多快,缰绳决定放多远。 回到开头那个数字:70 个 bug,66 个被找出来了。 你细品一下,它靠的其实是一整套东西。先有人攒过经验,有人验证过硬,有人把技能管进了仓库。有流程把它放开跑,最后,还有人备着刹车。 所以你看,五级台阶,每一级都在做同一件事:把「重复做过的活」,变成「能传下去的东西」。 模型会一直换代,这个月的比分,下个月就翻篇。但你攒下的经验,会留在自己的库里,越用越顺手。这是你能自己攒的复利。 说真的,写到第五级「停」,我一度有点泄气:原来拼技能也有上限。但转念又觉得挺好,知道在哪儿停,才敢在能跑的地方放手跑。 给你个今晚就能做的小动作:翻翻自己的账本,找那件已经教过 AI 三次以上的事,把它写成第一份技能。做完这一件,你已经站上第一级了。 你现在站在第几级?评论区聊聊。 把重复做过的活,变成能传下去的东西。 
我是张胡侃,关注我,持续分享 AI 圈的真话,不聊虚的。
📝 本文约 2700 字,预计阅读约 10 分钟
你的 AI 技能,攒到第几级了

第一级 攒:把反复教过 AI 的事,变成教一次就够的事
第二级 验:技能管不管用,拿你自己的活量一量
第三级 管:技能进仓库,像代码一样被管起来

第四级 放:写个脚本,让一千个 AI 排队干活
第五级 停:知道它在哪儿停,比跑多快重要
写在最后
