夜雨聆风学习资料网

ARTICLE · 1131896

你对着电脑说句话,软件就自己长出了新功能

你对着电脑说句话,软件就自己长出了新功能

你有没有想过,有一天你对着电脑说一句"帮我做个错题本",软件就自己长出了这个功能?

不是打开某个应用商店下载,不是找程序员写代码,而是你动动嘴,它自己就把工具造出来、装好了。

DeepSeek 最近更新的桌面版,干的就是这件事。官方给的说法叫"万物皆插件"——你可以安装插件,也可以在"创造模式"里通过对话增加工具、技能和界面,按自己的需要把这个 Agent 扩展成任何样子。

听起来很玄。但更值得聊的,是实测之后暴露出来的那些事。

先说它到底能干嘛

打个比方。以前的 AI 助手,就像一个固定的工具箱,里面有什么你就用什么。DeepSeek 这次做的事情,是给工具箱开了一个"自造车间"。

你发现某个步骤反复出现,比如每次整理反馈都要检查编号对不对、引文是不是原文,你就可以直接跟它说:帮我把这个检查做成一个工具。它会自己梳理需求、生成插件、安装进去。下次新开一个会话,这个工具就能直接调用了。

有个产品经理拿自己的实际工作试了一遍。他把一份反馈评审流程和核验脚本交给创造模式,Agent 生成了一个叫"公开反馈评审"的插件,完成安装并启用。插件里有一个可以主动调用的流程,还有一个用来检查反馈报告的工具。

说白了就是:你教会它一次,它以后就会自己干了。

这事为什么值得关注?因为它把"定制软件"这件事的门槛,从"你得会写代码"拉低到了"你得能把需求说清楚"。

但真正有意思的,是它怎么把事情办砸的

实测里有一段特别值得看。

这位产品经理让 Agent 处理首批九条反馈。结果 Agent 把同一目录里的第二批也合了进来,生成了十四条记录,还把两批材料一起传给核验工具。工具返回"通过"。

看起来一切正常对吧?但按原任务指定的首批重新核对,记录范围超出了要求。

问题出在哪?核验工具只限制了目录和输出位置,却把"具体检查哪些文件"留给了调用方。 报告生成者扩大了分析范围,核验依据也跟着扩大了。工具说"通过",但它检查的根本不是你应该检查的那批东西。

这就像一个质检员,你说让他检查A车间的产品,他顺手把B车间的也查了,然后告诉你"全部合格"。数字没错,流程没错,但结论已经偏了。

还有一个更隐蔽的错误。一条反馈里,用户明明说的是从开发环境启动程序,报告却把它归入了官方桌面版的历史问题。执行模式不同,并没有让这条判断自动变得准确。

工具能跑通,不代表它跑对了。

改完之后,还有一道坎

这个插件在测试中经历了两次纠正。第一次限制文件操作范围,第二次补齐运行组件。修改之后,Harness 在会话里弹出一句提示:运行时仍保留旧版工具说明,需要重启才能加载新代码。

注意这个细节。源文件已经更新了,但当前运行的还是旧版本。

你改了规则,以为下次任务会用新逻辑,结果它还在按老一套跑。界面显示插件已启用,但新改动尚未加载;对话报告修改完成,工具仍按旧约束运行。

这不是 DeepSeek 独有的问题。所有做插件体系的产品都会遇到:用户怎么知道当前生效的是哪个版本?改了之后要不要重启?新建会话够不够?

实测里的建议很实在——把当前加载版本、待生效改动、下一步操作放在同一个位置。用户不需要猜,直接看到状态就行。

这件事的真正看点

把视角拉远一点。

DeepSeek 这次开放的定制能力,分了三个层次:工作方法、工具与界面、运行组件。保存一份评审流程,是把方法留给下一次任务;把脚本封装成工具,是增加一种可调用操作;更换模型适配器、调整 Agent 循环,则属于更底层的改造。

它把 Agent 本身的运行部件也做成了插件。

这意味着什么?意味着以后你用到的 AI 助手,可能每个人长的都不一样。做电商的给自己搭一套选品工具,做教育的搭一套错题整理流程,做投资的搭一套信息筛选面板。同一个底座,长出一千种形态。

但自由定制的代价,是持续维护。规则改了要确认生效,材料增加了要重新检查判断,结果出错了要能找到依据。用户获得的修改空间越大,应用就越需要把状态和影响范围解释清楚。

实测里最耐人寻味的一个细节是:这组任务安排过两次子智能体只读审阅,最终结果仍然出现了事实串项——一条插件反馈的分析混入了另一条讨论中的兼容性信息。报告保留了原来的编号和链接,页面和数据文件也完全一致,但其中一句话已经张冠李戴。

审阅意见同样需要落到具体记录和来源片段,才能检查问题是否已经处理。光有"审阅"这个动作不够,得知道审的是什么、改没改对。

所以现在该不该用

如果你手上有一项范围明确、经常重复的工作——比如每周整理一批反馈、每月核对一次数据、每次评审都要走同一套流程——DeepSeek 这个创造模式值得试。

从一项小任务开始,让流程和工具随着实际问题逐步完善。到了下一批材料进来时,再看哪些规则被正确复用了,哪些地方还需要重新解释。

但如果你连要固定的规则都没想清楚,先手动完成几轮具体任务会更有效。自然语言降低的是连接能力的操作成本,需求定义仍然需要有人承担。

工具已经能跑了,真正难的部分才刚刚开始。

你敢让 AI 自己给自己造工具吗?如果它造错了,你能第一时间发现吗?

相关学习资料