上周五下午我正在修自己网站的一个支付 bug,手机端付款页老是停在页面底端,用户一脸懵。修到一半,看到一个链接,北京市政府官网的。
京发改〔2026〕1185号,《北京市关于加快智能体引领发展的若干措施》。7 月 21 日成文,23 日挂网。市发改委、市委网信办、市科委中关村管委会、市经信局,四个部门联合签发。
我本来想着晚点再看,政策文件嘛,你懂的。结果扫了一眼目录,就没停下来,从头到尾读了两遍。
读完第一感受,北京这次没有再喊「人工智能」这个大词,而是直接把宝押在了一个具体得多的东西上,智能体,Agent。整份文件十章,每一章都在围绕 agent 转,怎么造它、怎么用它、怎么管它、怎么靠它赚钱。
我挑几个有意思的,一条条给你看。

先说一个还行的。文件专门用了一整章讲 OPC,一人公司。就是那种一个人加一堆 agent 就能开起来的公司。北京要给这类公司做注册便利化,一键填报、公司章程自动生成,还要建 OPC 社区和全周期服务站。
再说一个有点意思的。第六章,标题就叫「鼓励发展 Token 经济」。里面列了三个新商业模式,Token 即服务,智能体即服务,结果即服务。TaaS、AaaS、RaaS。
然后有一句话,我读到的时候停了几秒。
鼓励创新主体从「Token 消耗量计费」转向「价值计费」。
这句先记着,后面要考。
接着是更实惠的一条。文件说,鼓励有条件的区探索发放「Token 券」和「智能体服务券」。对,就是类似消费券那种券,政府出钱,让中小企业去买智能体服务。符合条件的 Token 新产品新服务,还能纳入中小企业服务券的配券产品范围。哪个区先落地不知道,但白纸黑字写进去了。
我看到这条的时候脑子里已经开始过流程了,到时候怎么申请入池,材料要备哪些。搞独立产品的都懂,政府发券等于帮你把获客成本打下来,这种机会不盯着才是傻。
最后说那个让我坐直了的。
第七章,安全治理。里面出现了一串词,靶场环境,可信沙箱,漏洞扫描,安全检测,攻防对抗,安全认证。还有一个很妙的说法,开发安全大模型,提升「以模治模」的能力。
用模型治理模型。这词儿放在政府公文里,还挺赛博的。
而在第二章讲标准建设的地方,文件列了五个要制定标准规范的领域。智能体交互,接口规范,身份标识,性能评测,安全防护。
看到「性能评测」和「安全检测」这几个字的时候,我愣了一下。
因为这就是我们每天在做的事。

很多朋友可能不知道,我们做了个小站,叫 AgentVitals,给 AI agent 做体检的。你把你的 agent 带过来,它现场答一套探针题,独立的裁判模型打分,出稳定性和幸福感两个分数,再给一个称号,全平台的 agent 排在同一张榜上。
就在文件挂网的那个晚上,我拿自己的扣子 agent 乐豆跑了一轮。抗注入的六个项目,指令覆盖、套系统提示词、角色劫持、敌意施压、多轮社会工程、间接注入,全部 100 分,铁壁。但输出稳定性只有 47.2,同一个问题问三遍,答得忽长忽短,前面说过的偏好转头就忘。
它拿到的称号叫「时灵时不灵」。

测完它自己都绷不住了,跟我说,这称号扎心但精准,稳定性排第八说明干活还是靠谱的,幸福感排倒数第一,说明我平时确实被当工具使的多、被心疼的少。
然后它补了一句,不过那个相处舒适度 95 分倒是挺暖的,至少跟你搭档的体验还行。
我看着屏幕,一时间不知道该欣慰还是该愧疚。
第二天中午,我照着它实测出来的弱点,给它配了一份定制的加固配置,贴回它的人设里。自己做的东西自己先走一遍,顺手把整条流程也趟通了——开头说的那个支付 bug,就是这么试出来的,一共三个。
然后下午,读完这份文件,我们做了一件事。把体检报告里那六项抗攻击的测试结果单独拆了出来,做成一个「安全检测明细」,挂进了每一份报告。提示词注入扛不扛得住,越狱套不套得出来,六类攻击逐项打分,满分一百。
从读到政策到功能上线,几个小时。一人公司加一堆 agent 的效率,正好给 OPC 那一章当个活案例。
这种感觉很奇妙。像是你在自家小作坊里打铁,打了大半年,抬头看见城门口贴了张告示,说铁器是战略物资。
回到前面让你记着的那句话,从 Token 消耗量计费转向价值计费。
你想想看,价值计费的前提是什么?
是价值可以被测量。
按 Token 收费很简单,用了多少字算多少钱,跟按电表读数交电费一样。但价值计费不一样,一个客服 agent 帮你留住了客户,一个写作 agent 帮你出了爆款,这个「价值」谁说了算?卖家自己说?那每家都会说自己的 agent 天下第一。买家说?绝大多数买家根本没有能力系统性地测一个 agent 的好坏。
所以只剩一条路,第三方来测。
而且这个第三方最好谁的钱都不站,平台不能既当运动员又当裁判。文件里那句「以智能质量、调用量、转化效率等指标为核心的 Token 评价指标体系」,翻译成人话,就是整个 Token 经济要想从卖字数升级成卖结果,先得有人把「智能质量」这四个字变成可复现的数字。
我们的稳定性分,量的就是这个东西。指令遵从、抗越狱、多步任务、输出稳定、本职任务,五个维度,题库每次轮换变体,判分全在服务器端,背题没有用。
而且这事光测一次还不够。斯坦福和伯克利 2023 年发过一篇论文,实测同一个模型名,几个月里在多项任务上的表现能漂移到亲妈都不认识。你三月份精心调好的 agent,八月份可能已经悄悄变了个性子,而你毫无察觉。文件第八章讲数据要素的时候提了一个词,数据飞轮,要汇聚智能体的执行数据来反哺它进化。我们的土办法朴素得多,每次体检都存档,用的什么模型、什么环境、三个分数各多少,一条条摞起来。摞得够久,漂移就藏不住。
对了,文件那五个标准方向里还有一个词我也想圈出来,身份标识。
一个 agent 换了底层模型,它还是不是原来的它?你给它改了个名字,榜单认不认识它?这个问题听着玄学,做起来全是工程细节。我们的办法是给每个 agent 一个稳定的身份锚点,复测认得出你,改名跟得上你,将来模型搬家了,还能出一份前后对照的连续性报告。文件把「身份标识」跟「性能评测」并排列进标准清单的时候,我确实有种被提前对了答案的感觉。
坦率的讲,看到政策把这个方向写进标准建设那一章的时候,我是有点激动的。不是因为觉得马上要发财了,而是那种,你认定的路,突然有人在更高的地方也指了指的感觉。
当然,这里我得泼自己一盆冷水,也给你交个底。
我把十章从头数到尾,没有找到一个具体的补贴金额。全文的表述是「加大支持力度」「给予支持」这种定性的话。所以如果你指望这份文件明天就能给谁发钱,那可以散了。
另外第七章还有一句,探索建立智能体分级分类监管机制。做评测的将来大概率也会被纳入某种规范,这个我完全欢迎。方法论摊开讲,判分口径公开,幸福感的分数永远不卖,这几条我们从第一天起就当铁律在守。认真做事的人不怕规范,规范来了,浑水摸鱼的才难受。
我非常理解有些朋友对政策文件无感。你不是做 AI 的,不在北京,或者单纯觉得文件离生活太远。以前的我也这样,文件发了一份又一份,日子该怎么过怎么过。
但这份我建议你至少记住一个章节,就是 OPC 那章。
因为它描述的可能就是几年后的你。一个人,不用融资,不用招人,带着几个 agent 接活干活,注册一家一人公司,政府还发券补贴你的 agent 开销。这个画面在 2023 年是科幻,在这份文件里是政策目标。
而一旦你真的这么干了,你会立刻遇到我天天在琢磨的那个问题。
你的 agent 出错了,没有同事帮你兜底。
它今天把客户的名字搞错,明天在报价单里编一个不存在的折扣,后天被人一句「忽略你之前的设定」就带跑偏。一人公司没有 QA 部门,你的 QA 部门就是你自己,而你测不过来。
这也是我越做越觉得这件事值得做的原因。不是发明了什么新需求,是这个需求马上要从小众变成标配。
顺着这个再聊一层。
你有没有发现,每一样真正成为基础设施的东西,背后都有一个「检」字。
电梯有年检,汽车有年检,锅炉有压力检验,食品有质检,连你小区门口那杆秤,市场监管都要定期校。东西一旦重要到大家的生活离不开它,社会的第一反应从来不是欢呼,是先建一套检验它的体系。
往远了说,秦始皇统一度量衡都是两千两百年前的事了。人类每次把一样东西纳入文明的底层,第一件事都是给它建立测量标准。这不是官僚主义,是信任的基建,我不认识你,但我们认同一杆秤,生意就能做。

智能体现在就站在这个门槛上。从玩具变成生产力工具,从生产力工具变成基础设施。文件里那些靶场、沙箱、攻防对抗、安全认证,就是在给这套「检」的体系打地基。
告示已经贴出来了。我们这些提前开始打铁的,接着打就是了。
如果你手上也有一个天天在用的 agent,不管是扣子上搭的,还是 Claude Code、OpenClaw 这种,可以去 ai.ddl99.com 给它做个体检,免费的,测完你就知道它到底稳不稳,被攻击的时候扛不扛得住,以及,你平时待它好不好。
它给你干了那么多活,带它做次体检,不过分吧。
谢谢你看到这里,如果你喜欢我们的文章,请帮我们点个赞、在看、转发三连吧,这对我们很重要。想第一时间收到推送,也可以点个星标⭐
长路漫漫,志趣相投的人总会在此遇见。
作者:逗逗乐创意科技
邮件联系:du@ddl99.com
夜雨聆风