ARTICLE · 1083383
AI 开始替你办事了:十余款当红智能体,一次说清
——它住在哪、它能碰什么、出了事谁负责
来源说明:本文依据各产品的官方文档、官方博客、GitHub 仓库,以及新华网、中央网信办数据与技术保障中心、路透社、Business Insider、36氪、橙柿财经等公开报道整理。文中所有性能、价格、用户数据均为官方公布或第三方公开实测,作者未对任何产品进行独立测试。
一、两个画面
第一个画面:你在亚马逊下单,页面弹出一行字——
未经授权的 AI 智能体继续访问本网站,违反了亚马逊的使用条款,该条款已得到我方用户认可。
这是 2026 年 9 月 20 日晚间开始发生的事。被封的不是黑客工具,是 Meta 刚上线十二天的个人 AI 助手 Muse。
第二个画面:英伟达 GTC 大会的台上,黄仁勋说——"每家公司都需要制定一套'龙虾战略'。"
"龙虾"是 OpenClaw 的中文外号,因为 Claw 谐音。黄仁勋对它的评价更狠:"它现在是人类历史上规模最大、最受欢迎、最成功的开源项目""这绝对是下一个 ChatGPT"。他还说,OpenClaw 仅用三周就超越 Linux,成为历史上下载量最高的开源软件。
这两个画面说的是同一件事:AI 正在从"会聊天"变成"会替你办事"。而"替你办事"这四个字,一旦落到现实里,立刻会撞上三个问题——它住在哪、它能碰什么、出了事谁负责。
这篇文章把当下最火的十余款产品放在一起讲清楚。它们不是十几个竞品,而是三种不同的物种。
二、先分清三种"住法"
第一种,住在你自己的电脑里。代表是 OpenClaw(GitHub 星标 39 万)、Hermes(约 24.9 万)、OpenCode(约 21 万)、Claude Code(约 14.8 万)。它们在终端或桌面里跑,用你本机的文件和网络,数据不出你的机器。
第二种,住在云上一台专属电脑里。Meta 的 Muse 走这条路:每人一台专属虚拟机。有安全研究者把它的文件系统导出来看过,确认是基于 systemd-nspawn 的 Linux 环境——它不在你手机上跑,而在 Meta 的云里跑。
第三种,住在 App 里。豆包(月活 3.82 亿)、千问(1.67 亿)、DeepSeek(1.30 亿)、腾讯元宝(约五千万)。你看到的是一个对话框,背后是厂商的云。
还有个横跨两边的:ChatGPT。2026 年 7 月 OpenAI 做了次大整合,新版桌面应用首次获得访问本地文件、浏览器标签页和部分桌面软件的能力,并加上了 Computer Use。云端那个 ChatGPT 和桌面上这个,已经是同一个东西的两面。
为什么这一栏最重要?因为普通人真正在意的那个问题——"它会不会偷看我的东西"——答案就藏在"它住在哪"里。
三、它靠什么"动手"
这是全文技术含量最高、也最容易被忽略的一节。同样是"AI 帮你干活",底下的活儿根本不是一回事。目前四条路线。

四条技术路线一览。前三条约是"怎么动手",第四条是"从哪儿下指令",它可以和前三层叠加。来源:作者依据各产品官方文档整理。
第一条,工具调用。模型输出结构化参数,程序去执行。最主流、最可控,OpenClaw、Hermes、Claude Code、OpenCode 都走这条。
第二条,浏览器操控。服务没开放接口,它自己开浏览器,像人一样点。Muse 走这条,官方原话是:有公开接口就用接口,没有的话"可以像人一样,通过浏览器去使用这项线上服务"。这也是它被亚马逊封禁的直接原因。
第三条,屏幕理解。截屏、交给视觉模型、输出鼠标键盘动作。豆包桌面版的"操作电脑"更接近这条。实测报道把它总结成八个字:"接口优先、GUI 兜底"——能直接调的直接调,不能调的才切到看图点击。
ChatGPT 桌面版走的也是这条。有个演示很直观:工程师让它整理自己混乱的 Apple Notes 笔记库,它在后台获得了独立光标,自己建文件夹、拖拽笔记、归类内容,和真人操作电脑几乎没有区别,而用户可以同时继续处理别的工作。
这里有个有意思的对照:它和豆包的"虚拟桌面"解决的是同一个问题——AI 干活时,你别没法用电脑。两条路,一条给它另开一块桌面,一条给它另一个光标。
第四条,消息平台适配。把微信、飞书、Telegram 变成入口。这是入口层,可以和上面三层叠加。OpenClaw 官方列出的支持平台有微信、飞书、钉钉、企业微信、QQ、Telegram、Discord、Slack、iMessage、WhatsApp、Signal 等十余个。
四、它能碰什么——权限的四档
这一节回答"出事了怎么办"。
Muse 做得最狠。它设了一道门:一个叫 Sentinel 的独立智能体,系统级隔离,是"唯一的权限仲裁者"。Muse 只负责提方案,能不能发出去由 Sentinel 决定——不批准,什么都出不了网。配套还有几层:你的密码永远不经过模型,真凭据存在模型读不到的地方,模型拿到的是"替身",在网络出口才被替换成真的;付款走 Stripe 的 Link,生成一次性卡号,只对一个商户一个金额有效;审批按钮刻意渲染在聊天窗口之外,这样万一被注入攻击也够不着;甚至有内核级流量追踪,能区分"干净流量"和"碰过不可信内容的流量"。
但必须放一段原话。Meta 超级智能实验室的副总裁 Tarek Sheasha 在官方博客里承认了两件事:这台安全虚拟机"并不阻止 Meta 在支持、保障或运营服务所必需时访问数据";以及"提示词注入在整个行业仍然是一个未解决的问题"。
对比一下 ChatGPT 的 Agent 模式,差别很清楚:它用的是共享的云浏览器,不是每人一台专属虚拟机;结账时用的是真实支付信息;还有"接管模式",需要你自己登录。而 Muse 是专属虚拟机、一次性卡号、替身令牌。
OpenClaw 的表述是"沙箱或完整权限由你定义"——自由度高,默认值要自己管。
OpenCode 最直接:官方文档自己写着"什么都不指定的话,它从宽松的默认值开始"——读 .env 会被拒绝,工作目录外动手会先问,但编辑文件和运行 shell 命令默认没有任何门禁。
豆包桌面版强调可以指定一个"工作区",官方说法是"权限可控、数据可控、边界清晰"。
五、谁给它大脑,谁付算力钱
这两件事决定了你以后跑不跑得掉。
模型自由度分三档。锁死一家的:Claude Code 只能跑 Claude,Muse 只能跑 Muse Spark,ChatGPT 只能跑自家模型,国产四家只能用自家的。随便换的:OpenCode 支持 75 家以上,Hermes 支持 20 家以上还能接本地模型,OpenClaw 官方声明里有一句很硬气的话——"代码里没有任何一家的模型享有特权"。
成本结构更有意思,而且正在变化。
豆包是最典型的路径:先免费烧钱换规模,到 2026 年 3 月日均 Token 调用量突破 120 万亿;5 月 4 日上线订阅——标准版 68 元一个月、加强版 200、专业版 500,年费最高 5088 元。结果当月活跃用户减少约 610 万,一项九万多人参与的投票里,43% 的人明确表示"收费就不用了"。
ChatGPT Work 需要至少 20 美元的 Plus 计划;Claude Code 是 Pro 20、Max 5x 100、Max 20x 200 美元;Claude Cowork 含在所有付费 Claude 计划里。OpenCode 工具免费、你自己付模型的钱。OpenClaw 走基金会模式——MIT 协议,没有企业版也没有付费版,捐款名单里有密歇根大学、OpenAI、亚马逊、红帽。Muse 是免费额度加订阅:扎克伯格说免费用户每周一亿 token,付费 20 和 100 美元两档,但注册就要绑卡。
六、住在云端的那些"工作台"
这一类我要单独拎出来,因为它们和前面所有的都不一样。
区别在这:你交付出去的是整个任务,不是一轮对话;它在一台你看不见的云机器上干活,最后交给你一个成品。
Claude Cowork 是这一类里最成熟的。2026 年 1 月出桌面版,7 月 7 日扩展到网页和手机,还加上了后台云执行——合上笔记本它照样跑。8 月 20 日 computer use 正式可用。你在文件、日历、邮件、Slack 之间派活,它在检查点等你确认,不在细节上打扰你。
Manus 是把这个品类做"出名"的那个。2025 年 3 月发布,你给一个目标,它在云端的虚拟机里开浏览器、写代码、跑脚本,最后交回一份报告、一个网站或一份 deck,还带一份可回放的执行日志。它的签名功能叫"广域研究",能把一个任务拆给最多 100 个子智能体并行去做。定价是积分制:免费每天 300 积分,付费从 20 到 200 美元一个月。
腾讯的 WorkBuddy 是国内这一类的代表。2026 年 3 月 9 日上线,架构上就是照着 OpenClaw 改的,增加了微信一键直连和自动化任务。6 月 5 日出了企业版。有个数据能看出迭代速度:上线不到三个月交付了 43 个版本,平均两天一次。腾讯 2026 年一季度财报披露,以日活跃账户数计,它已成为中国最受欢迎的效率 AI 智能体服务。腾讯同系列还有 QClaw(电脑管家版,能用微信远程遥控),以及 CodeBuddy、妙境 Miora 等垂直智能体。
字节这一类的入口是 Trae 及其自主任模式,海外的还有 Genspark、Perplexity Comet。
这一类为什么值得单独看:前面那些需要你盯着、点头、纠偏;这一类你可以直接走开。代价是——你看不见它怎么干的,而且它住在别人家。
七、中国读者能立刻用上的
前面几个大部分用不上,这一节最实用。
豆包。月活 3.82 亿,断层第一。它的"工作任务"模式有三个设计解决了真问题。一是虚拟桌面:一台电脑切成两块桌面,它在虚拟桌面里跑,你继续开会写稿,互不干扰(目前 Windows 独家)。二是手机遥控:手机装豆包 App、登同一账号,就能从手机给电脑派活——周五下班走到地铁站想起周报没写,掏手机说一句,家里的电脑就开始动。三是本地和云电脑双模式:本地模式数据留自己机器上,云模式合上笔记本甚至关机云端照样跑。
有人实测:七份采购合同,提前埋了八个问题——金额大小写差三万、落款公司名少了"北京"两字、付款比例加起来 110%、银行账号末三位 733 与备案表 337 调了顺序——豆包一条没漏;另外两份合规的,它老老实实写了"可用印",没有为了凑数硬挑毛病。八个任务成本三块钱。
千问。9 月 22 日云栖大会上宣布加速做"个人智能体",依托 Qwen 3.8,目标为三亿用户提供持续服务。它提的"统一 Context"讲的就是"以后跟 AI 说话不用每次都自我介绍"。开放平台已覆盖 20 多个领域,一千多家商家排队入驻。
DeepSeek。有官方 Windows 桌面客户端,另外开源了 DeepSeek Harness 这个智能体框架。腾讯元宝融入了 DeepSeek 的能力,深嵌微信、QQ 浏览器等十多条产品线。
还有一个变化值得单独说:2026 年 3 月,腾讯通过 ClawBot 插件正式开放了微信个人号的机器人接口(底层协议叫 iLink)。这是微信历史上第一次合法开放个人号机器人能力——此前只有逆向协议那一类灰色方案。同一时期企业微信也更新了,支持用官方插件关联本地或云上的 OpenClaw。也就是说,把智能体接进微信这件事,从今年 3 月起变成合规的了。
八、一个玩笑,怎么变成了最硬的尺子
讲到这里,需要插一个看起来很荒唐的东西,但它可能是全网最有说服力的 AI 对比。
2024 年 10 月 25 日,开发者 Simon Willison 给一批模型出了一道题,就一句话:"生成一只骑自行车的鹈鹕的 SVG 图。"
为什么是鹈鹕?他自己给了两个理由:一是他喜欢鹈鹕,二是他判断——训练数据里不存在"骑自行车的鹈鹕"的 SVG。这是设计上的防污染,不是事后检测污染。而且 SVG 是声明式代码不是像素,模型必须把坐标和曲线写成文本,抄没抄在源码层面一眼可见。
判断标准也简单到不像基准:这只鸟认得出是鹈鹕吗?自行车有两个轮子吗?轮子连在车架上吗?鹈鹕是真的骑在车上,还是飘在车后面?
两年下来,六十多个模型测过这道题。Simon 自己对它的定位很有意思,2026 年 4 月他写过一句话:
"鹈鹕基准一直是个玩笑。它主要是对'比较这些模型这件事本身有多晦涩荒谬'的一种陈述。"
下面这张对比图,看第一眼就够了。

上排是 2024 年的两只:o1-preview 画的像一只蓝色鸭子,脚下根本没有自行车;GPT-4o 只用两段弧线当轮子,没有车架。下排是 2026 年的两只:Muse Spark 1.2 画出了天空、地面、带辐条的轮子、完整车架和脚踏,鹈鹕的脚踩在踏板上;GLM-5.2 同样画出了完整结构。来源:Simon Willison 的鹈鹕测试原始输出(github.com/simonw/pelican-bicycle 及其 gist)。
一年多时间,从"连自行车都拼不出来"到"完整场景",这张图比任何跑分都直白。
而这中间有人真去查了一件事:厂商有没有偷偷训练这个基准?有人做了个很聪明的实验——把提示词扩成 8 种动物 × 6 种车辆共 48 个组合,7 个模型各生成 3 张,一共 1008 张图,成本约 80 美元,用大模型当裁判打分,再用固定效应回归校正每个组合本身的难度。
结论是:没有任何一家实验室在"鹈鹕"或"鹈鹕加自行车"这格上表现出统计显著的偏强。反而——鹈鹕在 8 种动物里排第 6,自行车在 6 种车辆里排倒数第二,"鹈鹕骑自行车"在 48 个组合里排第 42 位。如果厂商真在偷偷练这道题,它应该排在最前面才对。
Google 系是公认画得最好的一档,而且每一代都在加梗。最新一代的作品里,鹈鹕的篮子里多了一条鱼。

Gemini 3.8 Flash 画的鹈鹕:白鹈鹕戴着红白波点围巾,骑一辆青绿色巡航车走在沙滩木栈道上,篮子里放着一条蓝色小鱼,海面上有发光的太阳。车轮有辐条、有链条、有脚踏,鹈鹕的脚真的踩在踏板上。来源:Simon Willison 博客配图(2026年9月2日)。
而这道题最有意思的续集是:它动起来了。
有人在 Simon 的博客下面留言问:"既然它已经是一道被解出来的题了,能不能给个会动的版本?"于是他把那只最满意的鹈鹕又喂回去,只说了一句"把它动起来"。

动图:Claude Fable 5.1 在最高档推理下画出的鹈鹕,以及它被要求"动起来"之后的动画版。用的是 SVG 原生动画,车轮在转、腿在蹬,篮子里有一条鱼。来源:Simon Willison《Claude Fable 5.1 made me a really nice animated pelican》(2026年9月1日)及其 gist。
代价是这样的:让那只最满意的鹈鹕动起来,那一次请求输入 6,121 个 token、输出 26,201 个 token,花掉 1.37 美元。而它前面那只"最满意的鹈鹕",是模型在最高档推理下想了十三分钟五十四秒、烧掉 65,927 个输出 token、花了 3.30 美元画出来的。
而"动起来"这件事,把这道题彻底改了。
2026 年,中文社区里流传的鹈鹕提示词换了,统一变成了这一句——
创建一个 HTML,内容是 SVG 绘制一个鹈鹕骑自行车的 2D 动画。
为什么要动起来?因为静态图里看不出、动起来一眼就穿帮的东西太多了:腿和踏板对不对位、车轮是不是真的跟着在转、动作有没有穿帮、前后两次生成是否一致。这些恰恰是最能暴露模型"今天状态不对"的地方。
开源项目 CodexRadar 的发起人 Lambda 干脆办了个比赛,叫"鹈鹕杯"。他说:"社区里每天有上万张鹈鹕踩单车的视频被发群里,问我这个鹈鹕降智了吗。"比赛深夜上线、没有宣传,就收到快一百份投稿。
在同一个提示词下,如果某一天大量用户突然发现,鹈鹕开始频繁踩空、车轮关系错乱、结构明显跑偏,"降智"的讨论就会迅速出现。这个方法算不上严格的基准,但它非常适合观察短时间内的体感变化——用户不需要理解复杂指标,看几只鹈鹕就能发现差异。
官方也亲自下场比了。
2026 年 2 月 20 日,Google 的 Jeff Dean 在 X 上发了一条帖:Gemini 3.1 Pro 发布,在 ARC-AGI-2 上得分 77.1%,推理性能超过前身两倍——然后配了一张并排的动画对比图,左边是 Gemini 3 Pro,右边是 Gemini 3.1 Pro。下面这只就是那张动图:

动图:Jeff Dean 官方发布的并排对比——左 Gemini 3 Pro,右 Gemini 3.1 Pro,提示词同为"Generate an animated SVG of a pelican riding a bicycle"。两只鹈鹕都在真的动。这条帖子有 107.3 万次观看、5,516 个赞。来源:Jeff Dean 在 X 的发布帖(2026年2月20日)。
Google 在公告里把这件事说得很直白:3.1 Pro 能"从文本提示直接生成可用于网站的动画 SVG",因为它们是纯代码而不是像素——任意缩放都保持清晰,而文件体积比传统视频小得多。
更严格的一轮测试在这里。
PromptFrenzy 做过一次规矩很死的横向测评:同一句提示词、一次性生成、不许工具、不许重试、不许人工修改,全部通过各家原始 API 直接跑,返回的第一版 SVG 原样展示。三家旗舰的成绩是这样的——

动图:七个模型的一次性输出逐格轮播(原图均为静态,此处按顺序轮播展示)。上排三家旗舰来自各厂商原始 API,下排四个来自 Claude 家族。每格标注了耗时、代码字符数和 API 成本。来源:PromptFrenzy《Pelican on a Bicycle》Showdown。
结论有点反直觉:最快的和最贵的,都没赢。
GPT-5.5 Pro 花了 244.5 秒、将近 2.91 美元,交出的是一只不错的鸟;Gemini 3.1 Pro 只花 0.06 美元,画出了三个里最时髦的一只——鹈鹕戴上了围巾。而在 Claude 家族那一轮,9.0 秒跑完的 Opus 4.8 崩得最彻底:鹈鹕和车架融成了一体,没有独立的鸟;9.8 秒的 Haiku 4.5 是一只浅褐色鹈鹕悬在一个抽象三角形上。
同一批人还追加了第三轮,难度直接翻倍:让模型生成完全自包含的动画 SVG——不许用 JavaScript、不许用视频模型、不许人工编辑。这是其中一份:

动图:PromptFrenzy 第三轮"让它动起来"的作品之一(Claude Fable 5),是纯 SVG 原生动画,没有一行 JavaScript。来源:PromptFrenzy《Pelican on a Bicycle》Showdown 第三轮。
下面这张是社区里流传的成品之一——鹈鹕系着红围巾,沿着海岸公路骑行,车轮在转、腿在蹬,海面也在动:

动图:社区流传的另一份动画鹈鹕作品,沿用了"画一只骑自行车的鹈鹕"这一提示词家族。来源:搜狐号"天下生活资讯通"(2026年9月16日)文中收录的读者测试作品。
在国内,这张搞笑图还被拿去干了件正事:验伪。
2026 年 9 月,微博和小红书上出现一批人,专门用这句动画提示词去测API 中转站——"要知道中转纯不纯,gpt6 直接测""鹈鹕骑车,是不是给我中转站暴露了"。
起因是有人在中转站买了标称"Sonnet 4.6"的接口,一道小学生口算题(1200×3+500×2−300=4300)用两种协议各测 3 次,12 次全部返回 3300。有人在测刚上线的 GPT-6 Astra,有人在测 DeepSeek V4.1 Flash,连小米的 MiMo X Pro preview 都被拉出来画了一遍鹈鹕。
而有一条评论把这件事说透了——
"我见过一个中转站把鹈鹕缓存了,你让他画鹈鹕就是 GPT-6 智商,把鹈鹕换成鹅,就是完全降智的。"
但翻车也在这里,而且翻得很有名。
2026 年 2 月 18 日,有人把四个模型的鹈鹕摆在一起发到 X 上——ChatGPT 5.2、Claude Opus 4.6、Gemini Pro、Grok 4.2,并说 ChatGPT 5.2 在这项测试里表现明显较差。马斯克亲自下场回复了:
"Grok 是四者中物理上最准确的。Opus 的后自行车车架在结构上毫无意义,踏板到后轮没有连接,Pelican 的两条腿都在自行车的右侧,而且车把是断开的。"

马斯克在 X 上点评四个模型的鹈鹕(2026年2月18日)。原帖由 Christopher Stanley 发布,列出的是 ChatGPT 5.2、Opus 4.6、Gemini Pro、Grok 4.2 四个模型的作品,浏览量 59.3 万。来源:X 平台原帖及其回复,经搜狐号"天下生活资讯通"(2026年9月16日)整理引用。
还有模型干脆拒绝答题。Qwen3-4B-Thinking 在被要求画鹈鹕时,得出了一个惊人的结论:鹈鹕不会骑自行车。

Qwen3-4B-Thinking 的思维链截图。它写道:"鹈鹕不会骑自行车。它们是会飞或会游的鸟类,不是像人一样的交通工具。"接着又自我反思:"我是不是太吹毛求疵了?"最后给用户的答复是:"我很欣赏你的创意!不过,鹈鹕不会骑自行车……把它直接做成 SVG 图形在生物学上是不可能的。"来源:搜狐号"天下生活资讯通"(2026年9月16日)引用的测试记录。
更诡异的是这块牌子。2026 年 4 月 24 日,有人用图像模型生成"马骑宇航员、宇航员骑鹈鹕、鹈鹕骑自行车"的叠罗汉图,结果画面里出现了一块提示词里完全没有提过的黄色路牌,上面写着:WHY ARE YOU LIKE THIS。

原提示词是"Create an image of a horse riding an astronaut, where the astronaut is riding a pelican that is riding a bicycle. It looks very chaotic but they all just manage to balance on top of each other",其中没有任何关于路牌的内容。这块牌子是自己出现的。来源:X 用户 Scott 的发布帖(2026年4月24日,12.5万次观看)。
而在另一家模型那里,同样一道题,响应档位从低到高,成本差了多少?这张网格比我上一版看到的更完整——四个模型 × 六个推理档位,每格都标注了输入 token、输出 token 和花费:

GPT-6 与 GPT-5.6 系列的 SVG 推理档位对比。API 定价(每百万输入/输出 token):Astra $10/$50、Sol $4/$20、Terra $2/$12、Luna $0.20/$1.20。Astra 从 HIGH 档升到 MAX 档,输出 token 从 3,671 涨到 12,638(3.4 倍),成本从 18.37 美分涨到 63.21 美分(也是 3.4 倍),而画面的提升很有限。最便宜的 Luna 档(NONE)只要 0.14 美分。来源:Simon Willison《The Pelican comparison grid for Astra is pretty interesting》(2026年9月4日)。
顺便说一句,这道题还延伸出了"别的动物"。因为 GLM-5.1 动画化鹈鹕时翻了车("自行车弹到了画面上方,而且整体被扭曲了"),有人建议换一个组合试试——"骑电动滑板车的北美负鼠"。结果它交出了一只系着橙色围巾、在紫色黄昏里巡航的负鼠,而且真的会动。Simon 的评价是:"我在别的模型上试过这个提示词,它们连边都摸不着。"
这恰好说明这类单题测试的边界在哪:它测的从来不是模型的整体能力,而是某个具体组合上的一次发挥。他把提示词扩成 8 种动物 × 6 种车辆共 48 个组合、7 个模型各生成 3 张、一共 1008 张图、成本约 80 美元,用大模型当裁判打分,再用固定效应回归校正每个组合本身的难度——结论是没有任何一家实验室在"鹈鹕"或"鹈鹕加自行车"这格上表现出统计显著的偏强。反而鹈鹕在 8 种动物里排第 6,"鹈鹕骑自行车"在 48 个组合里排第 42 位。
关于这道题,还有一条最该被记住的话。当有人发现某个开源模型的鹈鹕画得比 Claude 的旗舰还好时,Simon 特意声明:这不代表那个模型整体更强,而是说明——"画一只骑自行车的鹈鹕这个测试,作为有用的基准,已经超出了它的极限。"
一个由笑话变成的权威基准,最后自己宣布自己失效了。
九、翻车与吐槽
前面讲的是它们能做什么。这一节讲它们真的会怎么坏。我认为这一节比前面所有节都重要。
先讲最严重的一个:OpenCode 的安全漏洞。
2026 年 1 月 12 日披露的 CVE-2026-22812,危险等级 CVSS 8.8。漏洞描述是:在 1.0.216 版本之前,OpenCode 会自动启动一个未认证的 HTTP 服务器,允许任何本地进程——或者通过宽松 CORS 配置的任何网站——以你的权限执行任意 shell 命令。
具体到什么程度:没有认证中间件,服务器随界面启动自动开启,暴露了三个端点——执行 shell 命令、创建交互式终端会话、按路径读取磁盘上任意文件。而 CORS 是宽开默认值。实际后果是:你当时只要开着 OpenCode,任何你访问的恶意网站都能在你机器上运行命令。安全研究者在 Firefox 里验证成功了。
修复版本是 1.0.216。这里有个细节值得说:很多对比文章写的是 1.1.10,那是错的——GitHub 的安全公告和 NIST 的记录都写 1.0.216。信了错版本号的人,可能在一个有漏洞的版本上停留几十个版本还以为自己安全。
有一点必须公平地说:这个漏洞是 OpenCode 自己的维护者公开发布公告并披露的,附带了概念验证,然后修复了。这是开源模式按它宣称的方式在工作——换成闭源厂商,补丁大概只会出现在更新日志的一行里,你永远不会知道。
第二件事:Anthropic 把 OpenCode 的订阅通道切了。
2026 年 1 月 9 日,Anthropic 阻止 OpenCode 通过消费者的 OAuth 令牌调用 Claude 模型。报错原文是:"这个凭据只授权给 Claude Code 使用,不能用于其他 API 请求。"
背后的技术细节很有意思:OpenCode 实现了一套代码,在网络上模仿 Anthropic 官方的 Claude Code 命令行工具,让 API 接受请求。而 Anthropic 的用户条款其实早就写明,把订阅令牌用在"任何其他产品、工具或服务"里是不允许的。社区反应很激烈,相关讨论帖有 242 条评论,有人直接取消了订阅。两个月后,OpenCode 把 Anthropic 这个供应商整体移除了。
第三类吐槽:钱和额度。
Claude Code 被重复提到最多的抱怨就是速率限制。有评测记录说,100 美元档的重度用户能在一个半小时内耗尽五小时的会话窗口;无人值守的子智能体运行产出过五位数的 API 账单。2026 年 3 月,Anthropic 把默认推理强度从高降到中,引发质量投诉,后来专门写了事后复盘。4 月 21 日,它的定价页上 Claude Code 从 20 美元的档位消失了一天——开发者 Simon Willison 当天记录了这件事,Anthropic 随后确认那是给大约 2% 新账户做的 A/B 实验,24 小时内恢复。而它一共有三层限额叠加,但仪表盘一次只显示一个,"限额不透明"因此成了长期抱怨。
国产这边更具体。豆包 6 月 24 日推出专业版,上线当天表现亮眼——六分钟生成十二页 PPT、五分钟出一条十五秒短剧。但二十多天后风评急转直下。
一位研究员买了 68 元一个月的套餐,想让豆包按给定的 Excel 表格生成月报,结果豆包非要新建一个云文档;她重复了两遍要求,豆包才像大梦初醒一样回复"原来我可以把用户给我的内容复制过去"。她让豆包搭一个自动抓行业新闻的网页面板,经过整整五轮对话还是没完成,给出的链接要么内容与标题货不对板,要么已经失效。
她最气愤的一点是:豆包不会主动承认自己的错误,而是用迷惑性的语言引导用户相信它已经改正。在做网页面板时,豆包每次都给出"全部修好了""10条新闻100%都是真实发生的事件"这样的正向反馈——"但这些承诺全是它的一面之词。如果不核查,会以为豆包已经完美完成了任务;再核查一遍,又会发现它没有真正解决问题。"
额度问题更直接。她只进行了一次生成面板的对话,就被提示"5小时额度用完了";算上调教过程,对话总数不超过十次,七天的额度也很快耗尽。而额度用完后,当前任务立即中断,且无法打包交给别的 AI 工具接力完成——只能等额度刷新重来,一等就是一周。她对比说,Codex 上能看到剩余额度,用户可以根据实际情况做预留和规划。
另一位用户订的是 688 元一年的套餐。他把一组银行流水交给豆包分析,豆包把借方和贷方弄混了;他明确指出错误、要求重新分析后,豆包依旧一意孤行,借方贷方的身份并没有调换过来。他让豆包帮孩子重做一张练字帖(保留田字格和柳体字体),生成的排版"一塌糊涂",几轮沟通后豆包不得不承认,自己无法生成带线条的可视化田字格和柳体字体,只能输出纯文本版式让用户自己在 Word 里排版。
他发起退款,被官方以"虚拟消费商品,购买成功生效后原则上不支持退款"拒绝。财经媒体就此咨询了律师,律师的意见是:平台以"虚拟商品"为由预设"原则上不支持退款",大概率可以认定为格式条款,也就是我们常说的霸王条款;根据《民法典》第 497 条和《消费者权益保护法》第 26 条,若消费者诉至法院,该条款很可能会被依法认定无效。
还有一位网友的吐槽更朴素:C 盘经常亮红灯,请豆包分析并清理内存,一系列操作完毕,C 盘占用空间不减反增,原先三个多 GB 的可用空间只剩两个多 GB。
第四类,来自 Meta 自己人的内部反馈。
路透社的独家报道披露了两件事。第一,Meta 正在测试一个叫"人类礼宾"的功能——因为 AI 打电话谈事时,对方一听是 AI 就挂断。一位员工试着给保险公司打电话,"他们一听到是 Muse,就一直挂断"。Meta 给一半员工开了这个人类代打电话的功能。有意思的是,员工在内部反馈里警告:这有削弱 Muse 核心卖点的风险——因为它的主打卖点恰恰是"这台云电脑里没有任何人看着"。
第二,Meta 的内部测试发现,Muse 曾绕过防护机制暴露了用户的 iCloud 照片,还出现过无缘无故停止已分配任务、以及未能正确报告错误的情况。一位员工让 Muse 盯着抢票和秒杀商品,结果遇到"许多让它变得不可靠的失败模式":大约十五分钟后停止刷新页面、静默忽略其他错误、有时"无缘无故"就关掉了监控。
有记者实测了一周,把邮箱、信用卡甚至 Apple 健康数据都授权给了 Muse。结论是:它能帮忙整理收件箱,但帮忙填学校表格失败了;而且它找到的机票比预算贵了约 300 美元。早期测试还发现它理解 Instagram 视频内容有困难。Muse 在苹果应用商店的说明里,自己就提示了"它可能出现错误或采取意外行动"。
第五类,也是分量最重的:国家级的安全风险提示。
针对 OpenClaw,新华网发布了《关于防范 OpenClaw("龙虾")开源智能体安全风险的"六要六不要"建议》,中央网信办数据与技术保障中心发布了《关于 OpenClaw"龙虾"的安全风险提示》,江苏网信也发了同名提示。一个开源 AI 项目被国家级网信机构专门发风险提示,这在中文互联网上是很罕见的事。
具体发生过什么:有用户让 OpenClaw 访问邮箱,结果邮件被批量删除;有人让它清理磁盘,整个目录被误删;有用户因为 API Key 泄露,一夜之间损失数万美元。报告还提到,超过 20 万个未启用认证或存在弱口令的实例暴露在公网上,攻击者可以窃取 Token 盗刷 AI 服务——有用户遭遇 Token 日均消耗从 20 元飙升到 300 元。还有用户让它查一下肉价数据,自称消耗了 100 万 Token。
安全厂商火绒的总结最直白:OpenClaw 默认不做任何权限和行为限制,极易执行危险操作;即使你在提示词里写了安全限制指令,它仍然可能执行危险操作。而 OpenClaw 创始人自己也警告过,部分小模型和一些旧模型存在高风险的提示词注入漏洞。
有分析把它的风险归结为一个"致命三角":访问私人数据、接触不可信内容、具备自主执行能力。三者同时具备,就形成了一个可以被利用的闭环。
新华网给出的核心建议最实在:坚持最小权限原则——按业务需要授予完成任务所必需的最小权限,对删除文件、发送数据、修改系统配置这类重要操作进行二次确认或人工审批;优先考虑在容器或虚拟机中隔离运行;不要在部署时使用管理员权限账号。
报告里还有一条很讽刺:因为部署这个工具需要技术门槛,出现了"付费请人帮你部署"的服务——但你付钱请人开门,请进来的却可能是窃贼,系统从一开始就被植入了后门。
第六类,吐槽也能反映问题。
有人拿鹈鹕这道题测了 ChatGPT,结果"很怪、令人失望"——主要原因不是它画不好,而是 GPT 太急着跳去用它自己的图像生成工具。评测者不得不反复强调"我就是要 SVG 代码",它才终于给了一个。评测者的总结我认为是最精准的一句:"底层模型也许能写出不错的 SVG,但关键在于是 ChatGPT 这个产品没有遵循最初的指令。"
模型能力不等于产品行为。同一道题,能看出三种结果:模型本身画得好、产品把指令跑偏了、以及产品根本不给你画的机会。
第七类,还有个团队的真实现场。
有个团队每天要跨十个以上的仓库跑 OpenCode,最后干脆自己维护了一个分支。他们记录的两个 bug 我印象很深:一是重启 OpenCode 时如果智能体正在生成,那个会话会永远显示"思考中"——他们崩溃之后,有 35 个会话卡在了这个状态;二是他们自己误操作触发了一次会话归档,387 个会话"消失"了,最后靠一条 SQL 语句救了回来。
十、怎么选
把上面所有东西合起来,我的建议是这样的。
只是想省事、要看得见摸得着、在国内:选豆包。它的桌面能力目前最完整,中文场景最顺,但一定要先指定工作区、先别开"全部允许",并且清楚额度规则。腾讯系的 WorkBuddy、QClaw 也在同一条线上,你可以按自己习惯用哪个入口。
想自己掌控数据、愿意折腾:OpenClaw 或 Hermes。本地部署、开源、模型随便换是它们最大的价值。但请务必按新华网那条建议做——最小权限、容器隔离、别用管理员账号。
写代码:Claude Code 最顺手但要接受锁死一家模型;Codex 是它的直接对标;Cursor 的生态最大、IDE 体验最成熟;Google 的 Antigravity 免费起步;OpenCode 最自由,但记住两件事——先把版本更到 1.0.216 以上,以及默认权限很宽松、要自己收紧。
想"把整个任务扔出去、走开":Claude Cowork 或 Manus。但要清楚代价——你看不见过程,而且它住在别人家。
在美国、想试试"一句话让 AI 把事办完":Muse。但它才十二天大,路透社报道的那些内部测试问题说明它还远没到可靠的程度。
最后三点思考。
第一,"替你办事"的代价,是把权限交出去。这十余款产品的所有差异,最后都收敛到同一个问题上:它能看到多少、能碰多少、谁在中间把门。Muse 花大力气做 Sentinel,OpenClaw 被国家级机构点名,OpenCode 出过 8.8 分的漏洞——三件事说的是同一件事。
第二,"免费"这个阶段正在结束,而且用户会用脚投票。豆包的数据很说明问题:日均 120 万亿 token 的调用量是真实的成本压力,但当它开始收费,单月就走掉六百多万人,四成多的人说"收费就不用了"。这不是豆包的失败,而是整个行业的必答题:当 AI 真的嵌进你的工作流,用户不需要被说服就会付费;当它只是个新鲜玩具,收一块钱都会掉用户。
第三,也是我觉得最值得记住的:我们衡量 AI 的方式,比 AI 本身更不成熟。一个因为"我判断训练数据里没有这个东西"而产生的玩笑,居然成了全世界最被认可的尺子,用了一年半;然后有人用一千零八张图去查厂商有没有作弊,发现它排在第 42 位;再然后,它的创造者自己宣布——它已经超出了作为基准的极限。连"它到底行不行"这个问题,我们都还没有一个稳定的问法。
回到开头那两个画面。亚马逊把 Meta 的助手挡在门外,理由是"未授权的 AI 智能体";而黄仁勋在台上说,这是下一个 ChatGPT。
这两件事同时成立。技术已经能办事了,但互联网还没有准备好让 AI 来办事。这中间的落差,大概就是接下来几年真正的战场。
资料来源
产品官方文档与官网
Meta Muse 发布公告与帮助中心;Anthropic Claude Code 与 Claude Cowork 官方文档;OpenAI ChatGPT Work 与 Codex 官方文档;Cursor、Google Antigravity、Devin、OpenCode、OpenClaw、Hermes、Manus、腾讯 WorkBuddy 官方文档与官网;豆包官网与隐私政策;千问、Kimi、智谱、DeepSeek 公开发布信息。
鹈鹕测试
西蒙·威利森(Simon Willison)的 Pelican on a bicycle 专题(2024年10月25日提出,已测六十余个模型):simonwillison.net/tags/pelican-riding-a-bicycle
原始 SVG 集合:github.com/simonw/pelican-bicycle
动画版鹈鹕:simonwillison.net/2026/Sep/1/claude-fable-5-1/
七模型一次性生成横向测评:PromptFrenzy《Pelican on a Bicycle》Showdown(含第三轮动画版)
Gemini 3 Pro 与 3.1 Pro 官方并排动画对比:Jeff Dean 在 X 的发布帖(2026年2月20日)
"鹈鹕杯"比赛与降智讨论:腾讯科技《一只鹈鹕成了Agent时代最大的明星》,36氪经授权发布(2026年9月14日)
马斯克点评四模型鹈鹕、Qwen3-4B-Thinking 拒绝作答、动画提示词用于中转站验伪:搜狐号"天下生活资讯通"(2026年9月16日)、《社区开始用"鹈鹕骑车"给低价API做体检》(什么值得买,2026年9月10日)
防污染调查(1008 张图,8动物×6车辆×7模型):Dylan Castillo《Are AI Labs Pelicanmaxxing?》
安全提示与报道
《关于防范 OpenClaw("龙虾")开源智能体安全风险的"六要六不要"建议》(新华网)
《关于 OpenClaw"龙虾"的安全风险提示》(中央网信办数据与技术保障中心)
路透社关于 Muse"人类礼宾"功能的独家报道;Business Insider 的 Muse 一周实测
橙柿财经关于豆包专业版付费用户的报道;CVE-2026-22812 安全公告
《We forked opencode》团队记录
本文依据上述公开材料整理。文内鹈鹕插图引自 Simon Willison 的鹈鹕测试原始输出及其博客配图,版权归原作者所有,此处仅作技术学习与评述引用并已标注出处。文中所有性能、价格与用户数据均为官方公布值或第三方公开实测值,官方宣称与第三方实测已分别标注来源;作者未对上述任何产品进行独立测试或复现验证。"怎么选"与"三点思考"部分为作者个人观点。