ARTICLE · 1138138
2026 年 AI Agent 到底挑谁?盘点一下国内国外各个Agent
就在昨天,腾讯发了条公告:自家微信远程办公助手 QClaw,12 月 24 日正式停止运营,上线到停运总共不到十个月。用户可以迁去 WorkBuddy,迁移还送 1000 积分补贴。
这大概是 Agent 元年最真实的一幕。今天这篇,把市面上叫得上号的 AI Agent 捋一遍。谁在场上、各有什么本事是一回事,会不会活到明年是另一回事。一起来聊聊
01
WHAT IS AN AGENT
先给「Agent」这个词祛个魅
判断一个东西是不是 Agent,标准很简单:它有没有写权限。聊天机器人负责回答问题,Agent 负责动手干活:调工具、改文件、提交表单、改变你系统里的状态。
「能做题的叫助手,能改状态的才叫智能体。」
工作机理说穿了也不神秘:接到指令,把目标拆成步骤,能走接口的走接口,走不了的靠视觉理解模拟人操作键鼠,每做完一步回看结果、不对就修。「拆解、执行、核对」这个循环,是所有产品的公共骨架。
02
OVERSEAS
海外牌桌:能力上限在这几家里
| 通用能力均衡 | ||||
| 多模态原生 | ||||
| IDE 内体验顺滑 | ||||
| 开源 Harness 标杆 | ||||
| 终端原生开源 | ||||
| 任务拆解与工具编排直观 | ||||
| 深度嵌入 Office 与 M365 | ||||
要说今年海外最有戏剧性的产品,非 OpenClaw 莫属。它原本是奥地利程序员 Peter Steinberger 的「周末项目」,给大模型装上本地操作系统的权限,能自己跑命令、管文件、发邮件,数据全存本地,不订阅、不抽 token,由独立的 501(c)(3) 基金会托管。名字从 Clawdbot 改成 Moltbot 再定名 OpenClaw,4 个月狂揽 30 万 GitHub 星标,先后超越 Linux 和 React 登顶星标榜,连创始人都被 OpenAI 挖去做「下一代个人智能体」了。
OpenClaw 火了之后,圈内的焦点从「大脑」转向「身体」。LangChain 的 CEO Harrison Chase 有句话说得很准:Agent 翻车,瓶颈多半不在模型智商,而在给模型穿的那身「骨架」。这就是今年大热的 Harness Engineering。开源社区随即冒出一批「OpenClaw 之后的 Harness」:LangChain 的 Deep Agents 把规划、虚拟文件系统、子 Agent 编排、持久记忆、沙箱执行全配齐,成了开源 Harness 的事实标杆;OpenAI 干脆把 Codex Harness 用 Apache-2.0 协议开源,CLI 工具、SDK、应用服务器三件套直接奉上,等于宣布「Agent 要长进你们熟悉的软件里」。
同样打「Harness」旗号的还有 DeepSeek Harness。出品方是深度求索,MIT 全球开源,支持近 40 家模型提供商,「Model + Harness = Agent」的公式和「一切皆插件」的架构正在成为全球开发者的公共语言。开源竞争这下从「谁能跑模型」推进到了「谁决定模型怎么干活」。
最新的变量是 9 月 15 日亮相的 Jev。它出自 ChatGPT 早期研究员 Diogo Almeida 创办的 TypeSafe AI,藏了两年一出手就刷屏,3700 万人围观。Jev 不写任何文字,只做一件事:判断。「这是销售线索吗」「下一步该点哪个按钮」,给它程序状态,它直接返回带概率的结构化决策,延迟 70 到 500 毫秒,比前沿大模型快几十到 200 倍,输入百万 Token 只要 0.042 美元、输出免费。开发者拿它给 Agent 当「直觉系统」,LangChain 都跟进做了 Jev-as-a-Judge 实验。Harness 是 Agent 的身体,Jev 想做的就是那套快速直觉神经。
消费端的大动作属于 Meta。9 月 8 日上线的 Muse 是个「零门槛个人智能体」:网上购物、发邮件、订行程、填表单、甚至替你砍账单,由自家 Muse Spark 模型驱动,跑在隔离的云端虚拟机里。发邮件、付款这类敏感操作强制人工确认,支付走 Stripe Link 的一次性虚拟卡。免费加每月 20 美元、100 美元两档订阅,目前先在美国上线。扎克伯格押注「个人超级智能普及化」的筹码全在它身上。
03
WHY THE BOOM
国产为什么突然井喷
三个条件今年凑齐了:专为工具调用和多步规划优化的 Agent 模型过了商用线;MCP 协议统一,接办公软件的工程成本大幅下降;OpenClaw 开源把底层框架能力开放,入场门槛直接被打平。于是就有了各家「集体养虾」的盛况:QClaw、MaxClaw、AutoClaw、CoPaw,起名都带个「钳」。
不过开头那条停运公告也说明,热闹归热闹,洗牌已经开始了。
路线分成了两派。一派是模型同源,小米、阶跃星辰、月之暗面、智谱、MiniMax、讯飞、商汤这些模型厂商,执行内核用自家模型,调用链能从模型层直接调优,复杂任务上限更高;另一派是生态卡位,腾讯、阿里、字节、百度、美团、联想这些大厂,强在入口和场景。选型时先想清楚你要的是「脑子好」还是「路子广」。
04
BIG TECH
国产牌桌一:大厂军团
字节今年完成了从聊天到干活的关键一跳。6 月 24 日豆包推出专业版,上线「办公任务模式」,能操作本地电脑、调浏览器、用 Skills 技能、设定时任务,长任务扔后台跑,人可以脱手去干别的;订阅分 68、200、500 元三档,大学生认证后 38 元。8 月又上线豆包工作,打通飞书生态,正式进军职场场景。
百度是今年存在感最强的一家。Create 2026 上一口气亮出通用智能体「百度搭子」 DuMate、代码智能体「秒哒」 3.0、数字人智能体「百度一镜」,还有登顶 MLE-Bench 的决策智能体「伐谋」 2.0。搭子主打统一入口调兵遣将,月活环比暴涨 1063%;秒哒让完全不懂代码的人生成应用,市场份额 33.4%,居无代码应用生成平台第一。
腾讯经历了 QClaw 的来去之后,主力都压在了 WorkBuddy 上。三个月迭代 43 个版本,按 DAU 算已是国内最受欢迎的效率智能体工具,还配了企业版、ClawPro 管控平台和 ADP 开发平台,覆盖 20 多个垂直场景。
小米是今年最让人意外的选手,而且它拿出的不是又一个对话框,而是 Xiaomi MiMo,一个专为 Agent 时代造的模型底座。3 月 19 日凌晨,MiMo-V2 系列三大模型齐发:旗舰基座 MiMo-V2-Pro 总参数超万亿、激活 420 亿,支持 100 万 Token 上下文,在 Artificial Analysis 榜单排全球第八,API 定价只有 Opus 的五分之一,匿名上线 OpenRouter 时一度登顶日榜;全模态的 V2-Omni 打通从感知到执行的完整链路;V2-TTS 负责给 Agent 一张会说话的嘴。9 月,MiMo 团队又公布 V3 新架构 HySparse,100 万 Token 下预填充计算量降了 5 倍。小米还联合 OpenClaw、Cline、OpenCode 等五大 Agent 框架开放接口,手机上那句「超级小爱」,背后跑的就是这套 MiMo 底座。
| 办公任务模式 | ||||
| 零代码搭建 | ||||
| 微信直连 | ||||
| 万亿参数 Agent 基座 | ||||
| 无代码生成应用 | ||||
| 吃透组织架构与审批流 | ||||
| AI 原生浏览器 | ||||
| 共享同事进群干活 | ||||
05
MODEL MAKERS
国产牌桌二:模型厂商与垂直玩家
MiniMax 是「全家桶」路线,Agent 2.0 主打 AI 原生工作台,M2.5 在 SWE-Bench Verified 上拿 80.2%,与 Claude 并列顶尖,价格却只有同类的零头。智谱走跨端操控,AutoGLM 的手机和浏览器操作是招牌,AutoClaw 主打一键安装。阶跃星辰的桌面版被多家榜单评为五维最均衡,自研 Step 3.7 Flash 模型同源,还能兼容 5000 多个技能。月之暗面把长文本优势延伸成「长程任务」,K2.6 一次能调度 300 个子智能体并行干活。
| MIT 全球开源 | ||||
| 本地云端衔接 | ||||
| 手机与浏览器 GUI 操控 | ||||
| 语音与纸质文档识别 | ||||
06
BY THE JOB
按「活儿」来挑,别按榜单来挑
写代码这件事分裂成两种玩法。一种是陪你干的助手,在编辑器里补全、改写、随叫随到,Cursor 是典型;另一种是把活儿扔给它、自己去喝咖啡的委托式 Agent,Claude Code、Devin 属于这类。不想交订阅费的,Cline 和 OpenCode 这对开源组合足够日常使用;想从零搭自己的「数字员工」,OpenClaw 装在本地、Deep Agents 或 DeepSeek Harness 负责编排,模型爱接哪家接哪家;Agent 里那些高频「判断题」,交给 Jev 这类专职判断模型又快又省钱。
日常办公是国内卷得最狠的地方。批量啃 PDF 找 Kimi Work;天天泡微信和腾讯文档选 WorkBuddy;完全不想碰代码但要出应用的,秒哒就是为你做的;想要「下载即用、啥都能干一点」的均衡款,阶跃 AI 桌面版口碑最好;小米设备用户直接让 MiMo 底座的智能体跨手机、车机、米家设备接力干活;文件敏感怕上传的,看看百度搭子的分级授权。
企业级落地是另一套逻辑。实在 Agent 像人眼一样看懂界面直接驱动键鼠,专门对付没有接口的旧 ERP;讯飞星辰在纸质文档和语音上有独门功夫;360 纳米 Work 走安全合规路线。这类需求在制造、政务、金融里非常真实,也是国外产品基本摸不到的地盘。
07
REALITY CHECK
泼一盆冷水
QClaw 的离场不是孤例。
MIT 的 NANDA 计划发现,95% 的生成式 AI 试点项目没有测出可衡量的回报;Gartner 预计到 2027 年底超过 40% 的智能体项目会被砍掉。另一面,在边界清晰、可重复的任务上,Agent 平均能省下 2 到 5 小时。差距不在工具,在 scope。
还要提一句:国产这批桌面 Agent 大多基于 OpenClaw 二次开发,底层能力高度同质,差别主要在模型、生态和安全设计上。所以选产品时,除了看功能表,也得看它活得久不久。毕竟没人想给一个三个月后就发停运公告的「数字同事」搬家。
「把 Agent 当「数字员工替身」的基本都翻车了,把它当「数字同事」、只交付边界明确的那几段活的,反而越用越顺手。」
∞
THE END
写在最后
选型顺序建议:先定义清楚你要它干什么活,再定预算,最后才看榜单。编程交订阅费选 Claude Code、Cursor,想开源白嫖选 Cline 或 OpenCode;办公根据生态选豆包工作、WorkBuddy、钉钉或阶跃;出应用选秒哒;数字生活托管给 Meta 的 Muse;跨端操控看 AutoGLM;企业旧系统自动化试试实在 Agent;爱折腾的,用 OpenClaw 加 Deep Agents 或 DeepSeek Harness 自己养一只「龙虾」;做 Agent 二次开发的,小米 MiMo、Jev 和 Dify 都值得玩。
「工具会一直换,榜单每个季度都在洗牌。能留下来的,是把活儿定义清楚的那套本事。」
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。
本文由 AI 辅助完成 ,个人观点仅供参考