夜雨聆风学习资料网

ARTICLE · 1138138

2026 年 AI Agent 到底挑谁?盘点一下国内国外各个Agent

2026 年 AI Agent 到底挑谁?盘点一下国内国外各个Agent

就在昨天,腾讯发了条公告:自家微信远程办公助手 QClaw,12 月 24 日正式停止运营,上线到停运总共不到十个月。用户可以迁去 WorkBuddy,迁移还送 1000 积分补贴。

这大概是 Agent 元年最真实的一幕。今天这篇,把市面上叫得上号的 AI Agent 捋一遍。谁在场上、各有什么本事是一回事,会不会活到明年是另一回事。一起来聊聊

01

WHAT IS AN AGENT

先给「Agent」这个词祛个魅

判断一个东西是不是 Agent,标准很简单:它有没有写权限。聊天机器人负责回答问题,Agent 负责动手干活:调工具、改文件、提交表单、改变你系统里的状态。

「能做题的叫助手,能改状态的才叫智能体。」

工作机理说穿了也不神秘:接到指令,把目标拆成步骤,能走接口的走接口,走不了的靠视觉理解模拟人操作键鼠,每做完一步回看结果、不对就修。「拆解、执行、核对」这个循环,是所有产品的公共骨架。

02

OVERSEAS

海外牌桌:能力上限在这几家里

产品
出品方
强项
短板
适合谁
Claude / Claude Code
Anthropic
自主性和稳定性顶尖,SWE-bench 约 72.5%
终端交互上手门槛高
开发者、技术团队
ChatGPT Agent / Codex
OpenAI
通用能力均衡
,覆盖面广
深度垂直任务不够专
大众用户、泛场景
Gemini / Antigravity
Google
多模态原生
,全栈开发体验好
生态绑定较深
Google 生态用户
Muse
Meta
能购物付款、代写邮件,WhatsApp 直接用
目前仅限美国,敏感操作要确认
数字生活重度用户
Jev
TypeSafe AI
不写文字只出判断,快 200 倍、便宜 400 倍
只会做判断题
Agent 开发者
Cursor / Windsurf
Cursor 等
IDE 内体验顺滑
,项目级上下文强
架构级复杂任务吃力
在 IDE 里干活的开发者
Devin
Cognition
从需求到部署可独立跑完整流程
依赖清晰工单,单价高
有规范排期的工程团队
OpenClaw
Peter Steinberger / 开源社区
免费开源,本地部署数据不出门,技能插件海量
部署门槛高,权限大有安全隐患
极客、自建玩家
Deep Agents
LangChain
开源 Harness 标杆
,规划、记忆、子 Agent 全配齐
架构偏重,上手有学习成本
中小团队落地
Cline
开源社区
免费开源,VS Code 里即插即用,模型随便换
吃 token 较凶,配置全靠自己
爱折腾的开发者
OpenCode
开源社区
终端原生开源
,架构干净,兼容多家模型
生态和插件靠社区
命令行党、自研玩家
Manus
Monica(已被 Meta 收购)
任务拆解与工具编排直观
稳定性和成本仍在爬坡
研究、内容创作者
Copilot 系列
微软
深度嵌入 Office 与 M365
自主性中等
办公人群、企业采购
Perplexity Comet
Perplexity
浏览器原生,深度研究出成品
离开研究场景优势减弱
分析师、市场研究

要说今年海外最有戏剧性的产品,非 OpenClaw 莫属。它原本是奥地利程序员 Peter Steinberger 的「周末项目」,给大模型装上本地操作系统的权限,能自己跑命令、管文件、发邮件,数据全存本地,不订阅、不抽 token,由独立的 501(c)(3) 基金会托管。名字从 Clawdbot 改成 Moltbot 再定名 OpenClaw,4 个月狂揽 30 万 GitHub 星标,先后超越 Linux 和 React 登顶星标榜,连创始人都被 OpenAI 挖去做「下一代个人智能体」了。

OpenClaw 火了之后,圈内的焦点从「大脑」转向「身体」。LangChain 的 CEO Harrison Chase 有句话说得很准:Agent 翻车,瓶颈多半不在模型智商,而在给模型穿的那身「骨架」。这就是今年大热的 Harness Engineering。开源社区随即冒出一批「OpenClaw 之后的 Harness」:LangChain 的 Deep Agents 把规划、虚拟文件系统、子 Agent 编排、持久记忆、沙箱执行全配齐,成了开源 Harness 的事实标杆;OpenAI 干脆把 Codex Harness 用 Apache-2.0 协议开源,CLI 工具、SDK、应用服务器三件套直接奉上,等于宣布「Agent 要长进你们熟悉的软件里」。

同样打「Harness」旗号的还有 DeepSeek Harness。出品方是深度求索,MIT 全球开源,支持近 40 家模型提供商,「Model + Harness = Agent」的公式和「一切皆插件」的架构正在成为全球开发者的公共语言。开源竞争这下从「谁能跑模型」推进到了「谁决定模型怎么干活」。

最新的变量是 9 月 15 日亮相的 Jev。它出自 ChatGPT 早期研究员 Diogo Almeida 创办的 TypeSafe AI,藏了两年一出手就刷屏,3700 万人围观。Jev 不写任何文字,只做一件事:判断。「这是销售线索吗」「下一步该点哪个按钮」,给它程序状态,它直接返回带概率的结构化决策,延迟 70 到 500 毫秒,比前沿大模型快几十到 200 倍,输入百万 Token 只要 0.042 美元、输出免费。开发者拿它给 Agent 当「直觉系统」,LangChain 都跟进做了 Jev-as-a-Judge 实验。Harness 是 Agent 的身体,Jev 想做的就是那套快速直觉神经。

消费端的大动作属于 Meta。9 月 8 日上线的 Muse 是个「零门槛个人智能体」:网上购物、发邮件、订行程、填表单、甚至替你砍账单,由自家 Muse Spark 模型驱动,跑在隔离的云端虚拟机里。发邮件、付款这类敏感操作强制人工确认,支付走 Stripe Link 的一次性虚拟卡。免费加每月 20 美元、100 美元两档订阅,目前先在美国上线。扎克伯格押注「个人超级智能普及化」的筹码全在它身上。

03

WHY THE BOOM

国产为什么突然井喷

三个条件今年凑齐了:专为工具调用和多步规划优化的 Agent 模型过了商用线;MCP 协议统一,接办公软件的工程成本大幅下降;OpenClaw 开源把底层框架能力开放,入场门槛直接被打平。于是就有了各家「集体养虾」的盛况:QClaw、MaxClaw、AutoClaw、CoPaw,起名都带个「钳」。

不过开头那条停运公告也说明,热闹归热闹,洗牌已经开始了。

路线分成了两派。一派是模型同源,小米、阶跃星辰、月之暗面、智谱、MiniMax、讯飞、商汤这些模型厂商,执行内核用自家模型,调用链能从模型层直接调优,复杂任务上限更高;另一派是生态卡位,腾讯、阿里、字节、百度、美团、联想这些大厂,强在入口和场景。选型时先想清楚你要的是「脑子好」还是「路子广」。

04

BIG TECH

国产牌桌一:大厂军团

字节今年完成了从聊天到干活的关键一跳。6 月 24 日豆包推出专业版,上线「办公任务模式」,能操作本地电脑、调浏览器、用 Skills 技能、设定时任务,长任务扔后台跑,人可以脱手去干别的;订阅分 68、200、500 元三档,大学生认证后 38 元。8 月又上线豆包工作,打通飞书生态,正式进军职场场景。

百度是今年存在感最强的一家。Create 2026 上一口气亮出通用智能体「百度搭子」 DuMate、代码智能体「秒哒」 3.0、数字人智能体「百度一镜」,还有登顶 MLE-Bench 的决策智能体「伐谋」 2.0。搭子主打统一入口调兵遣将,月活环比暴涨 1063%;秒哒让完全不懂代码的人生成应用,市场份额 33.4%,居无代码应用生成平台第一。

腾讯经历了 QClaw 的来去之后,主力都压在了 WorkBuddy 上。三个月迭代 43 个版本,按 DAU 算已是国内最受欢迎的效率智能体工具,还配了企业版、ClawPro 管控平台和 ADP 开发平台,覆盖 20 多个垂直场景。

小米是今年最让人意外的选手,而且它拿出的不是又一个对话框,而是 Xiaomi MiMo,一个专为 Agent 时代造的模型底座。3 月 19 日凌晨,MiMo-V2 系列三大模型齐发:旗舰基座 MiMo-V2-Pro 总参数超万亿、激活 420 亿,支持 100 万 Token 上下文,在 Artificial Analysis 榜单排全球第八,API 定价只有 Opus 的五分之一,匿名上线 OpenRouter 时一度登顶日榜;全模态的 V2-Omni 打通从感知到执行的完整链路;V2-TTS 负责给 Agent 一张会说话的嘴。9 月,MiMo 团队又公布 V3 新架构 HySparse,100 万 Token 下预填充计算量降了 5 倍。小米还联合 OpenClaw、Cline、OpenCode 等五大 Agent 框架开放接口,手机上那句「超级小爱」,背后跑的就是这套 MiMo 底座。

产品
出品方
强项
短板
适合谁
豆包工作 / 专业版
字节
办公任务模式
,本地电脑加定时任务
付费才有高额度
职场人、内容创作者
扣子 Coze
字节
零代码搭建
,插件生态丰富
复杂业务流程易掉链子
普通用户、轻量自动化
WorkBuddy
腾讯
微信直连
,手机派活电脑干活
创作能力一般
微信重度用户、办公白领
CodeBuddy / 元宝 / ima
腾讯
研发全流程;知识管理带记忆
单项深度有限
开发者、个人用户
Xiaomi MiMo
小米
万亿参数 Agent 基座
,全模态,价格厚道
终端产品高度依赖小米生态
开发者、小米生态用户
百度搭子 DuMate
百度
统一入口,文件分级授权,端云协同
生态接入仍在扩张
跨应用复杂任务
秒哒 / 伐谋
百度
无代码生成应用
;决策优化登顶基准
偏专业场景
一人公司、业务专家
钉钉 AI 助理 / 通义 / 百炼
阿里
吃透组织架构与审批流
场景偏行政与开发
企业内部流程
Tabbit
美团
AI 原生浏览器
,网页多步操作
浏览器场景之外较薄
网页重度工作者
天工 Skywork / LobsterAI
昆仑万维 / 网易
共享同事进群干活
;办公全场景
知名度偏低
团队协作、泛办公
纳米 Work / 天禧 / Krowork
360 / 联想 / 快手
安全合规偏政企;设备预装;内容创作
起步或受限于硬件生态
政企、联想用户、创作者

05

MODEL MAKERS

国产牌桌二:模型厂商与垂直玩家

MiniMax 是「全家桶」路线,Agent 2.0 主打 AI 原生工作台,M2.5 在 SWE-Bench Verified 上拿 80.2%,与 Claude 并列顶尖,价格却只有同类的零头。智谱走跨端操控,AutoGLM 的手机和浏览器操作是招牌,AutoClaw 主打一键安装。阶跃星辰的桌面版被多家榜单评为五维最均衡,自研 Step 3.7 Flash 模型同源,还能兼容 5000 多个技能。月之暗面把长文本优势延伸成「长程任务」,K2.6 一次能调度 300 个子智能体并行干活。

产品
出品方
强项
短板
适合谁
DeepSeek Harness
深度求索
MIT 全球开源
,一切皆插件,性价比极高
仍是开发者预览版
技术团队、自研玩家
Kimi Code / Work
月之暗面
长程任务,最多 300 个子智能体并行
C 端体验偏工具向
批量文档、长任务
MiniMax Agent / MaxClaw
MiniMax
本地云端衔接
,模型便宜大碗
品牌认知度不高
预算敏感的重度用户
AutoGLM / AutoClaw
智谱
手机与浏览器 GUI 操控
,一键安装
个人玩法偏少
跨端自动化、尝鲜党
阶跃 AI 桌面版
阶跃星辰
模型同源,五维均衡,零配置上手
生态尚在扩张
办公新手、法务财务
办公小浣熊
商汤
20 多种格式文件处理,生成可编辑 PPT
场景偏文档
文档密集型岗位
讯飞星辰 / Loomy
科大讯飞
语音与纸质文档识别
,信创合规
偏政企项目
政企文档场景
实在 Agent
实在智能
语义理解驱动键鼠,接管无 API 旧系统
偏 B 端
制造、金融、政企
Dify / FastGPT
开源社区
开源可私有化,搭建自己的 Agent
要自己搭自己维护
技术团队、自研玩家

06

BY THE JOB

按「活儿」来挑,别按榜单来挑

写代码这件事分裂成两种玩法。一种是陪你干的助手,在编辑器里补全、改写、随叫随到,Cursor 是典型;另一种是把活儿扔给它、自己去喝咖啡的委托式 Agent,Claude Code、Devin 属于这类。不想交订阅费的,Cline 和 OpenCode 这对开源组合足够日常使用;想从零搭自己的「数字员工」,OpenClaw 装在本地、Deep Agents 或 DeepSeek Harness 负责编排,模型爱接哪家接哪家;Agent 里那些高频「判断题」,交给 Jev 这类专职判断模型又快又省钱。

日常办公是国内卷得最狠的地方。批量啃 PDF 找 Kimi Work;天天泡微信和腾讯文档选 WorkBuddy;完全不想碰代码但要出应用的,秒哒就是为你做的;想要「下载即用、啥都能干一点」的均衡款,阶跃 AI 桌面版口碑最好;小米设备用户直接让 MiMo 底座的智能体跨手机、车机、米家设备接力干活;文件敏感怕上传的,看看百度搭子的分级授权。

企业级落地是另一套逻辑。实在 Agent 像人眼一样看懂界面直接驱动键鼠,专门对付没有接口的旧 ERP;讯飞星辰在纸质文档和语音上有独门功夫;360 纳米 Work 走安全合规路线。这类需求在制造、政务、金融里非常真实,也是国外产品基本摸不到的地盘。

07

REALITY CHECK

泼一盆冷水

QClaw 的离场不是孤例。

MIT 的 NANDA 计划发现,95% 的生成式 AI 试点项目没有测出可衡量的回报;Gartner 预计到 2027 年底超过 40% 的智能体项目会被砍掉。另一面,在边界清晰、可重复的任务上,Agent 平均能省下 2 到 5 小时。差距不在工具,在 scope。

还要提一句:国产这批桌面 Agent 大多基于 OpenClaw 二次开发,底层能力高度同质,差别主要在模型、生态和安全设计上。所以选产品时,除了看功能表,也得看它活得久不久。毕竟没人想给一个三个月后就发停运公告的「数字同事」搬家。

「把 Agent 当「数字员工替身」的基本都翻车了,把它当「数字同事」、只交付边界明确的那几段活的,反而越用越顺手。」

∞

THE END

写在最后

选型顺序建议:先定义清楚你要它干什么活,再定预算,最后才看榜单。编程交订阅费选 Claude Code、Cursor,想开源白嫖选 Cline 或 OpenCode;办公根据生态选豆包工作、WorkBuddy、钉钉或阶跃;出应用选秒哒;数字生活托管给 Meta 的 Muse;跨端操控看 AutoGLM;企业旧系统自动化试试实在 Agent;爱折腾的,用 OpenClaw 加 Deep Agents 或 DeepSeek Harness 自己养一只「龙虾」;做 Agent 二次开发的,小米 MiMo、Jev 和 Dify 都值得玩。

「工具会一直换,榜单每个季度都在洗牌。能留下来的,是把活儿定义清楚的那套本事。」

END

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

本文由 AI 辅助完成 ,个人观点仅供参考

相关学习资料