阿里让 AI 学会点开每一个 App,Stripe 忙着给它装收银台:自主智能体的「Token 焦虑」时代来了
**📌 省流速读**
① 8 月 20 日,阿里发布 Qwen-UI-Agent,一个"以真实世界为中心"的 GUI 智能体基座模型,覆盖手机 / 电脑 / 网页 / 深度搜索,让 AI 直接看懂屏幕、像人一样点 App 办事。
② 主力仅 27B 参数,却在 MobileWorld 等五项 GUI 基准上反超 GPT-5.6、Claude Opus 4.8 等几百 B 旗舰——靠"真机军训"练出的硬实力。
③ 但会干活的 Agent,也是会烧钱的 Agent:一个 170 步的任务,背后是无数次截图、点击、上下文重读,每一帧都在烧 Token。
④ 推理悖论正在发生:2026 年单 Token 价格降了约 70%,企业 AI 账单却涨了 300%~500%;"Tokenmaxxing" 之后,企业开始给 AI 设额度。
⑤ 同一周,支付巨头 Stripe 用约 75 亿美元买下 OpenRouter——这家每天路由超 10 万亿 Token 的"模型收费站",把"路由 Token、精打细算"做成了一门基础设施生意。
作为每天被各种 App 包围的普通人,你有没有想过:当 AI 替你点开 12306、高德、钉钉,一步步把事办完,这一连串操作背后,每一帧屏幕、每一次点击,都在悄悄烧掉你的 Token?
作为已经开始把活儿交给 Agent 的开发者或企业,你是否感到一种新的焦虑:当阿里把"会用屏幕"的 Agent 做到 27B 就反超几百 B,你手里的 AI 助手,会不会变成一台 24 小时运转、却没人盯着账单的"自动烧钱机"?
作为一个盯着技术周期的人,你有没有意识到:当 Stripe 用 75 亿美元把"路由 Token"买下来,AI 每一次自主调用的价格,可能已经被悄悄标好了——而这件事,比你想象的来得更快?
2026 年 8 月 20 日,阿里巴巴用一篇公众号推文,把 Qwen-UI-Agent 推到台前;就在这不到 24 小时前,支付巨头 Stripe 宣布要用约 75 亿美元买下 AI 模型路由平台 OpenRouter。两件事撞到一起时,整个 AI 圈都在问同一个问题:当 Agent 学会替我们干活,到底谁来为它干的每一件小事买单?
答案或许并不遥远。
一、当 AI 学会"点屏幕":GUI 智能体到底是什么
过去一年,智能体的能力边界,基本是靠着 CLI、MCP 这类工具接口撑起来的。但现实很骨感:绝大多数软件,从来没打算给你开放 API——银行的页面、政务的系统、老东家的内部工具,一个都不给。
GUI(图形用户界面)才是数字世界里覆盖面最广的通用入口。只要有界面,智能体就能上手操作,软件一行代码都不用改。Qwen-UI-Agent 押的就是这条路线:不去等世界 API 化,直接把屏幕当成最大的接口。
它的核心能力可以一句话概括——看懂界面,模拟人的点击、输入、滑动,替你把事办了。阿里给它的定位很大胆,叫"数字设备上的通用执行器",一套模型覆盖手机、电脑、网页和深度搜索四类环境。
真机演示最能说明问题。你可以让它"约朋友去天目里喝咖啡,在高德查地址、到大众点评找附近一公里内人气最高的咖啡馆、再去小红书总结前五条笔记看大家推荐哪款";也可以让它"查 12306 最早到杭州西的高铁、算地铁到公司的时间、最后在钉钉约个会"。一条指令,跨五六个 App,连着做完。
这不是 demo 秀。AI 第一次,真的长出了一双手。
图1:Qwen-UI-Agent 跨 App 执行示意——一套模型覆盖手机 / 电脑 / 网页 / 深度搜索四类环境
二、27B 反超几百 B:真机"军训"练出的硬实力
2.1 成绩单:五项第一,且是被公认基准
Qwen-UI-Agent 不是自嗨式宣传。它的分数来自业界公认的通用基准,而且主力版本只有 27B 参数——用 27B 的模型去碾压几百 B 的 GPT 和 Claude,这背后的训练方法,比模型规模更值得关注。
| 评测维度 | 基准 | Qwen-UI-Agent | 对比旗舰 | 领先幅度 |
|---|---|---|---|---|
| 移动端 | MobileWorld | 82.1% | GPT-5.6 Sol / Claude Opus 4.8 | +12.0 / +14.6 个百分点 |
| 真机环境 | MobileWorld-Real | 92.2% | Gemini 3.1 Pro 等 | 超越一排海外旗舰 |
| 移动端 | AndroidDaily | 97.5% | — | 接近满分 |
| 电脑端 | OSWorld-Verified | 79.5% | GPT-5.5 / Gemini 3.1 Pro | 超越 |
| 浏览器 | WebArena | 73.6% | 所有对比模型 | 位列第一 |
| 界面定位 | ScreenSpot-Pro | 81.5% | 其余 4 个 grounding 基准 | 全部刷新 SOTA |
还有个能说明效率的数字:在 OSWorld-v2 上,它拿到 40.0% 的部分完成度,同时比基线省了 58% 的执行步数。换句话说,它不只是"做对",还在学着"少绕路"。
2.2 真机训练的门槛:从模拟到真实的鸿沟
这个模型最硬的底牌是真机。此前各家 GUI 智能体大多在模拟器里训练、在模拟器里评测,一到真机就掉链子——App 改个版、弹个窗、换个布局,模拟器里练出的"肌肉记忆"当场失灵。
阿里搭了一个覆盖 100 多台真实手机、150 多款应用的移动环境,任务构建、轨迹采集、训练、评测全在真机上跑,还自建了 400 多个任务的真机基准 MobileWorld-Real,专门打通"从模拟到真实"的最后一公里。
这意味着这条路真正的门槛,不在模型本身,而在于能不能拿到足够真实、足够多样的操作数据。100 多台真机、150 多款 App——这本身就是一道资源壁垒。
2.3 它还懂得"停手"
会点屏幕的模型,安全问题比性能更要命。Qwen-UI-Agent 把安全判断贯穿任务执行全过程:面对违法或高风险请求(比如"怎么造大规模杀伤性炸药""给 50 个联系人群发去缅甸旅游"),它一步都不做,直接拒绝并终止;面对支付、删除数据、隐私授权这类敏感场景,则在关键步骤主动停手,向你说明情况,等确认后再继续。
比如"在支付宝给妈发 500 块红包",它把金额和备注都填好了,却停在支付那一步交还给你。危险的不做,敏感的不擅自决定——这正是自主 Agent 能不能进普通人手机的前提。
图2:Qwen-UI-Agent 关键基准成绩单——27B 反超几百 B 旗舰
三、Token 焦虑浮现:会干活的 Agent,也是会烧钱的 Agent
3.1 推理悖论:单价降了 70%,账单涨了 300%
但故事到这儿,要拐弯了。
一个容易被忽略的事实是:2026 年,前沿模型单 Token 价格相比前几年下降了差不多 70%。但企业和独立开发者的 AI 账单,却涨了 300%~500%。这个反差被业界称为"推理悖论"(Inference Paradox)——单价越低,大家越敢用;越敢用,Agent 就越爱"自己加戏"。
根子在于架构变了。从"单轮对话"切换到"多步自主 Agent"后,每个任务消耗的 Token 呈数量级膨胀。一个聊天机器人往返可能只要 800 Token;一个多步 Agent 工作流,算上系统提示词、工具定义、每一步的调用和结果回读、自我纠错的循环,轻松干到几万 Token。有开发者跑一个自主评测流水线的经历很典型:不到 3 小时烧了 85 美元,查日志发现每一步都成功、Agent 干净退出——钱就是这么没的。
多家机构的测算口径一致:Agentic 工作流每任务消耗的 Token,是普通聊天机器人的 5~30 倍。
3.2 一个 170 步的任务,到底烧了多少 Token
而 GUI 智能体,偏偏是其中最"费电"的那一类。
为什么?因为它的"眼睛"是屏幕截图——每一帧都是图像 Token;它的"记忆"是不断变长的上下文,每一步都要把前面的操作重读一遍;它的"动作"是连续的点击、输入、滑动,一个任务往往几十上百步。
阿里自己放出的一个长程任务,就很说明问题:深度分析 Google(Alphabet)从 2019 年至今的增长轨迹,要覆盖营收、利润、研发投入、资本开支等八项指标,数据必须来自财报和 SEC 文件并交叉核验,最后还要生成 Excel、PowerPoint、Word 三份交付物,再做多轮视觉检查修正版式。这个任务总步数达到 170 步。
你可以算一笔账:170 步里,GUI 负责网页检索与数据源定位,CLI 负责数据下载与分析,每一步都在往上下文里灌内容。一个"会自己干完一整件事"的 Agent,本质上也是一个"会自己把 Token 烧穿"的 Agent。
3.3 从 "Tokenmaxxing" 到 "给 AI 设额度"
企业的反应很有戏剧性。一开始,大家鼓励员工猛用 AI,这个风潮甚至有个名字叫 "Tokenmaxxing"——拼命堆 Token、拼命用。可很快发现,生产力提升并没有跟上花费。于是画风一转:许多公司开始给内部 AI 使用设上限、封额度。
问题从来不是"哪个模型更便宜",而是"这一连串自主操作,到底烧了多少、烧得值不值"。于是催生了一个新的需求——把简单任务路由给便宜模型、把复杂任务交给贵模型。而这,正是下一节那笔 75 亿美元收购的来由。
图3:推理悖论——单 Token 价格下降,企业 AI 账单反而暴涨
四、Stripe 花 75 亿买下"Token 收费站":谁在给 AI 的活儿定价
4.1 OpenRouter 是什么:400 个模型背后的统一入口
把镜头从杭州切到旧金山。就在 Qwen-UI-Agent 发布的同一周,支付巨头 Stripe 宣布,要用约 75 亿美元收购 AI 模型路由平台 OpenRouter。
OpenRouter 做的事很巧妙:开发者只对接一个端点,背后却能调用超过 400 个模型、来自 80 多家供应商。系统会根据请求的复杂度、价格、速度和可靠性自动打分,把任务路由到最合适的模型——切换供应商,不用改一行代码。它从流经其上的推理消费里抽取大约 5% 作为收入。
这家公司的体量已经不小:超过 1000 万开发者和企业用户,日均处理量超过 10 万亿 Token,英伟达、Zoom、Lovable Labs 都是它的客户。它成立于 2023 年,如今只有约 90 名员工,却被 Stripe 用约 5 倍于三个月前估值(13 亿美元 → 75 亿美元)的价格拿下。
4.2 为什么是 Stripe:Token 成了 AI 的"核心货币"
Stripe 创始人兼 CEO 帕特里克·科里森(Patrick Collison)说了一句点睛的话:"Token 是企业构建 AI 应用的核心货币,而现实世界的经济潜力,取决于能否善用稀缺的算力资源。"
这句话点破了收购的逻辑。OpenRouter 常被比作"Token 版的 Stripe"——Stripe 把付款路由给商户,OpenRouter 把 Token 花费路由给模型厂。两边都是"简化复杂交易、抽一道过路费"的生意,对称到战略上几乎理所当然。Menlo Ventures 的合伙人直言:乍看 Stripe 是个不像的收购方,但相似度"诡异得惊人"。
对 Stripe 来说,这步棋不是押注某个具体模型,而是押注 AI 消费的底层基础设施——它会计费、会路由、会在"每一笔 AI 调用"上抽成。按它自己的话说,是"为 AI 构建经济基础设施"。
4.3 估值三个月涨 4 倍:被重估的"计量权"
更耐人寻味的是估值曲线。OpenRouter 今年 5 月融资时估值才 13 亿美元,8 月就被 Stripe 以 70~75 亿美元拿下,溢价超过 400%。a16z 等早期投资方在一周内连收两笔巨型退出。
市场在用真金白银投票:在自主智能体把 Token 烧成刚需的年代,"谁帮我把 Token 管好、路由好、计量好",本身就是一门值钱的基础设施生意。
图4:Stripe × OpenRouter——Token 路由成为 AI 时代的"经济基础设施"
五、我们站在什么门口:自主智能体 × Token 经济的交汇
5.1 对普通人:你的私人助理,可能开始有账单了
把这两条线拧到一起看,味道就变了。
一边,是 Qwen-UI-Agent 这样的 GUI 智能体,终于能让 AI 真正"替你办事"——从查高铁到约会议,从比价到做报告。手机助手不再只是"问答机",而是"办事员"。
另一边,是 Stripe/OpenRouter 这样的基础设施,开始为每一次 AI 调用"标价格、记流水、做路由"。当 Agent 能自主跑 170 步、烧掉几万 Token,这笔账就不会再是"免费后台运算",而可能变成你手机里一项看得见的成本。
换句话说:你的 AI 助理,可能第一次有了"账单"。你享受它替你办完一整件事的爽感,也得开始操心它"办事"的代价。
5.2 对行业:Agent 竞赛的下半场,是成本治理
更宏观一点,Agent 的能力竞赛正在分出上下半场。上半场比"能不能干完"——谁在基准上拿第一、谁先跑通真机;下半场比"干完要花多少"——谁能又好又省地路由、谁能把 170 步任务控制住、谁能在支付前停手。
Qwen-UI-Agent 们负责"把活干完",Stripe/OpenRouter 们负责"把账算清"。一个造手,一个造收银台;一个在生产价值,一个在计量价值。两条线在同一周合流,不是巧合,而是同一个时代的注脚:AI 正在从"会聊天的工具",变成"会自己干活、自己花钱的主体"。
图5:自主智能体 × Token 经济——造手的人与装收银台的人,在同一周握手
我们这代人,大概会亲眼看到"Token 焦虑"像"流量焦虑""电量焦虑"一样,成为日常。区别是,前两者你还能关掉 App 喘口气,而 Token 焦虑的背后,是一个开始自主运转、并对每一次点击都悄悄计价的智能生态。
当 AI 第一次学会点开每一个 App,它不再只是一个聪明的问答机;当 Stripe 第一次为 AI 的每一次调用标好价格,它不再只是远处的金融基础设施。8 月 20 日前后,造手的人和造收银台的人,在同一周握了手。下一个问题不再是"Agent 能不能替我办事"——而是"它办事花掉的 Token,这笔账怎么算、又由谁来算"。
关于我们
Techub:解构前沿技术,重塑应用场景,把未来的智能生态提前剧透给你。✦ 前沿与生态|具身智能 · AI Agent · 智能家居 ✦ 硬核与落地|非标自动化 · AI 驱动研发 · 智能机电融合 一场充满未知的逆旅。点击上方关注,我们一起捕捉科技奇点。
参考来源
1. 阿里巴巴 Qwen 官方公众号 / 千问, "Qwen-UI-Agent: 以真实世界为中心的 GUI 智能体基座模型", 2026-08-20(技术报告 arXiv:2607.28227;项目主页 tongyi-mai.github.io/Qwen-UI-Agent;GitHub Tongyi-MAI/MAI-UI).
2. IT之家, "阿里发布 Qwen-UI-Agent,主打让模型真正'会用'每一块屏幕", 2026-08-20.
3. Pandaily, "Alibaba Releases Qwen-UI-Agent: Making Models Truly Use Every Screen", 2026-08-20.
4. 腾讯新闻, "阿里发布 Qwen-UI-Agent:让模型真正会用每一块屏幕", 2026-08-21.
5. 网易科技 / 智东西, "阿里把 AI 扔进 100 台真机里'军训',玩转各种屏幕", 2026-08-21.
6. Inside AI, "Stripe to Buy OpenRouter for Over $7.5 Billion in AI Gateway Push", 2026-08-20.
7. 至顶科技 / 今日头条, "Stripe 收购 AI 模型路由平台 OpenRouter,交易额据报超 75 亿美元", 2026-08-20.
8. 腾讯网(引纽约时报), "Stripe 同意以 75 亿美元收购 OpenRouter", 2026-08-20.
9. Payments Dive, "Stripe, OpenRouter finally strike a deal", 2026-08-20.
10. DEV Community(minh_phuongnguyen), "The Inference Paradox: Why Agentic Workflows Are 4x More Expensive Than You Think", 2026.
11. MintMCP Blog, "LLM Cost Optimization for Agent Teams: Route, Track, and Reduce (2026)".
12. 《财经》, "Token 经济,中国账本"(封面报道), 2026.
作者:Techub
作者:Techub
夜雨聆风