近日,人工智能行业同时发生了两件非常关键的事情。

第一件事,OpenAI大幅下调GPT-5.6系列中小模型的价格。
其中,GPT-5.6 Luna价格下降80%,GPT-5.6 Terra价格下降20%。
第二件事,Google宣布将Gemini Spark直接接入Chrome浏览器。
获得用户授权后,它可以使用已经登录的网站账号和浏览器保存的信息,帮助用户预约看房、查找航班,甚至启动预订流程。涉及支付等敏感操作时,再把控制权交还给人类。
这两条消息表面上分别属于模型价格和浏览器功能。
但放在一起看,它们指向了AI产品正在发生的一次根本变化:
AI正在同时获得更低的运行成本和更强的行动能力。
过去,AI主要负责回答问题。
接下来,AI会越来越多地直接进入软件、网页和工作流程,替用户完成实际操作。
而当一个能够操作工具的智能体,运行成本又下降到足够低时,AI才真正可能从偶尔使用的助手,变成长期运行的数字劳动力。
一、OpenAI为什么突然把模型价格降了80%?
根据OpenAI在7月30日公布的最新价格,GPT-5.6 Luna的API价格调整为:
每百万输入Token 0.2美元;
每百万输出Token 1.2美元。
此前的价格分别是1美元和6美元,相当于整体下降了80%。
GPT-5.6 Terra则调整为每百万输入Token 2美元、输出Token 12美元,较此前价格下降20%。
旗舰模型GPT-5.6 Sol的标准价格暂时没有变化。
很多普通用户看到这里,可能会觉得:
这只是API便宜了一些,与日常使用关系不大。
但对智能体产品来说,80%的降价非常重要。
因为聊天机器人和智能体的成本结构完全不同。
普通聊天机器人通常是:
用户问一次;
模型回答一次;
任务结束。
但一个智能体为了完成一项工作,可能需要连续运行几十个步骤:
读取资料;
分析用户意图;
搜索网页;
调用外部工具;
填写表格;
检查结果;
发现错误后重新执行;
最后再把任务交付给用户。
假设每一步都需要调用模型,原本一次只花几分钱的请求,经过几十次调用、失败和重试后,最终成本可能迅速放大。
所以,智能体产品真正关心的不是:
一次回答多少钱?
而是:
完成一项完整任务,最终需要花多少钱?
二、模型价格下降,真正改变的是智能体的商业模型
OpenAI在官方公告中明确提到,降低Luna和Terra价格,是为了让高频、规模化的工作更容易实现商业化。
例如:
大规模文档分析;
客户咨询分类;
日常代码实现;
后台自动化任务;
工具调用和多步骤工作流。
OpenAI还提出,一项复杂工作可以由不同模型分工:使用Sol处理高不确定性的规划和决策,再让更便宜的Luna完成明确的代码修改、测试和结果评估。
这个思路非常重要。
过去,很多AI产品为了追求效果,所有任务都调用最强模型。
这就像一家企业无论处理什么事情,都请最昂贵的专家亲自完成。
让专家判断公司战略当然合理。
但如果整理表格、检查格式、分类评论和修改文件名,也全部交给专家处理,成本一定无法控制。
未来更成熟的AI系统,会采用分层结构:
低成本模型负责分类、提取和格式处理;
中档模型负责常规分析和执行;
旗舰模型只处理复杂决策、困难推理和最终审核。
这意味着,AI产品的竞争不再只是“谁接入了最强模型”。
而是:
谁能判断每一个步骤到底需要多强的模型;
谁能减少不必要的调用;
谁能让任务失败后只重做局部,而不是全部重新运行;
谁能以最低成本交付用户真正需要的结果。
三、Google则在解决另一个问题:AI如何真正把事情做完?
即使模型价格降得再低,如果AI只能在聊天框里回答问题,它仍然只是一个信息工具。
要成为执行系统,AI必须能够操作真实软件。
Google这次把Gemini Spark接入Chrome,正是在跨越这道边界。
根据Google官方介绍,在用户明确授权后,Spark可以利用Chrome的自动浏览能力,使用用户已经登录的账号和保存的信息,完成复杂的网页任务。
Google给出的例子包括:
为用户收藏的公寓预约看房;
研究航班方案;
启动机票预订流程。
对于付款等敏感动作,Spark会暂停自动执行,将任务重新交还给用户确认。该能力目前首先在美国推出,后续再扩展至更多地区。
这里最重要的变化是:
AI不再只是告诉你应该点击什么。
它开始替你点击。
过去,你可以问AI:
“请帮我找三套符合要求的房子。”
AI可能提供一些搜索建议和链接。
但最终仍然需要你亲自:
打开网站;
输入区域和预算;
筛选户型;
逐个比较;
填写联系方式;
选择预约时间;
提交预约。
接入浏览器以后,智能体可以直接进入这套流程。
用户只需要告诉它最终目标:
“帮我从收藏的房源中,筛选出距离公司40分钟以内、预算不超过5000元、周末可以看房的房子。”
剩下的网页搜索、信息提取、条件筛选和表格整理,都可能由智能体自动完成。
四、浏览器为什么会成为AI最重要的执行环境?
因为大多数数字工作,本来就发生在浏览器中。
我们通过浏览器:
收发邮件;
处理文档;
查找信息;
管理客户;
购买商品;
预订出行;
发布内容;
操作后台;
管理云服务;
查看财务数据。
过去,AI想进入这些工作流程,需要每一个平台单独开放接口。
开发者必须分别接入邮箱接口、日历接口、电商接口和企业软件接口。
而浏览器提供了另一条路径:
既然人类可以通过网页操作这些系统,AI也可以通过理解页面、点击按钮、填写表格和读取结果来完成任务。
Chrome本身又保存了大量用户上下文:
登录状态;
密码和自动填充信息;
历史记录;
标签页;
文件下载;
与Google服务的连接。
因此,浏览器不仅是AI获取信息的入口,也是AI执行任务的控制台。
这也是为什么Google正在把Gemini从浏览器侧边栏中的问答助手,逐渐升级为可以跨页面完成多步骤任务的操作员。Google此前推出的Chrome自动浏览功能,已经可以处理旅行规划、表格填写、商品筛选和公寓查找等任务。
五、这两条新闻放在一起,意味着什么?
OpenAI解决的是:
让智能体运行得更便宜。
Google解决的是:
让智能体能够真正操作现实中的数字工具。
当这两种能力结合起来,AI产品才会出现真正的质变。
过去,一个AI助手可以帮助你写一封邮件。
未来,它可以:
发现某位客户长时间没有回复;
读取此前的沟通记录;
判断项目进度;
草拟跟进邮件;
选择合适的发送时间;
等待你的确认;
最终完成发送。
过去,一个AI可以提供旅游建议。
未来,它可以:
读取你的日历;
确认空闲日期;
搜索机票和酒店;
比较总预算;
把商品加入购物车;
在最终付款前请你确认。
过去,一个AI可以帮你写视频简介。
未来,它可以:
检测文件夹中的新视频;
识别视频内容;
分别生成抖音、B站和视频号文案;
检查各平台格式;
上传视频和封面;
保存为草稿;
只在正式发布前提醒你审核。
这时候,AI提供的已经不是一次回答,而是一段持续运行的业务流程。
结语
OpenAI降低模型价格,Google让Gemini Spark进入Chrome,看起来是两项不同的产品更新。
但它们共同跨过了一条重要的分界线。
AI正在同时变得:
更便宜;
更主动;
更接近真实工具;
更有能力完成完整任务。
过去,我们购买的是模型的回答能力。
未来,我们购买的可能是任务的最终结果。
不是生成一段旅行建议。
而是完成一次旅行规划。
不是写一封跟进邮件。
而是持续管理客户沟通。
不是分析几个租房链接。
而是从筛选房源一直推进到预约看房。
当模型足够便宜,浏览器又为它提供行动能力以后,AI才真正开始从聊天工具转变为执行系统。
接下来真正决定产品竞争力的,不再只是模型有多聪明。
而是它能否在明确的权限和成本范围内,稳定地把事情做完。
我是马伯言,每一次思考都在成长。
夜雨聆风