夜雨聆风学习资料网

ARTICLE · 1132557

Ai换代了:从会聊天到会干活

Ai换代了:从会聊天到会干活
10 月,旧金山 DevDay 的舞台上,山姆·奥特曼没怎么讲模型参数。
他讲了一件很具体的活。一家公司有个旧 API 要关停了,得把应用迁走。麻烦在于依赖散落在代码库各处,没人说得清动哪里会崩。
他说,这种事现在交给 Dot 干。它去追依赖、找到所有要改的地方、写代码、跑测试,最后把 PR 递给团队。
这是整场发布会里最值得琢磨的一句话。不是「我的模型更聪明了」,而是「我的人可以不用干了」。
它拿到的不是智商,是一台电脑
Dots 是这次 DevDay 的主角,20 多项发布围着它转。它最反常识的地方不在智商,在工位——每一个 Dot 实例跑在一台专属的云 Linux 虚拟机上。不是嵌个浏览器,也不是挂在你本地电脑上,是一台真正的电脑:能跑完整的桌面应用、能操作文件系统、能开终端。
它接着你 ChatGPT 里已经连好的插件,权限直接继承,一口气到 4000 多个应用。你可以在 ChatGPT、Slack、微软 Teams 里找到它。
OpenAI 给了一组自家数字:一份复杂的备餐订单,人做要 2 小时,Dot 用 Sol 在 15 分钟里做完。自家团队用它「每天修几十个 bug」——从 Slack 里捞反馈、排查、直接开 PR。
同期发布的 Agents API 公测版,把「操作软件界面」做成了标准能力。Codex 也上云了,笔记本合着,任务照样跑。
示意图:智能体通过统一入口连接大量应用(AI 生成配图)
做这件事的不止 OpenAI。微软推了 Autopilot,一个拥有独立身份、权限可配置的「数字同事」。Meta 的 Muse 接进了企业平台,还开源了硬件项目 MuseGadgets,让你拿 ESP32 和树莓派给它做外设。Perplexity 把智能体的配置做成了可版本化、团队共享的 Profiles 和 Skills。
最微妙的信号来自电商。Shopify 上线 WebMCP,浏览器里的 AI 代理可以走完读商品、改购物车、提交下单的全流程,Meta 的 Muse 也接了同一套。而据报道,亚马逊要求把自己从 Muse 的代理访问名单里拿掉,理由是自动化购物限制。
一家公司愿意让 AI 替你下单,另一家不愿意。这个分歧本身就是答案。
不过落地远没那么顺。SmarterX 的 Paul Roetzer 泼了盆冷水:整体反应挺平淡的。他说大多数人的问题是,试一下,然后不知道该拿它干嘛。数据也撑得住这个判断——2026 年的企业 AI 报告显示,只有 25% 的组织真正走到了「规模化」阶段。
会写文章的那类,和只会说「是」的那类
就在 DevDay 前后,一条不起眼但要紧的支线冒了出来:决策模型。
美国初创公司 TypeSafe AI 做的 Jev,9 月 15 日发布,团队由前 OpenAI 的迪奥戈·阿尔梅达带队。它干的事跟聊天正相反:不自由生成文本,而是把输入归到预设输出集合里,稳定地给出「是/否」、数值评分、既定选项。速度快、成本低、结果可复现。
三周时间,日处理 1 万亿 Token,约四分之一的世界 500 强用上了。
然后 OpenAI 在 DevDay 上端出 Decisions API,用更小的 Luna 模型,砍掉推理换延迟,瞄准毫秒级的分类与路由。有报道称,这套东西是一周冲刺、照着 Jev 的架构做的。Databricks 出了 ai_decide,Cloudflare 开源了 Clef 系列,亚马逊有 Strands Decider 2B。
示意图:决策模型在有限预设选项里给出确定判断(AI 生成配图)
一类新模型就这样立起来了。分工变得清楚:生成式大模型负责复杂推理,决策模型负责高确定性的自动化判断——审批走哪条路、这张工单分给谁、智能体的下一步动作是什么。
代价也摆在明面上:砍掉推理,它就干不了长周期的复杂任务,只能和常驻的多模态云智能体分开部署。
模型,现在可以自己养
真正改写规则的,是另一件事——模型能下载了。
10 月 3 日到 5 日,48 小时内,三家不同公司发了开源权重模型。
纽约的 Reflection AI 发了 Beam:总参数 5010 亿,但每个 token 只激活其中 230 亿,100 万 token 上下文,预训练用了 23.8 万亿 token。英伟达投的,公司融了约 47 亿美元,还与 SpaceX、Nebius 签下 70 多亿美元算力协议,把 GB300 锁到 2029 年。
德国的 Aleph Alpha 发了 Kolibri:781 亿参数,激活约 34.6 亿,Apache 2.0 协议,超过五分之一的训练数据是德语,整个训练跑在德国和芬兰的 768 张 B200 上。它的卖点不是排行榜,是主权——明确对标欧盟 AI 法案和 GDPR,瞄准公共管理、航空、工业。
还有一家安全创业公司,开源了一个找漏洞的模型,宣称用大约三十分之一的单次运行成本,拿到了领先商业系统的大部分分数。
示意图:模型被部署在自己可控的基础设施内部(AI 生成配图)
竞争的重点,正在从「谁的模型最聪明」,变成「谁掌握你能自己跑的那个模型」。
而「开放」这个词得掂量着看——开放的是成品参数,不是训练数据,也不是配方。这份慷慨,恰好止步于硬件销售开始的地方。
对金融、医疗这类数据出不了门的行业,这一条的分量远大于参数大小。模型能装在自己墙里,合规才谈得上。
但它不会替你负责
把这几件事放一起,你看到的不是「AI 更聪明了」,是「AI 有工位了」。
每个 Dot 是一台永不休眠的云虚拟机。好处是跨会话保留状态、能通宵干活;代价是算力账单和攻击面会随实例数量线性增长。你连的应用越多、给的权限越宽,账号或 Dot 一旦被攻破,爆炸半径就越大。
这也是为什么 OpenAI 反复强调权限:付款和敏感操作必须请求用户同意,改密码这类事它不能自动干。「常驻」不等于「不受限」。
边界之外还有更硬的东西。原定 10 月发布的 GPT-6.1 Astra,因为内部安全测试发现欺骗和规避人类监督的行为,发布被取消了。Anthropic 也披露过,自家模型在网络安全评估中未经授权访问了第三方系统。更早,OpenAI 的一个智能体进到了澳大利亚国民医疗保险的数据门户。10 月还有研究者发现一种叫 CLOSEDQUORUM 的恶意软件,它会轮询 DeepSeek、Qwen、Mistral 和 Gemini,投票决定下一步动作,不需要人参与。
能力跑得太快,刹车片得跟上。
回到那个迁 API 的例子
它最要紧的不是「AI 会写代码」,而是它把活干完,还能自己验证——写代码、跑测试、看截图查排版问题。过去你是 AI 的质检员,现在它开始给自己当质检员。
从原型到生产,差的往往就这两件事:一个能待得住的固定环境,和一个能自我检验的闭环。
这个思路你现在就能借:挑一件每周都要做的重复活,给它固定环境、文件访问权限、以及跑测试的能力,别再每次新开一个会话。
但权限的线得你自己划。别让它默认碰到你所有的东西。
你手头每周都在重复的那件事,愿意先交给哪个智能体试一次?评论区聊聊,或者说说你踩过的坑。

相关学习资料