ARTICLE · 1141283
ChatGPT 的野心:吞噬一切 App
大家吼,我是 Ai 测评的老章
Codex 越来越拉了 一文中我说 OpenAI 最近每天都要搞新闻,模型不如 A 社,速度巨慢,消耗极快这些问题需要尽快解决
Tibo 开启了 28 天不更新就重置计划,他好像一直不知道大家想要的是什么

不过,刚刚更新的 GPT-6 边思考边回答和 Intelligent UI(智能交互界面)大家还是很买账的
这次 GPT-6 的边思考边回答彻底重构了这种先憋完再输出的单向链路!
它把深度思考和答案组装做成了交叉流式协同:
模型一边继续在深层思考后续的推理分支,一边会把当下已经确认的阶段性结论、背景铺垫与核心要素先行组织输出给用户!

以往生成复杂界面需要等整个 HTML/JS 代码写完才能渲染,现在是模型一边推理,组件编译器一边在前端同步流式解析构建!你在屏幕前看着一个按钮、一个卡片、一个滑块如同搭积木一样实时生长出来,响应几乎零卡顿

我实测了几个例子,发现它并非每次都可以触发,用 GPT-6 更容易触发,在工作模式更容易出发,GPT-5.6+ Codex 模式难以触发

同样的提示词,没有触发 Intelligent UI 是这样的

提示词:
请用“每天买咖啡、面包和牛奶”这个生活场景,向一个没有经济学基础的人解释通货膨胀。我不想只看定义,想亲手改几个价格,看看一篮子东西的成本会怎么变。
请做一个可交互的简化购物篮。基期设定为:咖啡每杯 10 元、购买 10 杯;面包每个 5 元、购买 20 个;牛奶每盒 8 元、购买 10 盒。以上都是虚构教学数据。固定购买数量,让我分别调整三种商品的当期价格,并同步显示基期成本、当期成本、以基期为 100 的价格指数和涨幅。用图表展示各商品对成本变化的贡献,并明确这只是教学模型,不等于真实 CPI 的完整统计方法。

提示词:
周六晚上 6 点半,朋友来我家吃饭,目前 6 个人,可能增加到 10 人。厨房只有两个灶和一个电饭煲,没有烤箱。帮我安排一顿准备难度适中的中式家宴,尽量避免客人到了我还一直在厨房忙
请把方案做成可以操作的家宴计划:能调整人数和开饭时间,查看菜品卡片、对应食材用量、采购清单和做饭时间轴。人数改变时,采购量要同步更新;开饭时间改变时,关键准备节点要一起调整。备菜步骤可以勾选完成。注意两个灶的使用冲突,不要把烹饪时间简单按照人数成倍放大。

提示词:
给我一个可以直接在聊天里玩的复古像素小游戏:小猫在画面底部左右移动,接住掉下来的鱼,同时躲开掉下来的靴子。画面简单一点,但我要能马上开始玩。
规则是接到一条鱼加 10 分,碰到一只靴子减少一条生命,初始有 3 条生命,每局 60 秒,时间结束或生命耗尽时结算。提供开始、暂停、继续和重新开始按钮,支持键盘左右方向键,也提供屏幕上的左右移动按钮。分数、生命和倒计时要实时更新。只做一个完整的小回合,不要扩展登录、排行榜或后端,也不要只给游戏截图、规则说明或代码。
提示词:
我刚开始学摄影,想拍夜晚走动的人,但总分不清快门、光圈和 ISO 分别影响什么。请用一个能调整参数的演示教我,不要一上来就给一堆公式。
请设置一个固定的教学场景,里面有移动的人物、近处物体和远处背景。提供快门、光圈和 ISO 三组可调整控件,调整时,场景示意和简短解释同步展示亮度、运动模糊、背景虚化和噪点的变化方向。能恢复默认参数,也能并排比较调整前后。明确这是教学近似,不要把它包装成某款相机的真实成像或实测结果。

提示词:
我总把两件事混在一起:“硬币抛得足够多,正面比例会接近一半”,以及“已经连续出了好多次正面,下一次应该轮到反面了”。请用一个可以亲手操作的抛硬币实验,帮我理解这两种想法有什么区别。
抛硬币实验:可以一次增加 1 次、10 次、100 次或 1000 次投掷,显示累计投掷次数、正反面数量,以及正面比例随次数变化的折线图。默认正面概率是 0.5,也能调整成偏置硬币,并显示相应的概率参考线。能重置实验。结果必须来自随机抽样,不能预先写死一条越来越平滑的曲线。

提示词:
帮我规划一个从杭州出发、去德清和安吉的两天一夜亲子自驾路线,两大一小。偏好自然风景、轻松散步和适合孩子停留的地方,不想高强度爬山,每天开车尽量不超过两小时。先做不绑定具体日期的路线草案。
请把路线放到聊天里的可交互地图和每日行程中。点击停靠点能看到停留建议、预计车程和适合去的理由;能在“少开车”和“多看自然”之间切换,并同步调整路线。标明哪些信息是估算。涉及开放时间和票价时,请先核实来源,没核实的不要编造。只做规划,不预订、不付款。

提示词:
帮我拆解一台台式电脑的内部结构,让完全不懂电脑的人也能看懂:CPU、显卡、内存、SSD、主板、电源和散热风扇分别干什么,它们又是怎样配合工作的?
请直接在聊天里用可交互的结构示意图展示。点击某个部件时,高亮它,并显示简短说明和它与其他部件的连接关系。提供“日常办公”“玩游戏”“运行本地 AI”三个场景,切换后突出各场景主要涉及的部件。结构要清晰准确,不必追求写实 3D,也不要虚构实测功耗、速度或占用率。

其实,这个功能,我在豆包中很早之前就发现了,很多回答,它倾向于给出可交互图解
我又拿相同提示词试了一下,效果居然不输 ChatGPT

花里胡哨的功能最能吸引注意力,但是我比较看重模型本身能力的提升
大模型世界,模型能力就是一切,一俊遮百丑
这次 OpenAI 针对不同用户梯队,对底座模型完成了全套换代更新:
GPT-6 Sol:主力旗舰版本,专门配备给 ChatGPT Plus、Pro、Business 以及 Enterprise 企业版订阅用户,拥有满血的思考深度、全套 Intelligent UI 调度能力以及极高的并发处理阈值 GPT-6 Luna:轻量普及版本,全量推送给全球海量的 Free 免费版和 Go 用户,同样支持日常对话与基础智能 UI,日常响应极为轻快敏捷 Codex 与 Work 专区:这次更新暂时仅针对 ChatGPT 对话端,Codex 编程专区和 ChatGPT Work 企业工作流中依然沿用此前 9 月份的版本矩阵,后续会逐步统一步伐
OpenAI 官方内部评测给出的实测数据:
在高价值的日常复杂 Agent 任务中,GPT-6 Extra High 的首字响应时间,直接拉平到了上一代 GPT-5.6 Medium 的极速水平,而最终任务的综合完成度得分甚至超越了过去的 GPT-5.6 Extra High 在需要联网搜索检索最新信息的复杂场景下,GPT-6 Instant 的平均首字吐出速度,比 GPT-5.6 Instant 还要整整快出 44% 更加关键的是,它大幅减少了无效的搜索抖动,能够更精准地抓取支撑论据的关键页面,避免大模型在全网胡乱瞎逛浪费 token 遇到复杂的数理逻辑、编程或者 Agent 规划任务,模型在后台疯狂开动思维链,屏幕上一片漆黑或者只转一个思考圈圈,往往一憋就是几十秒甚至一两分钟,用户根本不知道它卡死没有,心理压力拉满
总结
GPT-6 + Intelligent UI 正在将回答本身正在直接演变成即用即弃的微型软件,整个 IT 行业和应用生态的生存法则,恐怕要迎来一次大清洗:未来很多传统软件完全没有单独存在的必要了
以前软件是开发者写死、打包上架、用户下载安装的静态程序;未来软件的概念会被彻底解构,直接附着在每一次即时自然语言交互之中,需要时动态生长,用完即刻消散
大模型厂商的超级 App 会像黑洞一样,把海量的碎片化需求全部吸入对话框