夜雨聆风学习资料网

ARTICLE · 1129976

AI 日报 10.6|推理成本与延迟优化:GPT-6.1 Sol 五分之一价逼近 Astra

AI 日报 10.6|推理成本与延迟优化:GPT-6.1 Sol 五分之一价逼近 Astra

一、头条:单位成本被三股力量一起往下压

这轮模型发布里,最值得读的不是一个新名字,而是一条成本曲线。OpenAI 在 DevDay(9 月 29 日)推出 GPT-6.1 Sol:官方口径是接近 GPT-6 Astra 的性能,定价 2 美元 / 百万输入 token、10 美元 / 百万输出 token,约为 Astra 的五分之一;上下文窗口 105 万 token,并新开 Ultrafast 档做到 300 token/秒。更早几天,GPT-6 Sol 与 Luna 已经把"更强缓存 + 分档能力阶梯"当作生产级 agent 的卖点。

值得关注的原因:过去一年 token 单价降了约八成,但 agent 工作流一个任务要调几十到上百次模型,单价便宜挡不住"每任务成本"反弹。真正把单位成本压下来的,是缓存命中(共享系统提示词只算一次)、把简单请求路由到小模型(省 40%–60%)、以及把长上下文的冗余前缀压缩掉——这三件事和"换更便宜的模型"一样关键,甚至更关键。

二、[AI Coding] OpenAI DevDay 把编码 Agent 推向"可托管运行"

同一场 DevDay 上,Agents API 新增 computer use(Agent 能操作软件界面和云环境),Codex 进入可复用的云项目形态,并发布 Codex Security Cloud(定时扫描、去重、给修复建议)。

值得关注的原因:编码 Agent 的竞争从"谁的模型写代码更准"切到"谁能让 Agent 真正跑起来、长期挂着、还能被治理"。只读定时扫描 + 人工审批闸门的节奏,正是企业敢把自动改代码接进 CI 的门槛。

三、[具身智能] IROS 2026:人形机器人从演示走向上岗

9 月 27 日至 10 月 2 日,IROS 2026 在匹兹堡召开,主线是"physical AI 从 splashy demo 转向真实部署"。Figure 与 Nscale 签下 35 亿美元算力合作(后续可扩到 60 亿、最多 10 万张 Nvidia GPU);Agility 发布 Digit 5,上一代 Digit 4 已在北美客户现场跑超 6.5 万小时;Tesla Optimus 一代产线在 Fremont 安装;美国《R15.08 第 3 部分》工业机器人安全标准落地。

值得关注的原因:资本、产线、安全标准三件一起到位,说明人形机器人正越过"能不能动"的演示期,进入"能不能批量上岗、出事谁负责"的工程期。这恰恰是 N05 数据飞轮和 N06 大脑路线之后,产业真正要补的功课。

四、[推理优化] 开源 Strata 让 125B MoE 跑在单张游戏显卡上

10 月 4 日,开源项目 Strata 发布:用 C++20/CUDA 引擎把 Qwen3.8-Flash-Next 这类 125B MoE 模型流式地放到单张 12–24GB 显卡的显存 + 主机内存 + NVMe 上跑,RTX 3090 上约 70 token/秒、写入 60–95 token/秒,并支持 MTP 投机解码(接受 2.4–3.2 token/步,与贪心逐字一致)。

值得关注的原因:这把"前沿开源模型本地可跑"的门槛又压低了一截。对推理成本敏感的个人和小团队,单卡 + 大内存的"穷人方案"正在变成可用的生产线,而不是玩具。

五、[芯片/算力] OpenAI 的 Jalapeño 推理芯片绕开 Nvidia 全栈

10 月 2 日,多方报道 OpenAI 把自研推理 ASIC「Jalapeño」与 AMD EPYC Turin CPU 搭档做机架级部署,明确不依赖 Nvidia 的 Vera 全栈。同期 Nvidia Vera Rubin 平台主打"机架级 token/秒/瓦"、宣称推理 token 成本降约 10 倍。

值得关注的原因:推理正在从"通用 GPU 顺手干"独立成一个硬件品类——为固定架构、海量、可预测的工作负载专门造芯片,每瓦性能能再挤 10%–30%。Jalapeño 上 AMD 而非 Nvidia 做主机,是头部客户主动给 Nvidia 全栈"去锁定"的最强信号。

相关学习资料