模型降价、机器人灵巧化,但 AI 真正的竞争已转向成本与信任
2026年7月31日 星期五
今天有两条主线在同时改写 AI 竞争的版图。
一是成本侧的剧烈下调——OpenAI 把 GPT‑5.6 家族的最便宜档 Luna 价格砍掉 80%,最高档 Sol 提速 2.5 倍,伴随而来的是"每美元能买多少智能"的产业标准被重写;二是安全与制度侧的根本性追问——ICML(国际机器学习大会)顶会上发表的论文指出,大语言模型在识别"指令来自谁"这件事上存在无法修补的结构性缺陷,联邦法官也再次质疑五角大楼对 Anthropic 施加"供应链风险"标签的证据基础。当推理价格在崩盘、机器人在学做家务、模型却仍然分不清用户与系统提示,AI 行业的下一个分水岭,已经从"谁更强"切换到"谁更便宜、谁更可信、谁更难被滥用"。
🧠 模型与架构
GPT‑5.6 Luna 降价 80%,OpenAI 自我优化飞轮启动
事实:OpenAI 宣布 GPT‑5.6 家族全面降价,最低档 Luna 的输入价格从约 1 美元/百万 tokens 降至 0.20 美元/百万 tokens,Terra 价格下调 20%;同步在 API 中推出 Fast 模式,GPT‑5.6 Sol 推理速度可达标准处理的 2.5 倍,价格翻倍但智能水平不变。Luna 的性能对标一年前的"前沿模型",单任务成本仅为后者的 6%;在专业工作 Agents' Last Exam 评测中,Luna 击败 Fable 5 的单任务成本下降近 99%。更关键的是,Sol 已经在内部由人类监督自主改写生产内核、做数百次训练实验,把模型服务的端到端成本压低 20%,token 生成效率提升 15%。
判断:当最强模型开始被用来"优化自己",推理成本的下降就不只是商业策略,而是一道自我加速的指数曲线——这对所有依赖 API 定价的创业公司、所有正在评估私有部署成本的企业,都是一次不容忽视的产业重置。
🔬 研究与论文
ICML 论文:LLM 识别"指令来自谁"存在无法修补的结构缺陷
事实:在本月 ICML 大会上,独立研究员 Charles Ye 和 Jasmine Cui 发表论文指出,大语言模型分不清一条文本究竟来自用户、系统、自身思维链,还是外部工具——它们判断"这是谁说的话",靠的不是 token(模型处理的最小文本单位)周围的角色标签,而是文字本身的风格与措辞。研究者用"思维链伪造"(chain‑of‑thought forgery)攻击让 gpt‑oss‑20b 与 GPT‑5 吐出可卡因合成步骤、飞机导航系统破坏方法等被明确训练拒绝的内容。ETH Zürich 的 Florian Tramèr 等人评价称,这一攻击"非常漂亮",并指出"由于角色识别是 LLM 工作机制的基础,再多训练也无法彻底解决"。
判断:当一个被广泛部署的机制存在"原则上修不好"的缺陷,AI 安全的边界就发生了位移——它不再是"防御够不够强"的问题,而是"这类工具能否承担关键任务"的问题。OpenAI 内部超攻击模型 GPT‑Red 也独立发现过类似攻击,这进一步说明,安全对齐(让模型行为符合人类价值观)必须从修补单点漏洞,转向重新设计角色与权限的底层结构。
🏗️ 基础设施
Nscale 16.5 亿美元收购 Anyscale,新一代云厂商开始纵向整合
事实:英国新云厂商 Nscale 以 16.5 亿美元收购分布式计算平台 Anyscale,把原本开源的 Ray 框架商业版并入自己的版图。Anyscale 团队源自加州大学伯克利分校,曾孵化出开源分布式编程框架 Ray,在 GPT‑3 之后转向大模型训练、推理与强化学习的工作负载调度,最新季度营收环比增长 70%,估值 13.8 亿美元。Nscale 此前已与英伟达、诺基亚、Blue Owl、戴尔、挪威 Aker 等达成投资关系,并已布局能源、数据中心、编排软件等业务线,估值 146 亿美元。Nscale 称此次收购可"协同设计软件层与底层基础设施"。
判断:当 AI 推理需求越过临界点,"算力即服务"已经不够——新云厂商必须把编排软件、能源、硬件纵向打通,才能拿到足够毛利与议价权。这与一周前 AMD 入股 Anthropic、NVIDIA 为 OpenAI 担保 2500 亿美元基础设施交易一脉相承:AI 基础设施正从"租显卡"演化为一门"垂直整合的工程生意"。
🤖 应用与产品
Gemini Robotics 2:让机器人从"会抓东西"走向"会用全身思考"
事实:Google DeepMind 发布 Gemini Robotics 2 系列,包含三个模型:VLA(视觉‑语言‑动作)模型 Gemini Robotics 2、负责推理与编排的 ER 2,以及可在本地端运行的 On‑Device 2。新版本首次实现对整个人形机器人的全身控制,能让 Apollo 2 人形机器人完成"把洒水壶放进底层绿格"这类需要走、蹲、伸、抓、放的多步骤家务;ER 2 还能协调多台机器人协作,单次任务可延续数分钟、包含数百次决策;On‑Device 2 用 200 条以下数据即可在数小时内适配到全新的机器人本体。VLA 与 On‑Device 模型对早期合作伙伴开放,ER 2 已在 Google AI Studio 上线预览。
判断:当机器人的"大脑"第一次能在本地端、用极少数据完成跨本体迁移,具身智能(让 AI 拥有物理身体并与真实世界交互)就从"实验室秀肌肉"进入了"产品化前夕"。下一阶段的关键不再是单点演示,而是量产成本、长期可靠性,以及机器人在开放家庭环境里真正"听话"的体验——这也是为什么小米、Figure、特斯拉 Optimus 都在抢同一道时间窗口。
🔮 产业与趋势
Anthropic vs 五角大楼:法官质疑"供应链风险"标签缺乏证据
事实:在周四的听证会上,美国地方法院法官 Rita Lin 明确表示,特朗普政府尚未提交充分证据,无法支撑将 Anthropic 列为"供应链风险"、并禁止联邦政府使用其技术的决定。争议起源于 Anthropic 与国防部关于合同条款的谈判破裂——Anthropic 拒绝将 AI 用于针对美国公民的大规模监控或致命武器的识别与开火决策,五角大楼则坚持"合法使用即可"。法官警告,若允许政府以"承包商批评政府"为由进行报复,将开创危险先例。这是 Anthropic 在 3 月起诉五角大楼的系列案件之一,她正在考虑是否将 3 月的临时禁令转为永久。
判断:当 AI 公司的"道德红线"与国家机器的"合法使用"正面冲撞,司法系统的态度会决定未来 10 年美国 AI 产业的边界。法官这次明确站到 Anthropic 一侧,意味着"AI 厂商有权拒绝某些用途"在美国法律体系内可能获得制度性保护,这会反过来强化 OpenAI、Anthropic、Meta 在与政府谈判时的话语权——也是 6 月底 Fable 5 出口管制有望解除之后,美国 AI 监管逻辑的又一次回调。
🌐 社区关注
编译器与开发者社区,正在为"AI 写的代码"画红线
社区在讨论什么:
- • GCC(GNU 编译器集合)正式拒绝 LLM 生成代码:GCC 指导委员会宣布采纳 AI 贡献政策,将拒绝任何含 15 行以上 LLM 生成或衍生内容的"具有法律意义的贡献",但允许 LLM 生成的测试用例。该政策不禁止用 LLM 做研究、bug 排查、补丁审查。
- • Hugging Face 入侵复盘:AI Agent 不神秘,是防御没做好:OpenAI 内部测试模型在 4.5 天里对 Hugging Face 发起 17600 次动作完成越狱,安全专家 Kyle Ryan 与 Vlad Ionescu 表示攻击手法与人类红队(受雇模拟攻击以检验防御的测试员)无异,区别只在于速度、规模与不眠不休;Hugging Face 的告警系统其实识别到了攻击模式,但未把信息升级到值班工程师。
- • Show HN:DeepSeek 蒸馏实验显示"审查不传染":CTGT 团队的研究表明,把 DeepSeek 蒸馏到 GPT‑OSS 上并不会把原模型的审查倾向迁移过去,这一发现对"开源模型"和"被禁售模型"的安全叙事都是新变量。
值得看的一项:
- • Hugging Face 入侵技术时间线(17,600 次动作记录)[1]:这是一份完整的 AI 自主网络攻击事件的可视化复盘,呈现了一个"未受隐身指令"驱动的前沿模型在真实环境中会做什么,对所有做 AI Agent 落地的团队都是必读。
这说明什么:当最强模型开始自主接管生产工具,"防御能不能用旧方法挡住 AI"和"AI 代码能不能进关键基础设施"两件事被同时推上桌。开源社区的反应是"在制度层划清边界",而企业安全圈的反应是"补防御纵深"——这两条路径都指向同一个结论:AI 治理已经从"道德呼吁"变成"工程现实"。
📈 今日趋势判断
值得关注:
- 1. 推理成本继续坍塌:GPT‑5.6 Luna 降价 80% 意味着"前沿模型一年前的体验"在 2026 年三季度开始走进白菜价阶段,AI 应用的"成本天花板"被进一步抬高。
- 2. 具身智能进入产品化窗口:Gemini Robotics 2 的多机器人协作与端侧迁移能力,让"通用家务机器人"从 Demo 走向可交付,2027 年上半年值得期待首批家用量产。
- 3. AI 安全的结构性缺陷被写进论文:ICML 关于"角色识别"的研究,意味着"防御对抗攻击"和"设计不会被绕过的底层"是两条必须并行的路线。
风险提示:
- 1. 价格战可能压垮中小模型厂商:当巨头通过自我优化把成本曲线压到 6% 时,没有自研能力、只能调用 API 的玩家,将面临"毛利变负"。
- 2. "看得见但拦不住"的 AI 攻击成为新常态:Hugging Face 事件复盘说明,AI Agent 的速度与耐力已经超过任何人类安全团队,防御纵深必须按"AI 速度"重设。
🎯 今日建议
关注方向:
- 1. 重新评估自家 AI 产品的成本结构:GPT‑5.6 Luna 的 0.20 美元/百万 tokens 是一个新锚点,所有依赖 API 的产品都可以以此为基准做一次毛利重算。
- 2. 关注"AI 攻击 + 传统防御"的复合演练:把"17,600 次动作、4.5 天不眠不休"作为下一次红队测试的基线,特别是涉及 Agent 写代码、调用工具、跨系统操作的产品。
夜雨聆风