AI 速递 07-20|Kimi K3 算力告急、Qwen 3.8 发布、Grok 4.5 登顶编程榜
本期精选 14 条 近两天 AI 领域重要动态,覆盖国内 7 条 + 国际 7 条,带你快速掌握行业脉搏。
国内动态
1. Kimi K3 开源发布即爆火,算力告急暂停 C 端新用户订阅
月之暗面 7 月 18 日正式上线 Kimi K3——全球首个 2.8 万亿参数 开源大模型,原生支持视觉理解与 100 万 token 上下文窗口。K3 在 Frontend Code Arena 以 1679 分力压 Claude Fable 5 登顶,并在 SWE-Bench 等多维评测中逼近前沿闭源模型。然而发布仅一天,GPU 算力即被击穿:OpenRouter 上日处理约 140B token,吞吐量从 30 tok/s 降至 13 tok/s,端到端延迟达 72 秒。7 月 20 日起暂停 C 端新用户订阅,未来将拆分为 Kimi Membership 和 Kimi Code Membership 两个独立计划。
值得关注:这是继 DeepSeek 之后,中国开源模型第二次因"需求远超供给"而暂停服务。Kimi K3 不仅验证了超大参数开源模型的市场号召力,更暴露出算力基础设施的瓶颈——服务量化版 K3 需至少 8 块 B300(约 50 万美元)。与此同时,Kimi 已通知投资者启动港股 IPO 筹备,最快 6 个月内完成。从"开源天花板"到"算力困局"再到"资本故事",Kimi K3 的每一步都在重新定义中国 AI 的天花板。
2. 阿里通义千问 Qwen 3.8 发布:2.4T 参数逼近前沿,开源阵营再加码
阿里通义千问团队发布 Qwen 3.8,参数规模达 2.4 万亿,在多项基准评测中性能仅次于 Claude Fable 5 等顶级闭源模型。Qwen3.8-Max-Preview 已同步上线阿里 Token Plan、Qoder 及 QoderWork 平台,开发者可即时调用。
值得关注:Qwen 3.8 的发布让中国开源阵营在短短一周内连下两城——继 Kimi K3 后,阿里用 2.4T 参数进一步拉近与 OpenAI、Anthropic 旗舰模型的距离。开源模型正在从"追赶者"变成"定义者",中美在 AI 开源生态上的攻守棋局已经发生实质性翻转。
3. WAIC 2026:商汤发布 SenseNova U1 Pro 多模态智能体
7 月 18 日 WAIC 期间,商汤科技发布旗舰多模态基座 SenseNova U1 Pro。基于 NEOunify 内核实现语言与视觉统一表征,原生支持 8K 超清输出,具备长程任务闭环能力,能自主完成从理解到执行的完整链路——可有效解决 AI 生图"反复抽卡"的痛点。预览版已开启邀请测试,8 月正式上线并开放 API。
值得关注:今年 WAIC 的主题已经从"拼参数"转向"拼应用"。商汤 U1 Pro 首次在底层架构上统一语言与视觉表征,不再走"缝合"路线。这标志着中国 AI 公司正从"多模态适配"走向"多模态原生",底层架构创新成为新的竞争高地。
4. DeepSeek 首轮融资后估值突破 3250 亿元
开润股份、汤臣倍健近日在投资公告中披露,通过产业基金间接持有 DeepSeek 股权,据此推算其最新投后估值达 3250–3508 亿元。创始人梁文锋出资 200 亿为最大投资方,腾讯、宁德时代、国家人工智能产业基金等均参与本轮融资。目前 DeepSeek 已启动大规模技术招聘。
值得关注:DeepSeek 的估值已接近 OpenAI 非公开市场估值的同一量级,意味着中国的 AGI 赛道在资本层面也完成了"平起平坐"。3500 亿估值背后,是国家队、产业资本和互联网巨头的三方合力——中国 AI 融资生态已从 VC 驱动进入"国家+产业"双引擎时代。
5. 阿里云灵骏真武 M890 超节点实例发布
阿里云在 WAIC 上推出 灵骏真武 M890 超节点实例,支持 FP8/FP4 低精度计算,64 卡互联带宽达 800GB/s,训练性能较上一代提升 3 倍,单台即可承载十万亿参数级 MoE 大模型推理。目前已在内蒙古乌兰察布区域开放邀测。
值得关注:当 Kimi K3 因算力不足暂停新订阅,阿里云恰好亮出可承载十万亿参数推理的 M890。国产算力正在从"能用"跨越到"让前沿模型跑得动"的临界点。推理芯片市场的供需错配将催生新一波国产 GPU 订单潮。
6. 京东 JoyAI 模型矩阵亮相 WAIC,打造全球最大物理世界运营中心
京东在 WAIC 系统展示面向物理世界的 JoyAI 模型矩阵,开源行业最大人类视角数据集 EgoLive,打造首个 JoyInside "AI Home"。依托 60 万人采集的 1000 万小时真实数据,京东正在建设全球最大物理世界运营中心。
值得关注:京东的 AI 路线与大模型玩家截然不同——不是去卷参数,而是卷"真实物理世界的感知数据"。1000 万小时的物理世界数据,让京东在具身智能、供应链 AI 等场景拥有了不可替代的"数据壕沟"。
7. 网易有道 OpenPods 开放式 AI 耳机亮相 WAIC
网易有道在 WAIC 推出国内首款苹果 MFi 认证的开放式 AI 耳机 OpenPods,支持十余种语言实时同传、98% 准确率录音转写、结构化纪要自动生成,耳机盒可独立作为翻译终端使用。单耳仅重 7g,综合续航 24 小时,预计 8 月正式发布并同步出海。
值得关注:AI 硬件正在从"手机上的 App"走向"独立终端"。OpenPods 的 MFi 认证意味着其在苹果生态中有官方身份,而"耳机盒 = 独立翻译器"的设计将翻译场景从"掏出手机"降维到"随时可用"。AI 硬件不会取代手机,但会吃掉越来越多"非屏幕交互"的使用时长。
国际动态
8. 苹果正式起诉 OpenAI 窃取商业机密,点名硬件主管 Tang Tan
苹果于 7 月 18 日正式对 OpenAI 提起诉讼,指控其系统性诱导前苹果员工泄露商业机密,特别点名硬件工程主管 Tang Tan。苹果主张 OpenAI 以"挖角+套取"方式获取了大量涉及硬件设计、供应链和制造工艺的专有信息。若法院采取禁令救济,可能直接延迟 OpenAI 的自研硬件产品路线图,并给其 IPO 定价带来重大不确定性。
值得关注:这不是两家公司之间的普通人才纠纷——这是全球市值最高的消费电子公司对全球估值最高的 AI 公司开出的"第一枪"。如果禁令落地,OpenAI 的硬件计划(从 AI 眼镜到 AI Phone)将被实质性冻结。苹果与 OpenAI 从"暧昧合作"到"对簿公堂",硅谷 AI 时代最重量级的商战才刚刚揭开序幕。
9. Grok 4.5 登顶 VulcanBench 编程基准,网站访问量突破 15 亿次
xAI 的 Grok 4.5 在 VulcanBench 新编程基准上得分 91.3%,解决 5 种语言 23 个真实世界软件任务中的 21 个,击败 Claude Fable 5 和 GPT-5.6 Sol,同时占据成本效率前沿。马斯克同时透露,Grok 4.6(2 万亿参数)预计下周完成初始训练。此外,Grok 网站 2026 上半年访问量突破 15 亿次。
值得关注:马斯克正在用速度碾压一切——Grok 4.5 刚登顶编程榜,4.6 就要来了。xAI 的"训练-发布-再训练"飞轮转速已经是业界最快,且 4.6 直接对标 Kimi K3 的 2.8 万亿参数。中美 AI 在编程 Agent 赛道的正面交锋已经开始,且战场从模型能力延伸到了"真实软件工程任务完成率"这一更有说服力的指标。
10. GPT-5.6 Sol 解决 30 年未解数学难题,Greg Brockman 称"分水岭时刻"
一位研究者使用 OpenAI 的 GPT-5.6 Sol Pro 成功解决了凸优化领域一个困扰数学家 30 年的开放问题。模型在约 148 分钟连续推理中生成了完整证明。虽然该研究者在此之前已用 GPT-5.4 和 GPT-5.5 积累了一年的先期工作,但最终突破来自 Sol Pro 的推演能力。Greg Brockman 称这是"数学进步的分水岭时刻",并表示科学和医学的突破"感觉非常接近了"。
值得关注:GPT-5.6 在数学证明领域的表现正在模糊"AI 辅助"与"AI 原创"的边界。148 分钟解决 30 年未解问题,即便有人类的前期积累,其意义也不亚于 AlphaFold 对蛋白质结构预测的冲击。如果 AI 能在数学证明这种最"纯智力"的领域持续突破,对物理、化学、生物学的基础研究将产生链式反应。
11. Anthropic 将 Claude Code 系统提示词削减 80%,模型越聪明越不需要约束
Anthropic 近日将 Claude Code 的 system prompt CLAUDE.md 从 12.8MB 削减至 2.1MB,占用上下文窗口的比例从 95% 降至 18%。瘦身后的 Claude Code 专注度与结果反而更优。Anthropic 的研究表明:模型越聪明,越不需要大量示例和显式约束,反而能从精简指令中更好地理解和执行任务。
值得关注:这是一项反直觉但极有价值的工程发现。"少即是多"不仅适用于提示词工程,更暗示着模型智能本身的质变——当模型推理能力足够强时,大量规则性约束不仅冗余,还可能干扰发挥。这对所有 LLM 应用开发者都是一个信号:是时候重新审视你的提示词到底有多臃肿了。
12. 黄仁勋访日:Nvidia 联手日本打造物理 AI 时代
Nvidia CEO 黄仁勋访日期间宣布为日本建设 Vera Rubin AI 工厂,配备 13,750 颗 Vera CPU 和 27,500 颗 Rubin GPU,预计 2028 年投运;同时成立 Cosmos 机器人联盟,推动物理 AI 在日本制造业、物流和养老护理领域的落地。
值得关注:继在美国本土和欧洲布局之后,Nvidia 将"主权 AI"战略推向日本。日本在机器人硬件和精密制造方面的优势与 Nvidia 的 AI 计算能力结合,可能催生出"物理 AI"时代第一波真正落地的工业级应用。这笔"AI 基建外交"对台积电日本工厂同样有联动效应。
13. 研究警示:AI 建议使准确率降至 1/3,自信度却翻倍
法国、意大利三所大学联合研究发现,人类在获取 AI 建议后,准确率从 27% 骤降至 9%,而自信度却从 30% 飙升至 76%。即便引入金钱激励,准确率也仅回升至 16%。研究揭示了"AI 过度信任"(over-reliance)现象的严重性:人们不假思索地接受 AI 输出,即便它显然是错误的。
值得关注:这可能是 2026 年迄今最重要的 AI 人因研究之一。它不仅质疑了"AI 增强人类判断"的核心叙事,更提示了一个隐秘风险——AI 越是流畅自信,人类的批判性思维退化就越严重。在医疗、法律、金融等高风险决策场景,这一点必须被纳入系统性护栏设计。
14. AI 成本下降反推 GPU 需求增长,Jevons 悖论正在上演
随着 AI token 成本持续下降,行业观察者和分析师发现一个反直觉的趋势:成本越低,GPU 需求越大。原因是成本下降大大扩展了 AI 使用场景——更多企业开始用 AI 替代传统搜索、客服、代码生成等任务,推理需求总量不降反升。这正是经济学中经典的 Jevons 悖论(效率提升 → 消耗增加)在 AI 时代的完美演绎。
值得关注:对于 Nvidia 等 GPU 厂商来说,AI 降本不是利空而是长期利好。对于企业和开发者,这意味着 AI 的 TCO(总拥有成本)不是在降低而是在"迁移"——从模型调用费变成基础设施费。理解这一趋势,才能真正判断 AI 产业链各环节的价值重分配方向。
以上就是本期 AI 速递的全部内容。如果你觉得有帮助,欢迎点赞、在看、转发。我们明天见。
夜雨聆风