DAWEN'S AI STATION
AI 学会自己造软件,视频模型开源打擂,机器人大脑融资忙
大叔AI情报站 · 学习笔记 · 2026-08-05
本文为个人学习观察笔记,非新闻报道,不构成互联网新闻信息采编发布。所述内容均据公开报道整理,文中涉及的评测分数、市值、募资金额、涨幅等具体数字未经独立核实,仅供参考,不代表任何投资建议。
贾扬清新公司 Intent Lab 发布 Fleet,AI 从"写代码"走到"做软件"
当 Caffe/PyTorch 的奠基人开始用 Agent 造基础软件
▎话题背景
据创业邦、机器之心等综合公开报道(8月3日),Caffe 和 PyTorch 1.0 的缔造者贾扬清在离开英伟达一个月后,正式创立新公司 Intent Lab(意图实验室),并发布首款产品 Fleet——一支由 AI Agent 组成的自主工程团队。官方定位很简洁:"把'你的意图',打造成'生产级系统'"。Fleet 将软件开发拆解为理解、设计、协调、构建、验证、演进六个环节,全链路自主接管,覆盖从架构设计到持续运维的完整生命周期。为证明通用能力,Intent Lab 公开了三份成果:① 将 GLM-5.2 在 TensorRT-LLM 上的推理性能据称提升 534%(吞吐从 102 token/秒拉到 647 token/秒);② 从一条模糊需求出发,用约 350 美元成本构建了一个通过全部 600 万项 SQLite 兼容性测试的数据库引擎;③ 开发了经形式化验证的分布式文件系统 AgentFS,部分性能据称达到 EFS 的 626 倍。三者背后是同一套 Fleet 引擎,而非三个专用工具。
信息来源:创业邦(2026-08-03);机器之心(2026-08-03);Intent Lab 官网公开信息
▎个人观察与分析
Intent Lab 做的事,本质上是在回答一个问题:当 AI 已经能写好代码,为什么还不能独立交付一个可用的软件系统?贾扬清的答案是——还差"系统交付"这一步。过去两年的 AI 编程助手解决的是"写代码"的问题,Fleet 要解决的是"做软件"的问题,两者之间的差距,相当于一把锤子和一栋房子的距离。
三份成果的选品很聪明:推理引擎优化证明 Agent 能啃硬骨头(在英伟达自家压箱底的优化基础上还能提速 5 倍),数据库创建证明它能量产成果(8720 万 token 成本约 350 美元,这放在人类工程师团队是不可能的开销),形式化验证的文件系统证明可靠性不是口号。这三点恰好回应了企业对 Agent 最大的质疑:"它写出来的东西能用在生产环境吗?"
我的判断是:Intent Lab 的竞争壁垒不在于单点技术,而在于贾扬清本人——十年间从 Caffe 到 PyTorch 到阿里云到英伟达,他经历了 AI 框架的每一代范式变迁。现在他赌的是"AI 造软件"这个方向,这比做又一个 AI 编程助手要有想象力得多。但挑战也很现实:Fleet 目前还处于早期,三份成果是精心挑选的 demo,离真正的"通用工程团队"还有距离。如果未来三个月能看到更多未经挑选的案例,"AI 造软件"的叙事才真正成立。
MiniMax H3 正式开源,欧盟 AI 透明度法案同日生效
视频模型有了开源旗舰,AI 监管也正式上路
▎话题背景
据中国经营报(8月4日)及 MiniMax 官方信息(8月3日),MiniMax 正式开源新一代通用视频模型 H3。该系统由 Context-IR、Base、Regenerate-2K 三个模块组成,能统一理解文本、图像、视频、音频等多模态上下文,生成最高 2K 分辨率、最长 15 秒、带原生立体声音频的视频。据 Artificial Analysis 榜单,H3 视频编辑能力排名全球第一。华为昇腾、摩尔线程、AMD、Intel 等据称 16 家芯片厂商及 Hugging Face、ComfyUI 等社区在开源同日完成适配。与此同时,据新华社(7月31日)及国际金融报(8月3日)报道,欧盟《人工智能法案》透明度规则于 8 月 2 日正式生效,要求聊天机器人须告知用户正在与 AI 交互、AI 生成的图片/音频/视频/文本须带有机器可读标识和明确标注,通用 AI 模型提供商须公开训练数据中的版权内容信息。
信息来源:中国经营报(2026-08-04);MiniMax 官方(2026-08-03);新华社(2026-07-31);国际金融报(2026-08-03)
▎个人观察与分析
H3 是视频模型赛道第一个真正意义上的"开源旗舰"。过去一年,Seedance 等头部产品一直走闭源路线,开发者只能通过 API 付费使用,无法微调、无法私有化部署。H3 的开源决策打破了这种格局——就像今年初 DeepSeek 在语言模型上的开源冲击,视频模型可能正在经历自己的"DeepSeek 时刻"。16 家芯片厂商同日适配的速度也说明,开源生态的动员能力远强于闭源。
但要注意的是,H3 开源的只是 Base 模型,Context-IR 预处理模块和 Regenerate-2K 高分辨率模块并未开源。这意味着开发者能拿到"发动机",但拿不到完整的"调校系统"——如果你想要最佳画质,还是要走 MiniMax 的 API。这是一种"半开源"策略:用开源吸引生态,用闭源模块和云服务变现。
欧盟 AI 法案的生效则是另一个维度的变数。对于计划出海的 AI 应用和模型厂商来说,2K 分辨率、15 秒视频这些能力,意味着你的产品几乎一定会触及内容标识、版权披露等合规要求。未来几个月,"合规"会从可选项变成必选项——这不是坏事,透明化本身有助于建立用户信任,但合规成本也会成为新的竞争门槛。
帕西尼再融 10 亿,破壳/求之同日破亿,资本涌向机器人"大脑"
当"大脑派"融资占比超过一半,具身智能的竞争逻辑彻底变了
▎话题背景
据21世纪经济报道(8月4日)及证券时报(8月4日)综合报道,具身智能赛道融资持续升温。帕西尼(PaXini)于近日完成 10 亿元战略轮融资,由一家全球消费电子与半导体万亿级巨头、中银国际投资、鲲鹏基金等联合领投,累计融资据称已达 35 亿元,其自研触觉芯片近一年出货量据称接近 100 万颗。同日,清华系公司破壳机器人宣布完成亿美元级 Pre-A 轮融资(顺为/经纬领投),求之科技宣布完成 1 亿美元天使轮融资(IDG/星连等参投)。据行业统计数据,2026 年上半年国内具身智能赛道融资总额约 438 亿元,其中"大脑派"公司吸纳据称约 222.53 亿元,占比高达 50.8%,而"本体派"同期占比仅 12.8%。
信息来源:21世纪经济报道(2026-08-04);证券时报(2026-08-04);晚点LatePost(2026-08-03)
▎个人观察与分析
50.8% vs 12.8%——这个数字差距说明了具身智能赛道正在发生一场结构性转向。资本不再追捧那些能把机器人做得会翻跟头、会后空翻的公司(这些已经是成熟工程能力),而是把钱砸向了让机器人"理解该干什么"的大脑层。过去半年我们反复说"具身智能的核心壁垒不在身体而在大脑",现在这句话正在被融资数据验证。
帕西尼的路线值得单独拿出来说:它不造机器人本体,而是做触觉传感器和物理交互数据基础设施——让其他做机器人的公司不用从零搭建感知链路。这本质上是一个"卖铲子"的商业模式。当淘金热来临时,卖铲子的人往往比淘金者先赚到钱。100 万颗触觉芯片的出货量说明市场对感知层的需求是真实的。
我的判断是:融资热本身也带来了估值泡沫的风险。上半年 438 亿元的融资总额,在机器人产品大规模商业化之前,已经让部分项目的估值脱离了基本面。但反过来看,泡沫本身是行业从实验室走向产业化的必经阶段——关键是谁能在这轮融资窗口里把技术优势转化为场景壁垒。破壳机器人选择从家庭场景切入(而非拥挤的工业赛道),这个定位差异化是加分项,但家用机器人的落地周期会更长。
马斯克宣布 SpaceX 太空 AI 数据中心独家采用英伟达 GPU
当算力竞赛从地面打到轨道,Vera Rubin 成为太空级算力标配
▎话题背景
据cnBeta综合公开报道(8月5日),SpaceX 创始人马斯克在最新财报电话会议及社交平台确认,公司已正式决定独家采用英伟达 GPU 满足全部 AI 计算需求。根据规划,SpaceX 的 AI 数据中心将全面引入英伟达最新的 Vera Rubin NVL72 机架(代号 Kyber),涵盖全球地面数据中心及地球轨道空间。首批含 2GW 计算能力的设备据称将于今年年底前安装完毕,到 2027 年底算力规模预计达到 10GW。英伟达此前已推出通过航天认证的 Space-1 Vera Rubin 航天模块,集成 4 颗 Rubin GPU 与 2 颗 Vera CPU,轨道 AI 计算能力据称达到此前 H100 GPU 的 25 倍。Aetherflux、Axiom Space、Planet Labs 等航天企业也已计划采用该方案。
信息来源:cnBeta(2026-08-05);SpaceX 官方/马斯克 X 平台(2026-08-04)
▎个人观察与分析
把数据中心送到太空,这听起来像科幻片,但背后的逻辑很务实:地面数据中心正面临电力、土地、冷却三重瓶颈。美国一些地区的数据中心用电已接近当地电网容量上限,而太空有无限的太阳能和天然的真空散热环境。SpaceX 有自己的猎鹰和星舰,运输成本对别人是天价,对它只是边际成本——这是只有 SpaceX 能玩的游戏。
10GW 是什么概念?作为对比,前几天我们刚讨论过 DeepSeek 在乌兰察布规划 1GW 的国产智算中心——SpaceX 规划的是这个规模的 10 倍。当然,地面 1GW 和太空 10GW 的落地难度不在一个量级,SpaceX 的 2027 年目标大概率会延期。但方向本身是重要的:太空算力不再只是 Demo,而是进入了商业部署的路线图。
对英伟达来说,这单生意有多层意义:① Vera Rubin 平台拿到了第一个旗舰级太空客户背书;② 航天认证的 Space-1 模块为后续向其他航天企业销售打开了通道;③ 当竞争对手在追赶地面 GPU 时,英伟达已经开始定义"太空级 GPU"这个新品类了。马斯克说英伟达是"最好的",不是客套——目前确实没有第二家能把 GPU 送上轨道。
Hermes Agent 发布 v0.20.0,Agent 之间终于能"互相聊天"了
A2A 协议落地,MCP 懒加载上线——Agent 生态正在从单体走向协作网络
▎话题背景
据GitHub/NousResearch 官方发布(8月3日),开源 Agent 框架 Hermes Agent 发布 v0.20.0 大版本。其中最引人注目的是A2A v1.0(Agent-to-Agent)协议插件正式落地——这使得不同 Hermes Agent 实例之间可以直接通信、任务委派和结果汇总,Agent 从单打独斗走向协作网络。此外,本次更新还包括:MCP 服务器支持懒加载(从指纹键控的磁盘工具模式缓存启动,不再在会话开始时全部启动,设计参考 #56832 提案),Skills 生态大幅完善(Office 技能内置、grounded-citations 技能新增事实核查模式、curator 可管理未注册技能),以及 Node 26 强制运行环境、Windows 编码兼容性修复等一系列工程化改进。启动时间从约 14 秒优化到约 1.8 秒。
信息来源:GitHub/NousResearch Hermes Agent Release(2026-08-03)
▎个人观察与分析
A2A 协议的意义不在于技术难度,在于它定义了一种 Agent 之间的"社交规范"。过去每个 Agent 在自己的沙箱里干活,做完把结果扔回给人类。但真实的工作场景不是这样的:你做市场调研、我做竞品分析、他写报告,三个人要中途对齐、交换信息、互相补充。Agent 也一样。当一个 Agent 发现自己需要另一个 Agent 的领域知识时,A2A 让它不必退回给人类再转发,可以直接找"同事"帮忙。
MCP 懒加载则是另一个看似小但影响面大的改进。如果每次启动 Agent 都要等所有 MCP 服务器起来,用户体验会非常差——就像打开手机等所有 App 自动启动一样。懒加载 + 指纹缓存的方案让 Agent 的启动时间从 14 秒降到 1.8 秒,这对需要频繁启动 Agent 的开发场景来说几乎是"可用"与"不可用"的差别。
我的判断是:Hermes Agent 正在从"大而全的实验品"变成"可以上生产的工具"。A2A、MCP 懒加载、Skills 管理、性能优化——这些不是炫技,是工程化。当一个开源 Agent 框架开始认真考虑启动时间、编码兼容性、事实核查模式这些细节时,说明它已经过了"能跑就行"的阶段,开始考虑"怎么让真实用户不骂人"。这是成熟的标志。
特斯拉中国接入豆包/千问,端侧 AI 抢滩车机大屏
大模型"上车"进入实战,车机正在成为最重要的端侧 AI 入口
▎话题背景
据科创板日报(8月5日)报道,特斯拉中国在部分新交付车型的车机系统中上线了基于豆包大模型的智能语音助手,同时多位知情人士透露千问已进入特斯拉中国车机的深度测试阶段。这标志着国产大模型开始进入全球最大新能源车企的终端设备。与此同时,据 IDC 数据,2026 年中国 AI 手机出货量据称将达 1.47 亿台,同比增长 31.6%,在整体市场中占比突破 53%;全球端侧 AI 市场规模据行业研报预测突破 8000 亿元。在芯片层面,晶心科技于近日发布新一代边缘 AI 方案 AnDLA I370 v2.0,支持 ViT、VLM 与 SLM 推理,MAC 阵列可扩展至 2048 个,原生支持 Transformer 网络在边缘端部署。
信息来源:科创板日报(2026-08-05);IDC 公开数据(2026年)
▎个人观察与分析
特斯拉选择豆包和千问,这件事的信号意义远大于技术意义。作为全球最"封闭"的车企之一,特斯拉在中国市场没有用自家的 xAI Grok 或 OpenAI,而是选择了中国本土的大模型——这种选择背后是数据合规、本地化体验和响应速度的综合考量。对豆包和千问来说,进入特斯拉车机等于拿到了一张"端侧大模型已验证"的商业背书,后续进入其他车企的谈判会顺畅很多。
车机成为端侧 AI 入口的逻辑很清晰:① 用户在车内是高度专注的"被动时间",语音交互是刚需;② 车机大屏和算力平台提供了比手机更沉浸的交互空间;③ 导航、娱乐、车辆控制等高频场景与 AI 的自然结合点非常多。可以预见,车机将是继手机之后端侧 AI 的第二战场。
晶心科技的新一代边缘方案则从芯片层面补上了一块拼图:Transformer 网络能在边缘端跑,意味着视觉理解大模型(VLM)和语言模型(SLM)不再依赖云端——这对自动驾驶、工业视觉等实时场景至关重要。我的判断是:2026 下半年到 2027 上半年,端侧 AI 会从"概念验证"进入"规模化部署"阶段。能同时搞定芯片架构、算法压缩和应用场景的公司,最有机会吃到这波红利。
▎ 造软件 · 开源 · 监管
Intent Lab Fleet 把 AI 编程从"写代码"推到"做系统",Caffe/PyTorch 的奠基人亲自下场赌"AI 造软件"这个方向;MiniMax H3 开源让视频模型赛道第一次有了非闭源的旗舰选项,"半开源"的商业模式也开始成型;欧盟 AI 法案同日生效,提醒我们技术跑得再快,合规永远是商业化的前提。
▎ 机器人 · 太空算力 · 端侧上车
三家机器人公司在同一天拿到大额融资,"大脑派"融资占比首次突破 50%——具身智能的竞争焦点已经从"会动"转向"会想";马斯克让 SpaceX 独家绑定英伟达,算力竞赛的维度从"建多少个数据中心"变成了"建在哪里的数据中心";特斯拉接入豆包和千问,端侧 AI 从概念到量产只差一步,车机正在成为手机之外最重要的 AI 入口。
▎ Agent 生态从单体走向网络
Hermes Agent v0.20.0 的 A2A 协议和 MCP 懒加载,标志着 Agent 工具链从"能跑"走向"好用"。当 Agent 之间能互相通信、Skills 生态走向工程化、启动时间从 14 秒降到 1.8 秒——这些看似微小的改进,叠加起来就是"开发者会不会真的每天用它"的临界点。
▎免责声明
本文为个人学习观察笔记,非新闻报道,不代表任何机构观点,亦不构成互联网新闻信息采编发布服务。文中内容均据公开渠道报道整理,各话题已标注信息来源;但涉及的评测分数、市值、募资额、涨幅等具体数字未经独立核实,可能存在偏差,请读者自行判断。转载请尊重著作权,标注原始来源。
大叔AI情报站
个人学习观察笔记
关注 AI 的一切新鲜事
夜雨聆风