AI 圈今天很忙。
一边是 DeepSeek 把一个"小模型"调教到能打自家旗舰,一边是 Karpathy 花 10 美元让 AI 自己造了个 3D 世界。
另一边,具身智能赛道一天爆出两笔亿美元级融资,机器人开始真刀真枪进工厂、进便利店。
我们挑五件事来说。
DeepSeek V4 Flash:开源模型在 AI 编程上杀疯了
这事其实 7 月 31 号发的,但市场在 8 月 3 号才真正消化。
简单说:DeepSeek 对 V4 Flash(284B 参数,推理只激活 13B)做了一轮后训练,结果这个"小模型"在 Agent 基准上全面干掉了自家更大的 V4 Pro Preview。
Terminal Bench 2.1 从 56.9 跳到 82.7。DeepSWE 从 7.3 跳到 54.4。这跨度,不是"优化",是"换了个模型"。
更狠的是价格——每百万 Token 输入 0.14 美元,输出 0.28 美元,只有 Claude Opus 的 1/90。而且 MIT 协议开源,权重直接放在 Hugging Face。
这意味着什么?用 AI 写代码的门槛,已经从"付得起"变成了"根本不用想"。
过去你纠结用哪个模型性价比高,现在不用纠结了——直接 V4 Flash 跑 Agent,便宜到可以随便试。
Karpathy 的 10 美元实验:AI 能写代码,但"看不懂"自己写了什么
Andrej Karpathy 这周末干了件很有意思的事。
他把《指环王》第一段扔给 Claude Opus 5,给了约 10 美元的 Token 预算,让它用 Three.js 渲染成 3D 场景。
两个小时后,Opus 5 产出了 5500 行代码——一个能跑起来的 3D 中土世界。有山丘,有河流,有角色在移动。
效果很糙。Karpathy 自己说"janky but fun"。
但重点是:AI 第一次完成了从"理解文字"到"构建可交互 3D 世界"的完整链路。
以前做这种定制化 3D 内容需要一个团队干几周。现在 10 美元,两小时。
不过 Karpathy 也戳破了一件事——Opus 5 写到一半,只能靠截图来检查自己的渲染对不对。它没办法"看"自己的成果。生成了 5500 行代码,却不知道角色有没有穿模、镜头有没有被树挡住。
这就是当前 AI 编程的核心矛盾:生成能力已经跑到前面去了,验证能力还在起跑线上。
谁能解决"让 AI 自己审自己"这件事,谁就拿到了下一阶段的船票。
自变量机器人开源 HOST:看视频就能学会技能
今天具身智能这边也有大动作。
自变量机器人发布并开源了 HOST 框架——全称 Human-to-robot One-Shot Skill Acquisition。
翻译成人话:你拿手机拍一段自己干活的视频,机器人看一遍就能学会。
传统方法需要给机器人重新采集数据、标注动作、训练模型,部署一个新场景动辄几周。HOST 把这个流程缩短到"一段几十秒的视频"。
而且不丢老技能。学会了倒水不会忘记端盘子。
这件事的价值在于——具身智能最难的不是造机器人,是让机器人适应千变万化的真实场景。每个家庭布局不一样,每个工厂产线不一样。如果每次都要重新训练,规模化就是空中楼阁。HOST 的 One-Shot 思路,踩在了最痛的痛点上。
一天两笔融资,具身智能"操作派"正在崛起
8 月 3 号同一天:
求之科技拿了 1 亿美元天使+轮,IDG、星连、武岳峰等参投,正式跻身独角兽。
破壳机器人完成亿美元级 Pre-A,顺为和经纬领投,创始人许华哲是清华 TEA Lab 的创建者。
两家有一个共同点:都押注"操作"能力。
过去两年具身智能的主旋律是"会跑会跳"——双足行走、越障、后空翻。但今年风向明显变了。资本在追问同一个问题:它能干活吗?能拿杯子吗?能拧螺丝吗?能做一顿饭吗?
求之科技建了"模型—数据—仿真"全栈底座,破壳则一头扎进灵巧操作这个最难的方向。两笔钱砸下去,信号很明确:具身智能的下半场,拼的是手,不是腿。
银河通用:机器人已经真的在上班了
"迎宾小盖"在全家便利店上岗,会打招呼、会夸顾客裙子好看、会从货架取水递过来。
它的"同事" Galbot S1 在宁德时代产线搬了三个月的料箱,7×24 连续作业,全程零遥操、全自主运行。
这是全球首次人形机器人在新能源制造产线的常态化自主作业。
背后支撑这套系统的是银河通用自研的 WAM-TTT 技术——全球首个面向具身智能世界模型的测试时后训练框架。核心解决了一个行业最头疼的问题:机器人在实验室满分,一到真实场景就挂科。WAM-TTT 让机器人在部署后持续学习适应,不需要重新采集数据。
从 Demo 到 Product,银河通用先跨过去了。
写在最后
今天这五件事放在一起看,一条主线很清楚:
AI Coding 在往"几乎免费"的方向狂奔,但"写了什么不知道对不对"成了新瓶颈。具身智能在往"真能干活"的方向冲刺,资本、技术和场景验证正在形成闭环。
两边的共同命题是:生成已经不是问题了,验证和适应才是。
谁能先把"自审计"和"自适应"做好,谁就是下一个时代的答案。
你们觉得呢?欢迎留言聊聊。
夜雨聆风