6月1号晚上,我在GTC Taipei的直播画面里,看着黄仁勋按下了一个按钮。
身后的大屏幕上,一个机器人走进仓库,绕过地面上的水渍,准确地抓起了货架上那个红色箱子。
黄仁勋说:"这不是游戏,不是电影。这是一个机器人,在完全由模拟训练的环境中,在真实世界里行动。"
然后画面切换——那个仓库,不是Unity做的,不是Unreal Engine做的,是一个叫Cosmos 3的模型,用一段文字描述生成的。
我坐在屏幕前,沉默了。
干了二十年测绘,从倾斜摄影到激光雷达,从Mesh建模到语义分割,我们花无数个小时、无数台设备,才建出一个城市的三维模型。而现在,一个开源AI模型,用几秒钟,生成了一个物理一致的虚拟世界。
我们的"实景三维",是不是该换赛道了?
一、传统实景三维:3-6个月,几百万投入
先回忆一下,做一个地级市的实景三维项目有多难:
外业数据采集(2-4周)
飞无人机、架激光雷达、拍倾斜摄影。一个地级市1000平方公里,一架无人机一天飞20平方公里,光采集就要飞50天。天气、空域、飞行高度、重叠度——每个参数都要人工控制。
点云处理(2-3周)
去噪、滤波、分类、配准。百万级点云数据需要高性能工作站——一台机器一天处理5平方公里,1000平方公里要200天。所以得上集群,10台机器并行,20天搞定。
Mesh建模(1-2周)
点云转三角网,生成纹理,优化拓扑。一个中等城市的数据量轻松上TB。
语义标注(2-4周)
给每个物体打标签:这是建筑,那是道路,这是树木。以前靠人工,现在AI辅助,但准确率永远到不了100%。
平台发布(1-2周)
切片、索引、发布服务。TB级数据发布成Web服务,需要专门的服务器和CDN。
总计:3-6个月,一个团队全职,成本数百万。
二、Cosmos 3是什么?不只是一个"视频生成模型"
Cosmos 3和Sora、Luma这些视频生成模型的本质区别在于:它的目标不是"好看",而是"真实"。
维度 | Sora/Luma | Cosmos 3 |
目标 | 内容创作 | 物理仿真训练 |
输出 | 视频 | 视频+动作数据(关节角度、轨迹) |
物理一致性 | 追求"好看" | 追求"真实"(碰撞、重力、摩擦) |
开源 | 封闭API | 全开源 |
Cosmos 3采用了双塔架构:一个"推理塔"理解物体交互和时空关系,一个"生成塔"生成视频和动作轨迹。它输出的不只是画面,还有物体的运动轨迹、关节角度——它理解这个世界是怎么动的。
三个规格:
规格 | 参数 | 目标硬件 | 适用场景 |
Super | 64B | 数据中心GPU | 大规模合成数据生成 |
Nano | 16B | 工作站GPU | 实时机器人推理 |
Edge | 4B | 边缘设备 | 设备端实时推理 |
全部开源,许可证是OpenMDW 1.1。
三、对测绘人意味着什么?
做GIS的看到这个,第一反应应该是:我们的数据训练方式要被重构了。
冲击一:合成数据替代外业采集
传统实景三维的外业采集受天气、空域、时间限制。Cosmos 3可以用文本描述生成物理一致的三维场景——从仓库到城市街道,从晴天到暴雨。
虽然现在还做不到"替代真实三维模型",但作为训练数据的补充,已经非常实用。你用少量真实数据采集+大量合成数据填充,训练效率提升一个量级。
冲击二:标注工作大幅缩减
语义标注占了实景三维项目18%的时间。Cosmos 3生成的场景自带标注信息——因为它"知道"画面里每个物体是什么。这意味着你可以用生成数据训练AI模型,再做迁移学习应用到真实场景。
冲击三:极端场景不再"没法采集"
地质灾害场景、洪水淹没模拟、火灾现场——这些场景真实采集几乎不可能。Cosmos 3可以生成物理一致的极端场景,让AI模型在安全环境里预先训练。
四、老登的判断
Cosmos 3不会"取代"实景三维。但它会重新定义"实景三维"能干什么。
现在的实景三维,核心价值是"看得见、量得准"。未来的实景三维,核心价值应该是"可理解、可交互、可预测"。
拿一个具体的例子:自然资源部的"国土空间规划实施监测网络(CSPON)"。传统的做法是用卫星遥感+实景三维做变化监测。如果引入Cosmos 3的范式,能不能用生成数据做"规划实施预演"——建一个片区前,先在虚拟环境里模拟它对周边生态、交通、景观的影响?
这才是"数字孪生"的真正价值——不是复制现实,而是预见未来。
Cosmos 3全开源,下载就能跑。干的二十年的老测绘,学一个新工具的时间,总比花3-6个月做外业采集快。
一个看完GTC Taipei直播、对着Cosmos 3发呆半小时的老登说:不是我们的实景三维不牛逼了,是"真实"这个词的定义,正在被AI改写。
夜雨聆风