ARTICLE · 1040381
3DGS模型几个GB,用户等下载就跑了?UMKC*高通:让3DGS像视频一样边下边看
你点开一个3DGS场景,屏幕上转了3分钟圈,进度条才走到20%。你算了一下,按这个速度还得等十几分钟,最后干脆关掉页面,不看了。
这不是你网速的问题,也不是服务器的问题。是3DGS从根上就不能流式传输。
视频能边下边看,是因为MPEG-DASH——先传低清版让你看着,边看边下载高清版。
所以你点开视频3秒就能播,画质慢慢变清楚。但3DGS不行,你必须把整个模型(几个GB)全部下载完,才能开始看。

UMKC和高通的团队说:3DGS也应该能边下边看。
这就是论文《SplatStream: Fine Granular Scalable Gaussian Splatting for Adaptive 3D Scene Streaming》:
把3DGS模型打包成MPEG-DASH兼容的流,边下边渲染。

图1:RGB-PSNR versus bpp——展示三个动态3DGS序列在不同码率下的PSNR变化。
为什么以前做不到
3DGS模型不能流式传输,有两个原因。
第一,它的数据结构是“一坨”。 几百万个高斯,每个高斯带位置、旋转、缩放、颜色、透明度。
你没法说“先传前10万个高斯让我看着”——因为高斯之间是有空间关系的,传了一半你根本不知道场景长什么样。
第二,帧间冗余被浪费了。 一个动态3DGS序列,连续两帧之间大部分高斯是一样的,只有少数在动。
以前的方法每一帧都全部重新传一遍,带宽浪费严重。
论文原文:连续帧之间共享相似的几何和外观,尽管存在运动、形变、可见性变化和拓扑变化,但帧间冗余并未被有效利用。
SplatStream干了什么:三层可扩展性
SplatStream的核心思路:把3DGS模型拆成可以分层传输的结构。 它做了三层可扩展性。
第一层:空间可扩展性(多分辨率)
SplatStream把3DGS场景表示成多分辨率的——低分辨率版高斯少,高分辨率版高斯多。
开始传输的时候,先传低分辨率版——场景大概长什么样,轮廓对不对。用户先能看到东西了。然后边看边传高分辨率版——越来越清楚。
论文原文说,SplatStream不训练三套独立的PLY模型,而是同一个高斯表示在540p、720p、1080p三个目标分辨率下渲染并监督。
这意味着用户不需要等完整模型,几秒钟就能看到场景轮廓。
这跟视频的“从360p到4K”是一个道理。

图2:SSIM versus bpp——展示三个动态3DGS序列在不同码率下的SSIM变化。
第二层:时间可扩展性(帧间预测)
SplatStream用一个轻量Transformer做帧间预测——预测下一帧的高斯应该是什么样。
实际传输的时候,只传“预测误差”(residual),不传完整帧。连续两帧之间的高斯变化不大,误差数据量很小,带宽就省下来了。
论文原文:SplatStream使用了基于InterGS-Lite的扩展框架,在KNN和bilateral预测器基础上增加了一个轻量transformer预测器。
对于每个目标高斯,编码器评估多个预测候选,选择预测误差最小的那个,只传输残差和预测器索引。
论文还引入了B层时间增强帧。以7帧GOP为例,基础时间层包含I₁、P₃、P₅、P₇,B层增强帧包含B₂、B₄、B₆。
客户端可以只解码基础层获得低帧率播放,也可以请求B层帧恢复全帧率。
这跟视频编码里的P帧/B帧是一个道理。

图3:LPIPS versus bpp——展示三个动态3DGS序列在不同码率下的LPIPS变化。
第三层:细粒度可扩展性(DASH兼容)
最关键的一层:SplatStream把所有这些分层打包成MPEG-DASH标准格式。
论文原文:SplatStream将可扩展的GS比特流映射到DASH-like结构,每个GOP被视为一个时间片段,空间层、时间层和细粒度质量层被暴露为可选的表示或子表示。
重要的是,高斯按体积-不透明度重要性分数排序,传输时先传重要的高斯。重要的细粒度优化单元以子表示形式暴露,允许客户端根据带宽请求10%、20%、30%、50%或100%的优化级别。
这意味着什么?意味着你不需要新的播放器,现有的视频流媒体服务器就能直接传3DGS。CDN厂商不需要改架构,直接把3DGS当成一种“特殊视频”来分发。
数据验证
论文在三个MPEG标准动态3DGS序列上做了实验:bartender_semitracked、cinema_semitracked、breakfast_semitracked。每个实验使用四帧GOP。
Table I展示了细粒度重要性排序的优化级别数据。

Table II展示了bartender_semitracked序列的带宽自适应操作点。

从Startup模式(13.80 MB,PSNR 30.45 dB)到High BW full FPS模式(38.82 MB,PSNR 32.34 dB),客户端可以根据带宽选择不同的操作点。
关键结论:在低传输比例下,SplatStream能提供渐进式渲染。
10%传输比例下PSNR已达22.86 dB,用户可以先看到场景轮廓,随着更多数据传输,画质逐步提升。
这对具身智能和机器人意味着什么?
SplatStream解决的是3DGS的分发问题,但它对机器人方向的人有直接启发。
第一,端侧存储压力减轻。 如果你把3DGS场景部署到机器人端,不需要在本地存几个GB的完整模型,只需要接收流式传输的低分辨率版,边运行边补全。
第二,远程操作实时渲染。 做VR/AR遥操作机器人的人,可以实时“走进”一个远程的3DGS场景,不需要提前下载整个模型。
操作员戴上头显,几秒就能看到远程环境的轮廓,然后边操作边变清楚。
第三,Sim2Real场景流式下发。 仿真环境不需要预装在本地,可以从云端流式传输到机器人上。换场景就像换电视频道一样快。
最后说一句
3DGS这个方向,从“能不能建”到“能不能实时渲染”,再到“能不能流式分发”,每一步都是在拆墙。
SplatStream拆的是分发这堵墙。当3DGS能像视频一样边下边看,它才真正具备了成为下一代互联网内容格式的资格。
从“下载一个模型”到“点开就看”,这一步拆掉的是3DGS大规模落地最硬的那堵墙。
你觉得3DGS流式传输,最先会在哪个场景落地?VR/AR、云游戏、还是机器人远程操作?留言区聊聊。
如果你身边有做3DGS或VR/AR的朋友,这篇可能帮他省下几个GB的下载时间。
想系统入门3DGS流式传输方向的同学,后台回复「流式传输」,将获得:SplatStream的核心方法和与MPEG-DASH的对应关系整理成了一份入门路线图。