夜雨聆风学习资料网

ARTICLE · 1040381

3DGS模型几个GB,用户等下载就跑了?UMKC*高通:让3DGS像视频一样边下边看

3DGS模型几个GB,用户等下载就跑了?UMKC*高通:让3DGS像视频一样边下边看

你点开一个3DGS场景,屏幕上转了3分钟圈,进度条才走到20%。你算了一下,按这个速度还得等十几分钟,最后干脆关掉页面,不看了。

这不是你网速的问题,也不是服务器的问题。是3DGS从根上就不能流式传输。

视频能边下边看,是因为MPEG-DASH——先传低清版让你看着,边看边下载高清版。

所以你点开视频3秒就能播,画质慢慢变清楚。但3DGS不行,你必须把整个模型(几个GB)全部下载完,才能开始看。

UMKC和高通的团队说:3DGS也应该能边下边看。

这就是论文《SplatStream: Fine Granular Scalable Gaussian Splatting for Adaptive 3D Scene Streaming》:

把3DGS模型打包成MPEG-DASH兼容的流,边下边渲染。

图1:RGB-PSNR versus bpp——展示三个动态3DGS序列在不同码率下的PSNR变化。

具身计算研习社

为什么以前做不到

3DGS模型不能流式传输,有两个原因。

第一,它的数据结构是“一”。 几百万个高斯,每个高斯带位置、旋转、缩放、颜色、透明度。

你没法说“先传前10万个高斯让我看着”——因为高斯之间是有空间关系的,传了一半你根本不知道场景长什么样。

第二,帧间冗余被浪费了。 一个动态3DGS序列,连续两帧之间大部分高斯是一样的,只有少数在动。

以前的方法每一帧都全部重新传一遍,带宽浪费严重。

论文原文:连续帧之间共享相似的几何和外观,尽管存在运动、形变、可见性变化和拓扑变化,但帧间冗余并未被有效利用。

具身计算研习社

SplatStream干了什么:三层可扩展性

SplatStream的核心思路:把3DGS模型拆成可以分层传输的结构。 它做了三层可扩展性。

第一层:空间可扩展性(多分辨率)

SplatStream把3DGS场景表示成多分辨率的——低分辨率版高斯少,高分辨率版高斯多。

开始传输的时候,先传低分辨率版——场景大概长什么样,轮廓对不对。用户先能看到东西了。然后边看边传高分辨率版——越来越清楚。

论文原文说,SplatStream不训练三套独立的PLY模型,而是同一个高斯表示在540p、720p、1080p三个目标分辨率下渲染并监督。

这意味着用户不需要等完整模型,几秒钟就能看到场景轮廓。

这跟视频的“从360p到4K”是一个道理。

图2:SSIM versus bpp——展示三个动态3DGS序列在不同码率下的SSIM变化。

第二层:时间可扩展性(帧间预测)

SplatStream用一个轻量Transformer做帧间预测——预测下一帧的高斯应该是什么样。

实际传输的时候,只传“预测误差”(residual),不传完整帧。连续两帧之间的高斯变化不大,误差数据量很小,带宽就省下来了。

论文原文:SplatStream使用了基于InterGS-Lite的扩展框架,在KNN和bilateral预测器基础上增加了一个轻量transformer预测器。

对于每个目标高斯,编码器评估多个预测候选,选择预测误差最小的那个,只传输残差和预测器索引。

论文还引入了B层时间增强帧。以7帧GOP为例,基础时间层包含I₁、P₃、P₅、P₇,B层增强帧包含B₂、B₄、B₆。

客户端可以只解码基础层获得低帧率播放,也可以请求B层帧恢复全帧率。

这跟视频编码里的P帧/B帧是一个道理。

图3:LPIPS versus bpp——展示三个动态3DGS序列在不同码率下的LPIPS变化。

第三层:细粒度可扩展性(DASH兼容)

最关键的一层:SplatStream把所有这些分层打包成MPEG-DASH标准格式。

论文原文:SplatStream将可扩展的GS比特流映射到DASH-like结构,每个GOP被视为一个时间片段,空间层、时间层和细粒度质量层被暴露为可选的表示或子表示。

重要的是,高斯按体积-不透明度重要性分数排序,传输时先传重要的高斯。重要的细粒度优化单元以子表示形式暴露,允许客户端根据带宽请求10%、20%、30%、50%或100%的优化级别。

这意味着什么?意味着你不需要新的播放器,现有的视频流媒体服务器就能直接传3DGS。CDN厂商不需要改架构,直接把3DGS当成一种“特殊视频”来分发。

具身计算研习社

数据验证

论文在三个MPEG标准动态3DGS序列上做了实验:bartender_semitracked、cinema_semitracked、breakfast_semitracked。每个实验使用四帧GOP。

Table I展示了细粒度重要性排序的优化级别数据。

Table II展示了bartender_semitracked序列的带宽自适应操作点。

从Startup模式(13.80 MB,PSNR 30.45 dB)到High BW full FPS模式(38.82 MB,PSNR 32.34 dB),客户端可以根据带宽选择不同的操作点。

关键结论:在低传输比例下,SplatStream能提供渐进式渲染。 

10%传输比例下PSNR已达22.86 dB,用户可以先看到场景轮廓,随着更多数据传输,画质逐步提升。

具身计算研习社

这对具身智能和机器人意味着什么?

SplatStream解决的是3DGS的分发问题,但它对机器人方向的人有直接启发。

第一,端侧存储压力减轻。 如果你把3DGS场景部署到机器人端,不需要在本地存几个GB的完整模型,只需要接收流式传输的低分辨率版,边运行边补全。

第二,远程操作实时渲染。 做VR/AR遥操作机器人的人,可以实时“走进”一个远程的3DGS场景,不需要提前下载整个模型。

操作员戴上头显,几秒就能看到远程环境的轮廓,然后边操作边变清楚。

第三,Sim2Real场景流式下发。 仿真环境不需要预装在本地,可以从云端流式传输到机器人上。换场景就像换电视频道一样快。

具身计算研习社

最后说一句

3DGS这个方向,从“能不能建”到“能不能实时渲染”,再到“能不能流式分发”,每一步都是在拆墙。

SplatStream拆的是分发这堵墙。当3DGS能像视频一样边下边看,它才真正具备了成为下一代互联网内容格式的资格。

从“下载一个模型”到“点开就看”,这一步拆掉的是3DGS大规模落地最硬的那堵墙。

你觉得3DGS流式传输,最先会在哪个场景落地?VR/AR、云游戏、还是机器人远程操作?留言区聊聊。

如果你身边有做3DGS或VR/AR的朋友,这篇可能帮他省下几个GB的下载时间。

想系统入门3DGS流式传输方向的同学,后台回复「流式传输」,将获得:SplatStream的核心方法和与MPEG-DASH的对应关系整理成了一份入门路线图。

具身计算研习社
从「飘在空中」到「贴地飞行」:五篇顶会工作,拆解 3DGS表面重建的进化链路
截稿倒计时|ICRA 2027 时间、费用、投稿红线一次性讲清
大脑狂飙,躯体僵化——从RSS 2026开始,补上机器人的“身体智能”课

相关学习资料