夜雨聆风学习资料网

ARTICLE · 1072666

AI 是怎么学会捏 3D 模型的

AI 是怎么学会捏 3D 模型的

生成式 3D AI · 2020 → 2026

2020 年,一个角色资产的建模、材质、绑骨报价是 18000;2026 年,同一张需求图丢给 AI,十秒出一个。 这中间发生了六年的技术混战。这篇不讲「AI 好厉害」,只顺着一条线讲清楚: 每一步都是被上一步的毛病逼出来的——从隐式表示到显式表示,从借 2D 评委到自己长出手艺, 以及为什么最后的胜负手落在「布线干不干净」这种听起来很小的事情上。

三代范式8 张机制图3DGS 快约 100 倍Meshy T2:6 秒出网格

TL;DR
  • 3D 的表示换了三代:SDF / NeRF(隐式)→ 3DGS(显式椭球)→ mesh(原生多边形)。表示一变,生成范式就跟着变一次。
  • 没有 3D 数据怎么办:DreamFusion 借冻结的 2D 扩散模型当评委(SDS),代价是 Janus 多面脸——评委这辈子只见过照片。
  • 直接生成 mesh 的主流是自回归,死穴是「串行」;2026 年 Meshy T2 改用 flow matching 并行解码,压到 6 秒、100% 成功率。
  • 大厂发论文做基建,创业公司做产品抢用户——所以一开源,砸的是所有订阅制玩家的定价权。

一、3D 该怎么「存」:从 mesh 到 NeRF

想让模型生成一个 3D 物体,第一件事就卡住了:在神经网络眼里,3D 物体长什么样?

游戏行业早有标准答案——mesh,一堆顶点连线围成面。听起来很自然,但它有个要命的毛病: 拓扑太乱。顶点怎么连、连几个,毫无规律。而神经网络最讨厌没规律的东西。

换个角度:别存形状了,存「空间里每个点离表面有多远」。 在物体外面为正,在里面为负,整个物体就变成一张连续的距离地图。这叫 SDF(Signed Distance Function,符号距离函数)。 可以想象成把一座雕塑泡进果冻,然后记录果冻里每一个点离雕塑表面的距离。

2019 年,DeepSDF 第一个把它喂进神经网络:输入一个坐标,输出一个距离。 百万个模型压进去,它就成了张「3D 形状的压缩表」。神经网络第一次被当成 3D 数据库用。

一年后,另一群人走得更远——不存表面了,干脆把整个空间都存下来。 这伙人叫 NeRF(Neural Radiance Fields,神经辐射场,2020,UC Berkeley)。

做法是:给网络一对输入(一个坐标 + 一个观察方向),它回两样东西——这个位置 是什么颜色有多实(密度)。然后从相机位置往场景里射一条线, 沿线一路采样、每个点问一遍网络,再把颜色一层层叠起来。一张照片就这么「算」出来了。

NeRF 渲染一个像素的完整流程。注意第二步——「每个点」,这就是它慢的全部原因。
一个几百 KB 的小网络,装下了一整个世界。NeRF 拿下 ECCV 2020 荣誉提名,随后几百篇变体井喷,硬生生炸出一个新领域:神经渲染。 代价是上面那张图里的第二步——每个像素都要把这条路走一遍。

二、NeRF 的致命伤:太慢

渲染一个像素要沿线采样几十上百个点,每个点都得跑一遍神经网络。 而一张 1080p 的画面有 200 万个像素。训练一个场景几个小时起步,训完还只能渲染这 一个场景——想换个东西?从头再来。

于是开始打补丁:

  • pixelNeRF
    (2021):给一张照片直接推理出 NeRF,终于不用一个场景训一次。
  • Instant-NGP
    (NVIDIA,2022):把那个大 MLP 换成一堆多分辨率哈希表,训练时间从小时砍到

但真正的革命在 2023 年。SIGGRAPH 2023,法国 INRIA 的一群人甩出一篇 3D Gaussian Splatting(3DGS),思路清奇到:神经网络?扔了。

改用几百万个带颜色的小椭圆(高斯椭球),直接把场景「堆」出来。 每个椭球有自己的位置、大小、朝向、颜色、透明度;渲染时按远近排个序,一层层叠上去—— 纯光栅化,一次神经网络推理都不用。 结果是 1080p 实时 100+ FPS,画质不输 NeRF,快约 100 倍。

同一件事的两条路。左边每加一个像素就多一份网络计算;右边把计算一次性前移到优化阶段,渲染只做排序和叠加。

一个不严谨但好记的比方:NeRF 像「一个记性超群的人,把每个角落死死背在脑子里,你问他一句他答一句」; 3DGS 像「直接往空中撒几百万颗珠子,你从哪个角度看,都是珠子拼出来的画」。

表示的问题到这儿告一段落。接下来才是正题:生成。

三、没有 3D 数据,怎么生成:借一个 2D 评委

2022 年,目标变成「输入一句话,输出一个 3D 模型」。然后撞上第二堵墙: 没有 3D 训练数据。 互联网上有几十亿张带文字的图片,文生图扩散模型就是吃这个长大的;但高质量 3D 模型全网翻个底朝天也就百万级, 还都是椅子、桌子、汽车这种。数据量差着三个数量级,硬训喂不饱。

Google 的 DreamFusion(2022.9)给了一个天才到离谱的答案: 没有 3D 评委,那就借 2D 的用。

四步:随便初始化一个 3D 表示(一开始就是一坨糊);从它身上渲染出一张图;故意往图上加噪声, 请一个冻结的、已经看过几十亿张图的 2D 扩散模型来猜「这坨东西里面加的噪声长什么样」; 它猜出来的噪声和实际加的噪声之间的,就是「这张图哪里不像真的」——把这个差当成梯度, 回头去改 3D 参数。

分数蒸馏采样(SDS)。冻结的 2D 扩散模型只是个「评委」——它从没学过 3D,只负责回答「这张图哪里不像真的」。

这套路叫 SDS(Score Distillation Sampling,分数蒸馏采样),是整个文生 3D 的奠基技术。 后续就卷疯了:

  • Magic3D
    (NVIDIA,2023):粗、细两阶段走,快 2 倍、分辨率高 8 倍,第一次直接吐出带纹理的 mesh
  • ProlificDreamer
    (清华,2023):升级蒸馏算法(VSD),治好了过饱和,质量起飞。

但 SDS 有三个毛病,怎么治都治不好:

  1. ——优化一个模型几十分钟。
  2. ——出来的东西像被水泡过,过于平滑。
  3. 多面脸。

第三个值得单独讲,它有个专有名词叫 Janus 问题(雅努斯,罗马神话里前后面各一张脸的神)。

为什么会长出多面脸?想想那个 2D 评委——它这辈子只见过照片, 而照片永远只是一个面。你问它「这个物体的背面长什么样」,它真不知道。 于是它一脸笃定地指导学生:「正面,应该长这样。」学生就傻乎乎地把物体的 每一个面都做成了正面。结果就是:一个模型,三张脸。

评委不是不专业,是它压根没背过背面。这也点明了下一步的方向:得换一个懂多视角的评委。

四、换个思路:先看懂图,再重建

Janus 的根子在于「评委没有 3D 概念」。那换一个懂多视角的评委呢?2023 年,三条路同时爆发。

路线 A · 视角扩散

Zero-1-to-3(Columbia,2023)训一个扩散模型,输入单张图 + 一句「从左边 30 度看」, 吐出那个角度下的新画面——绕开 3D,只学「视角变换」这一件事。 后来的 Zero123++、InstantMesh(腾讯,2024)都走这条路:单图 → 脑补 6 个视角 → 重建 3D,全程 10 秒。

路线 B · 前馈重建

LRM(Adobe,2023)把 LLM 那套 scaling 直接搬进 3D:5 亿参数 Transformer, 100 万 3D 资产喂下去,单图 5 秒吐出一个 3D——不优化、不迭代,一次前向传播搞定。 Stability AI 和 Tripo 拿它改成 TripoSR(2024):A100 上 0.5 秒出模型,还开源了。

路线 C · 3D 原生扩散

OpenAI 的 Shap-E(2023)不借 2D 了,直接在 3D 空间里做扩散,几秒生成。 质量一般,但思路很关键:让 3D 数据自己学自己。

三条路的共识

别再用 2D 评委打分了,直接生成 3D。这一步之后,「能不能秒出 3D」不再是问题, 新问题是「秒出来的东西,美术能不能直接用」

五、终点站:直接生成 mesh

到这儿,AI 已经能「秒出」3D 了。但游戏公司拿到手一看,还是摇头—— 因为吐出来的是一坨「密集三角化网格」,几万个乱糟糟的小三角形密密麻麻糊在表面上。

人类美术做的模型恰恰相反:几千个面,布线干干净净,一条环线顺着肌肉走势绕过去—— 行话叫 artist-like mesh。为什么非要讲究布线?因为模型做出来是要动的,要绑骨骼、要做动画。 布线一乱,模型一动就烂:该弯的地方不弯,该转的地方卡死。

行话里右边叫 artist-like mesh。区别不在面数多少,在于布线能不能支撑后面的绑定和动画

于是 2024 年,最硬核的路线登场:把 mesh 当成一门语言,让 Transformer 一个 token、一个 token 地「写」出来。

这个脑洞其实 2020 年就有人开过:DeepMind 的 PolyGen,先自回归生成顶点序列,再生成面, 只是当时没人当回事。到 2024 年这条线彻底爆发:

  • MeshGPT
    (TU Munich,CVPR 2024):先用 VQ-VAE 把三角形编码成 token,再让 GPT 式模型自回归生成。第一次生成出紧凑、布线像人做的网格。
MeshGPT 这一代的做法:mesh 当成句子,三角形当成词。和 GPT 写句子的唯一区别是——写错的代价大得多。
  • MeshAnything V2
    (2024):让相邻三角形共享顶点,序列长度直接减半,能撑到 1600 面。
  • MeshXL
    (复旦 + 腾讯,NeurIPS 2024):250 万 mesh 预训练,参数干到 1.3B——第一次验证了 3D 也有 Scaling Law。
  • Meshtron
    (NVIDIA,2024.12):沙漏结构 Transformer + 滑窗推理,一口气支持 64K 面,比此前最好结果高一个数量级。

但这条自回归的路有个绕不开的死穴:它是串行的。 一个 token 接一个 token 地吐,中间错一个,后面全跟着崩。代价直接写在数字里: 生成一个模型要 49 秒到 20 分钟,成功率能掉到 30% 以下。 想拿它搭流水线?一个三次里失败一次的工具,没法用。

于是 2026 年 7 月,Meshy 甩出 Meshy T2,把「逐 token 串行」整个扔掉, 改用 flow matching——就是现在图像生成模型背后那套快速生成的数学。 两阶段走:第一阶段看着你的图,先框出一个粗糙的 64³ 体素脚手架; 第二阶段拿这个脚手架当底,把每一个顶点、每一条边、每一个面的绕序,一次性并行解码出来

核心是一个 vertex-set VAE:一个顶点 = 一个连续 latent token,顶点和连接关系一起生成, 所以多部件物体(一辆车 + 四个轮子)会自己裂成干净的连通块,不用单独做部件切分。三个数字说明差别:

自回归的瓶颈是「必须等上一个」;flow matching 把顶点集合整体当成一个可并行的对象。这是 2026 年这条路线上唯一重要的转折。
6 秒中位耗时,比自回归快一个数量级以上100%重拓扑测试里的合法网格成功率(老方法 28%–96%)可控生成前告诉它要多少顶点,就按这个预算建

代码和权重已经放到 GitHub,不过许可写的是 CC BY-NC-SA 4.0——非商用, 所以「开源 = 白嫖」在这条线上暂时不成立。

与此同时,另一条线在解决「表示不统一」的问题,终极形态叫 TRELLIS(清华 + 微软,2024.12 开源): 搞了个统一潜在表示(SLAT),一个模型同时输出 mesh / NeRF / 3DGS 三种格式,2B 参数,CVPR 2025 Spotlight。 一年后 TRELLIS 2(2025.12)参数翻到 4B,新的 O-Voxel 表示把数据压 16 倍,3 秒生成

还有一个绕不开的名字:腾讯混元 Hunyuan3D。2.0(2025.01)一开源就登顶 HuggingFace; 2.1(2025.06)是第一个开源的 PBR 材质方案,6GB 显存就能在本地跑。

到这儿,学术侧的三代范式齐了:

第一代(2019–2021):表示学习 —— NeRF 一统神经渲染 第二代(2022–2023):借 2D 评委 —— SDS 蒸馏凭空长出 3D 第三代(2024–2026):原生生成 —— 直接吐 artist-like mesh + PBR

学术讲完了。接下来是商业战场——比论文精彩多了。

六、创业公司的生死簿

六年六个节点。往下读任何一层,都能在上面一层找到它要解决的那个毛病。

Luma AI:最优雅的叛逃

Luma(2021,Palo Alto)起点好得不像话:创始人 Alex Yu 是 UC Berkeley 搞 NeRF 的, 做了个「iPhone 拍段视频就能重建 3D」的 App,融资一路绿灯。 2023 年 11 月发布文生 3D 产品 Genie,Discord 上线首日几万人涌进来。 所有人都以为:Luma 要做 3D 界的 Midjourney 了。

然后他们掉头,做了视频。 2024 年 6 月 Dream Machine 上线,4 天用户破百万;这家「3D 公司」彻底转行做视频生成。 2025 年 11 月拿下 9 亿美元 C 轮,估值 40 亿,沙特 HUMAIN 领投,Amazon、AMD 跟投。 顺带一提,他们首席科学家宋佳铭是 DDIM 算法的发明者——Stable Diffusion 的底层技术之一。 人家不是跑路,是本来就有这本事。

他们的说法很文艺:「要做好 3D,必须先理解世界怎么动。视频,是通往 4D 的必经之路。」信不信由你,反正钱是真的。

Kaedim:AI 界的「机械土耳其人」

1769 年,欧洲展出过一台「会下棋的自动机器」,全欧洲震惊。多年后真相泄露: 机器肚子里,藏着一个真人棋手。这段典故后来有了个名字,叫「机械土耳其人」。

2023 年,404 Media 扒了 Kaedim——一家对外宣称「AI 自动把 2D 图转成 3D」的创业公司。 真相是:他们雇了阿根廷、印尼、埃塞俄比亚的 3D 艺术家,一个模型付 1–4 美元,有时候压根没用 AI,是从零手画的。 CEO 出来辩解:那不是外包,那是「质量控制团队」。更讽刺的是——2024 年 a16z Games 还是给他们领投了 1500 万 A 轮。

Meshy vs Tripo:两个 90 后的对决

这是中国 AI 3D 赛道的双雄会,人设工整得像编剧安排的。

胡渊鸣,1994 年生,Meshy 创始人。清华姚班 → MIT 博士(导师 Frédo Durand), 博士期间发了 6 篇 SIGGRAPH / NeurIPS,还独立写了 25k Star 的开源物理模拟框架「太极」—— 技术天才型。上面那个 Meshy T2 的论文,他就在作者名单里:产品在卖,论文在发,两头都抓。

宋亚宸,1997 年生,VAST(Tripo)创始人。Johns Hopkins 毕业(学的还不是 CS), 前商汤、MiniMax 联合创始人,重度游戏玩家——商业玩家型

2026 年战报:

  • Meshy
    :近 4 亿美元 B 轮,估值 100 亿人民币,1200 万用户——AI 3D 赛道最高估值。
  • Tripo
    :2 亿美元 A+/A++ 轮,估值破 10 亿美元,2000 万用户——中国最快 AI 独角兽。

一个从技术深度打,一个从产品生态打,两家都赢了。这个赛道大到容得下两种活法。

大厂众生相

  • NVIDIA
    :不发 C 端产品,只发论文(Magic3D、Meshtron)+ 做基建(Omniverse)。翻译成人话:我卖铲子,你们去淘金
  • Microsoft
    :开源 TRELLIS 一击必杀,然后 Azure 收租。经典微软打法。
  • 腾讯
    :混元 3D 全家桶开源。自媒体标题都是「暴击国外建模行业」——夸张,但定价权是真被砸了。
  • OpenAI
    :Point-E、Shap-E 起了个大早,然后资源全押 Sora。3D 先驱,变先烈。
  • Meta
    :3D Gen 论文一发就走,不给产品。人家做 3D 是为了给自家元宇宙补内容。
  • Stability AI
    :开源神话的代价——估值 10 亿 → 欠云厂商 1 亿 → 创始人跑路。开源一个模型,不等于跑通一个商业模式。

七、复盘:四条能带走的东西

一、这条技术路线是「缺陷驱动」的。 每一步都是上一步的毛病逼出来的:SDF 存不下细节 → 那就 NeRF;NeRF 太慢 → 那就 3DGS; SDS 有 Janus 问题 → 那就前馈重建;密集三角化没法用 → 那就原生 mesh 生成。 没有一步是拍脑袋想出来的。

二、表示和生成是绑在一起的。 NeRF 时代生成靠「优化」;3DGS 时代生成靠「蒸馏」;mesh 时代生成靠「自回归」; 到了 flow matching 阶段,生成靠「并行去噪」。表示一变,整个生成范式就跟着变一次。

三、大厂和创业公司根本不在同一个维度打架。 大厂发论文、做基建;创业公司做产品、抢用户。 所以腾讯和微软一开源,砸的其实是所有订阅制玩家的定价权

四、最后的瓶颈不在「能不能生成」,在「能不能生产级」。 今天所有模型吐出来的 3D,美术都得二次编辑。谁能把「70% 自动 + 30% 手动」变成「95% 自动」,谁就通吃。 这就是为什么 Tripo Studio、Meshy Agent 都在拼命做一站式工作台—— 生成只是门票,工作流才是护城河。

回到开头那个报价员。他 2020 年报价 18000 的活,2026 年 AI 十秒生成、成本 1 美元。 但他没有失业——他现在的工作变成了:从 AI 生成的 20 个方案里挑出最好的那一个,然后改布线、调材质、绑骨骼。

AI 干掉的不是人,是「从零开始」这四个字。

同一批人正在把战场从「物体」推到「世界」——要求从「像不像」变成「能不能一直走下去而不崩」。

八、关键论文速查

DeepSDF
2019
把 SDF 喂进网络,第一次当 3D 数据库用
NeRF
2020
一个 MLP 装下整个场景
PolyGen
2020
最早把 mesh 当序列生成(当时没人理)
DreamFusion / SDS
2022
借 2D 扩散模型当 3D 评委
Instant-NGP
2022
哈希表把训练从小时砍到秒
3D Gaussian Splatting
2023
几百万个小椭圆,快约 100 倍
Zero-1-to-3 / LRM
2023
单图秒出 3D 的两条路
MeshGPT
2024
mesh 当语言,逐 token 生成
Meshtron
2024
64K 面,NVIDIA 的警告
TRELLIS / TRELLIS 2
2024 / 2025
一个模型三种格式;2 代 3 秒生成
Hunyuan3D 2.x
2025
开源 PBR,6GB 显存能跑
Meshy T2
2026
扔掉自回归,flow matching 并行出网格,6 秒
作业:去 tripo3d.ai 或者 meshy.ai,传一张你手机里的照片进去。 十秒之后你会回来点赞的——然后你会盯着那条布线,想起这篇里的第五层。

整理自公开论文与产品资料,年份以会议 / 预印本首次公开为准; 商业数据(估值、轮次、用户量)来自公开报道,口径可能不一致,引用前请回原文核对。

相关学习资料