
做网页 3D 的朋友,应该都被一个问题折磨过:
想在网页里放一个可以 360° 旋转的商品模型,要么得找建模师排期,要么用摄影测量扫描,要么花钱买现成模型。一个 .glb 文件动辄几 MB,想改个颜色、换个细节,还得再去求美术打开 Blender。
最近,GitHub 上有个项目火了:img2threejs。
它的思路很有意思——给 AI 一张参考图,它不直接给你吐出一个模型文件,而是直接生成一段 Three.js 代码。用 Box、Cylinder、Sphere 这些基础几何体,像搭积木一样,把图片里的物体一点点“拼”出来。
而且项目采用 Apache-2.0 协议开源。
所以这篇文章,我们就来把它讲清楚:img2threejs 到底是怎么工作的?生成出来的 3D 效果怎么样?又值不值得实际用?

这两年图生 3D 的工具不少——Tripo3D、Meshy 这些,都是端到端神经网络直接吐一个网格文件(GLB/OBJ)出来。
img2threejs 走的是完全相反的路,它不做摄影测量,不做网格提取,不下载美术资源包。
而是 reconstruction-by-code:用几何图元、程序化着色器和生成几何体,把参考图里的物体用代码重建出来。
最终产物是什么?
一个 TypeScript 函数。调用它,返回一个 THREE.Group,直接塞进你的 Three.js 场景里就能渲染、旋转、交互。
这个区别带来的好处:
• 体积极小:几 KB 的代码,对比几 MB 的网格文件;
• 可以 git diff:纯文本,版本管理友好,改尺寸改颜色就是改代码;
• 可以逐行读:AI 怎么理解这个物体的,全写在代码里,你能看懂、能插手;
• 动画就绪:输出自带 pivots、sockets、colliders 这些运行时结构,做拆解动画、交互效果不用重新绑。
简单来说就是:别的工具给你一个"死模型",它给你一份"活代码"。

这是最有意思的部分。
img2threejs 不是一个传统软件,也不是一个网站——它是一个给 AI Agent 用的 Skill。
安装方式就是把它克隆到你 Agent 的 skills 目录:

然后在 Claude Code(或 Codex、OpenCode)里附上一张物体照片,说:

接下来,AI 会自己走完整条流水线。你只需要在旁边看着它干活。
它跟 Agent 宿主无关——Claude Code、OpenAI Codex、OpenCode 都能跑。脚本部分只用 Python 3.10+ 标准库,零第三方依赖,连 pip install 都不用。

这是这个项目最硬核的地方。它不是让 AI 一口气糊几千行代码出来赌运气,而是设计了一条带质量门控的分阶段流水线。
整个流程分四个大阶段:
Stage 1 - Intake(看图)
AI 先对参考图做多层视觉分析:这是什么物体、复杂度多高、宏观结构怎么拆、微观细节有哪些、用什么 PBR 材质术语描述、哪些部分从这个角度根本看不到(标记为"待推测")。
Stage 2 - Spec(出规格)
把分析结果写成一份结构化的 JSON 规格书(ObjectSculptSpec):
组件层级树、每个部件用什么几何体、尺寸位置、材质参数、哪些关节可以动。相当于先画图纸再施工
Stage 3 - Build(写代码)
按固定顺序分 8 个 Pass 逐步生成代码:
大体轮廓 → 结构细化 → 形体精修 → 材质贴合
→ 表面细节 → 光照 → 交互能力 → 性能优化
Stage 4 - Review(渲染审核)
这是灵魂所在。每完成一个 Pass,系统会在浏览器里把当前模型渲染出来,截图和参考图并排对比,让 AI 自己看"像不像"。不像?打回去改。像?才解锁下一个 Pass。
轮廓没过审,不许做材质;结构没过审,不许上表面细节。
这套"构建 → 审核 → 修正"的循环,就是官方说的 quality-gated(质量门控)——它避免了 AI 一次性生成几千行代码、比例材质灯光全混在一起反复返工的灾难。

还内置了迭代上限、停滞检测、重复缺陷检测,防止 AI 陷入死循环无限烧 Token。这种"确定性脚本管验证和门控,AI 只负责视觉判断和写代码"的分工,是这个项目真正聪明的地方。

官方演示站:(img2threejs.github.io/img2threejs-showcase)上的案例很漂亮:手枪、汽车、角色,都是浏览器里实时跑的,可以转着看,还能直接读生成它的源码。

但第三方实测也给了诚实的反馈:
擅长的:
轮廓明确、部件关系清楚的硬表面物体——武器、道具、机械、产品图,还原度相当高。
还差点意思的:
• 玻璃太淡,厚壁折射和瓶底聚光不对;
• 透明液体(比如酒瓶里的琥珀色液体)容易做得偏不透明;
• 布料褶皱这类软表面仍需人工调整;
• 单张图片的背面结构,本质是"推测"——正面可以很像,背面是不是对的,没人能打包票。
所以对尺寸精度有要求的 CAD、工业设计、逆向工程,别指望一张图搞定。
Token 成本也有个参考(官方数据):

大头花在 5-8 轮"渲染-审核"循环上。不算免费,但比起约一个建模师的价格,你自己品。
适合:
• 前端开发者,要给电商页/活动页加个能转的 3D 商品展示;
• 游戏开发者做原型验证——概念图秒变可交互道具,先验证玩法再找美术;
• 做教育课件的——机械结构、航天器变成可拆解、可标注的 3D 教学模型;
• 任何"不想引入外部模型文件、追求代码可控"的轻量 3D 项目。
不适合:
• 要写实人脸的(v1.5 角色更新还在 beta);
• 要大型场景、建筑群的(v1.6 才排上);
• 要精确尺寸的工程件;
• 想完全无人值守批量跑的——它目前需要 AI Agent 交互式运行。
项目的路线图:v1.5 角色重建和面部、v1.6 环境生成、v1.7 导出 Unity/Unreal、v1.8 自动绑骨、v2.0 多视图重建。
如果都兑现,这会是个很恐怖的工具。

img2threejs 这类项目最有价值的地方,不是它现在雕得多好,而是它验证了一个思路:
AI 生成 3D,不一定要端到端吐一个黑盒网格出来。
端到端方案给你的 GLB 文件,像一个烤好的蛋糕——好看,但你没法调整配方。而代码重建方案给你的,是一份食谱:每个部件多大、什么材质、为什么放在这个位置,全部可读、可改、可复用。
这跟最近 Skill 生态的整个趋势是同构的:与其让 AI 直接生成"结果",不如让 AI 生成"可执行的中间产物",把判断力和修改权留在人手里。
当生成的 3D 模型变成了能 git diff 的代码,设计师和前端之间的那堵墙,可能真的要塌了。
end
加入交流群,一起高效学习AI,拥抱未来!

进群后,希望大家可以共享skill提示词模板,AI时代共同学习进步!也会每天更新AI设计相关的文章及AI日报、周报哦~



夜雨聆风