Pixal3D:让生成的 3D 更贴近输入图片

让生成模型更好地保留参考图的轮廓、比例与可见细节。Pixal3D 将图片像素直接对应到生成过程中的三维几何。

Pixal3D 的角色、生物与建筑参考图及生成几何
官方总览把参考图和生成几何放在一起,去掉颜色后也能观察形状与细节。 Pixal3D

Pixal3D 是清华大学、腾讯 ARC 与惠灵顿维多利亚大学的 SIGGRAPH 2026 项目。当前实现基于 TRELLIS.2,支持单图推理和 PBR 纹理,2026 年 9 月又发布了多视角推理代码。

像素对齐解决什么问题

很多图片转 3D 模型在标准物体坐标中生成形状,再通过注意力引入图像特征。Pixal3D 则把特征反投影到三维空间,让表面位置与输入视角的像素建立明确联系。

目标是更忠实的轮廓和局部细节,而不只是生成一个看起来相似的物体。官方案例包含复杂生物、机械部件与建筑;比较效果时同时看贴图和纯几何,才能判断细节是否真正进入模型。

图像特征通过反投影参与空间对齐的生成,让输入图的可见部分与模型形状建立对应。
图像特征通过反投影参与空间对齐的生成,让输入图的可见部分与模型形状建立对应。 Pixal3D

单图与多视角怎么输入

单图推理接收物体图片并输出 GLB。多视角推理用独立的多视角权重融合相同物体的不同观察,需要图片目录和记录相机的 transforms.json。

图像取景必须与相机数据一致:多视角流程不自动裁剪或缩放输入。首帧应是标准正面视角。自带四视角示例对应每隔 90°、仰角 0°、视场角 20° 的环绕相机,不适用于任意拍摄的照片。

生成并导出 GLB

先配置 TRELLIS.2 环境,再安装 Pixal3D 的额外依赖,包括 NATTEN 与指定的 utils3d wheel。不想本地安装时,可以从官方 Hugging Face 演示开始尝试。

下方分别是单图和多视角命令。标准模式默认分辨率 1536;--low_vram 按需加载模型,默认降到 1024。可用 --resolution 手动指定;没有 FlashAttention 时可选择 ATTN_BACKEND=sdpa。

python inference.py \
  --image assets/images/0_img.png \
  --output output.glb --low_vram

python inference_mv.py \
  --views_dir assets/mv_images/example \
  --output output_mv.glb --low_vram

接入 ComfyUI 工作流

ComfyUI 已原生支持 Pixal3D 和 TRELLIS.2,二者共用图片转模型模板,默认使用 Pixal3D,通过开关切换到 TRELLIS.2。相关教程包含权重目录、网格清理、UV 展开、PBR 烘焙与导出。

复现论文实验时,使用基于 Direct3D-S2 的 paper 版本;新版生成流程则使用基于 TRELLIS.2 的实现。二者是不同版本,不要混用环境和权重。

选择哪条 Pixal3D 工作流

流程输入或基础模型适用任务
当前单图版单张图片;TRELLIS.2生成带几何与 PBR 纹理的精细资产
当前多视角版图片与相机变换;独立多视角权重融合相同物体的已知视角
论文版本Direct3D-S2复现论文实验
ComfyUI 模板节点式单图流程网格处理、材质烘焙与导出

常见问题

没有相机参数能直接用多张图片吗?

本地多视角流程需要 transforms.json。只有视角符合自带四视角环绕设置时才能复用示例相机文件;其他照片需要填写对应变换与视场角。

低显存模式改变什么?

按需加载模型,并把默认推理分辨率从 1536 调为 1024。可用 --resolution 手动修改,但更高分辨率仍会增加显存需求。

导出的 GLB 可以直接进游戏引擎吗?

GLB 便于交换资产,但接入前仍应检查面数、UV、材质效果和几何质量。ComfyUI 工作流提供网格减面和材质烘焙步骤。

官方资料

无需配置本地环境,直接生成模型

只需要一个资产时,可以在浏览器中使用图片转 3D 生成器,无需管理本地工作流。

生成 3D 资产