Pixal3D 是清华大学、腾讯 ARC 与惠灵顿维多利亚大学的 SIGGRAPH 2026 项目。当前实现基于 TRELLIS.2,支持单图推理和 PBR 纹理,2026 年 9 月又发布了多视角推理代码。
像素对齐解决什么问题
很多图片转 3D 模型在标准物体坐标中生成形状,再通过注意力引入图像特征。Pixal3D 则把特征反投影到三维空间,让表面位置与输入视角的像素建立明确联系。
目标是更忠实的轮廓和局部细节,而不只是生成一个看起来相似的物体。官方案例包含复杂生物、机械部件与建筑;比较效果时同时看贴图和纯几何,才能判断细节是否真正进入模型。
单图与多视角怎么输入
单图推理接收物体图片并输出 GLB。多视角推理用独立的多视角权重融合相同物体的不同观察,需要图片目录和记录相机的 transforms.json。
图像取景必须与相机数据一致:多视角流程不自动裁剪或缩放输入。首帧应是标准正面视角。自带四视角示例对应每隔 90°、仰角 0°、视场角 20° 的环绕相机,不适用于任意拍摄的照片。
生成并导出 GLB
先配置 TRELLIS.2 环境,再安装 Pixal3D 的额外依赖,包括 NATTEN 与指定的 utils3d wheel。不想本地安装时,可以从官方 Hugging Face 演示开始尝试。
下方分别是单图和多视角命令。标准模式默认分辨率 1536;--low_vram 按需加载模型,默认降到 1024。可用 --resolution 手动指定;没有 FlashAttention 时可选择 ATTN_BACKEND=sdpa。
python inference.py \
--image assets/images/0_img.png \
--output output.glb --low_vram
python inference_mv.py \
--views_dir assets/mv_images/example \
--output output_mv.glb --low_vram 接入 ComfyUI 工作流
ComfyUI 已原生支持 Pixal3D 和 TRELLIS.2,二者共用图片转模型模板,默认使用 Pixal3D,通过开关切换到 TRELLIS.2。相关教程包含权重目录、网格清理、UV 展开、PBR 烘焙与导出。
复现论文实验时,使用基于 Direct3D-S2 的 paper 版本;新版生成流程则使用基于 TRELLIS.2 的实现。二者是不同版本,不要混用环境和权重。
选择哪条 Pixal3D 工作流
| 流程 | 输入或基础模型 | 适用任务 |
|---|---|---|
| 当前单图版 | 单张图片;TRELLIS.2 | 生成带几何与 PBR 纹理的精细资产 |
| 当前多视角版 | 图片与相机变换;独立多视角权重 | 融合相同物体的已知视角 |
| 论文版本 | Direct3D-S2 | 复现论文实验 |
| ComfyUI 模板 | 节点式单图流程 | 网格处理、材质烘焙与导出 |
常见问题
没有相机参数能直接用多张图片吗?
本地多视角流程需要 transforms.json。只有视角符合自带四视角环绕设置时才能复用示例相机文件;其他照片需要填写对应变换与视场角。
低显存模式改变什么?
按需加载模型,并把默认推理分辨率从 1536 调为 1024。可用 --resolution 手动修改,但更高分辨率仍会增加显存需求。
导出的 GLB 可以直接进游戏引擎吗?
GLB 便于交换资产,但接入前仍应检查面数、UV、材质效果和几何质量。ComfyUI 工作流提供网格减面和材质烘焙步骤。