Pixal3D é um projeto SIGGRAPH 2026 de Tsinghua, Tencent ARC e Victoria University of Wellington. A implementação atual usa TRELLIS.2, texturas PBR e, desde setembro de 2026, inferência multivista.
Por que alinhar os pixels
Muitos geradores inserem características por atenção em um espaço canônico. Pixal3D as retroprojeta em 3D para criar uma correspondência explícita com a vista de entrada.
O objetivo é preservar contornos e detalhes locais. Os exemplos incluem criaturas, peças mecânicas e prédios. Avalie a geometria além dos resultados texturizados.
Uma imagem ou várias vistas
Uma imagem gera um GLB. A inferência multivista usa pesos próprios e exige uma pasta de imagens com transforms.json descrevendo as câmeras.
O enquadramento deve corresponder às câmeras: as imagens não são recortadas ou redimensionadas. A primeira é a vista frontal canônica. O exemplo pressupõe quatro vistas a cada 90°, elevação zero e campo de visão de 20°.
Gerar e exportar GLB
Configure TRELLIS.2 e as dependências extras, incluindo NATTEN e o wheel utils3d indicado. A demonstração oficial no Hugging Face permite testar sem instalação local.
Os comandos mostram os dois modos. A resolução padrão é 1536; --low_vram carrega modelos sob demanda e usa 1024. --resolution muda o valor. ATTN_BACKEND=sdpa é uma alternativa sem FlashAttention.
python inference.py \
--image assets/images/0_img.png \
--output output.glb --low_vram
python inference_mv.py \
--views_dir assets/mv_images/example \
--output output_mv.glb --low_vram Usar no ComfyUI
ComfyUI integra Pixal3D e TRELLIS.2 em um template comum. Pixal3D é o padrão; o interruptor seleciona TRELLIS.2. O guia relacionado explica limpeza de malha, UV, baking PBR e exportação.
A versão paper usa Direct3D-S2 para reproduzir os experimentos publicados; a atual usa TRELLIS.2. Não misture os ambientes e pesos das duas versões.
Qual fluxo Pixal3D escolher
| Fluxo | Entrada ou base | Uso |
|---|---|---|
| Imagem única atual | Uma imagem; TRELLIS.2 | Asset detalhado com texturas PBR |
| Multivista atual | Imagens e câmeras; pesos próprios | Combinar vistas conhecidas do mesmo objeto |
| Versão paper | Direct3D-S2 | Reproduzir experimentos publicados |
| Template ComfyUI | Fluxo de imagem única por nós | Processar malha e fazer baking de materiais |
Perguntas frequentes
Posso usar várias imagens sem parâmetros de câmera?
O modo local exige transforms.json. Reutilize as câmeras do exemplo somente se suas vistas corresponderem à órbita de quatro câmeras; caso contrário, forneça transformações e campos de visão corretos.
O que muda no modo de pouca VRAM?
Carrega modelos sob demanda e reduz a resolução padrão de 1536 para 1024. --resolution permite alterar isso, mas resoluções maiores precisam de mais memória.
O GLB está pronto para um motor de jogo?
Confira polígonos, UV, materiais e geometria antes da integração. ComfyUI oferece simplificação e baking de materiais.