Pixal3D : des modèles 3D fidèles à l’image

Conservez davantage la silhouette, les proportions et les détails visibles de votre référence. Pixal3D relie directement les pixels à la géométrie générée.

Références et géométries Pixal3D de personnages, créatures et bâtiments
Les références et les géométries générées permettent de juger les détails sans se fier uniquement à la texture. Pixal3D

Projet SIGGRAPH 2026 de Tsinghua, Tencent ARC et Victoria University of Wellington, Pixal3D utilise aujourd’hui TRELLIS.2. Il propose génération monoculaire, textures PBR et inférence multi-vues publiée en septembre 2026.

L’intérêt de l’alignement pixel

Les générateurs classiques injectent souvent l’image par attention dans un espace canonique. Pixal3D rétroprojette les caractéristiques dans l’espace 3D pour établir une correspondance explicite avec la vue d’entrée.

L’objectif est de conserver contours et détails locaux. Les exemples couvrent créatures, mécanique et architecture : examinez les vues géométriques autant que les rendus texturés.

La rétroprojection des caractéristiques relie les pixels visibles à une génération 3D spatialement alignée.
La rétroprojection des caractéristiques relie les pixels visibles à une génération 3D spatialement alignée. Pixal3D

Une image ou plusieurs vues

Une image produit un GLB. Le mode multi-vues utilise des poids dédiés et attend un dossier d’images accompagné de transforms.json décrivant les caméras.

Le cadrage doit correspondre aux caméras : les images ne sont ni recadrées ni redimensionnées. La première vue est la face canonique. L’exemple fourni suppose quatre vues espacées de 90°, une élévation nulle et un champ de 20°.

Générer un GLB

Configurez TRELLIS.2, puis les dépendances Pixal3D, notamment NATTEN et le wheel utils3d indiqué. La démo Hugging Face officielle permet de tester sans installation locale.

Les commandes couvrent image unique et multi-vues. La résolution standard est 1536 ; --low_vram charge les modèles à la demande et passe à 1024. --resolution force la valeur. ATTN_BACKEND=sdpa remplace FlashAttention si nécessaire.

python inference.py \
  --image assets/images/0_img.png \
  --output output.glb --low_vram

python inference_mv.py \
  --views_dir assets/mv_images/example \
  --output output_mv.glb --low_vram

Le workflow ComfyUI

ComfyUI intègre Pixal3D et TRELLIS.2 dans un même modèle de workflow. Pixal3D est sélectionné par défaut ; un interrupteur active TRELLIS.2. Le guide associé détaille nettoyage, UV, cuisson PBR et export.

La version paper utilise Direct3D-S2 pour reproduire les expériences publiées. La version actuelle utilise TRELLIS.2. Gardez les environnements et poids de chaque version séparés.

Quel workflow Pixal3D choisir ?

WorkflowEntrée ou baseUsage
Image unique actuelleUne image ; TRELLIS.2Asset détaillé avec textures PBR
Multi-vues actuelImages et caméras ; poids dédiésFusion de vues connues du même objet
Version paperDirect3D-S2Reproduction des expériences
Modèle ComfyUIWorkflow monoculaire par nœudsTraitement du maillage et cuisson des matériaux

Questions fréquentes

Peut-on utiliser plusieurs images sans paramètres de caméra ?

Le mode local exige transforms.json. Réutilisez le fichier fourni uniquement si vos vues respectent son orbite à quatre caméras ; sinon renseignez les transformations et le champ de vision.

Que change le mode faible VRAM ?

Il charge les modèles à la demande et réduit la résolution par défaut de 1536 à 1024. --resolution permet de la modifier, mais une valeur plus élevée demande davantage de mémoire.

Le GLB est-il prêt pour un moteur de jeu ?

Vérifiez les polygones, UV, matériaux et la géométrie avant intégration. Le workflow ComfyUI propose simplification et cuisson des matériaux.

Sources officielles

Générer sans installation locale

Utilisez le générateur image-vers-3D dans le navigateur pour créer un objet sans gérer de workflow local.

Générer un objet 3D