Pixal3Dは清華大学、Tencent ARC、Victoria University of WellingtonによるSIGGRAPH 2026の研究です。現在の実装はTRELLIS.2を基盤とし、PBRテクスチャと2026年9月公開の複数視点推論を備えます。
ピクセル整合が重要な理由
一般的な生成器は標準座標空間に注意機構で画像特徴を注入します。Pixal3Dは特徴を3Dへ逆投影し、入力視点との明確な対応を作ります。
狙いは忠実な輪郭と局所的な細部です。作例には生物、機械部品、建築があります。テクスチャ付き表示だけでなく幾何表示でも評価してください。
単画像と複数視点の入力
単画像推論はGLBを出力します。複数視点版は専用重みを使い、画像フォルダとカメラを記録したtransforms.jsonが必要です。
入力は自動で切り抜き・リサイズされないため、画角をカメラ情報に合わせます。先頭は標準の正面視点です。付属例は90°間隔の4視点、仰角0°、視野角20°を前提にしています。
GLBを生成・出力する
TRELLIS.2環境を構築後、NATTENと指定utils3d wheelなどを追加します。ローカル導入なしで試す場合は公式Hugging Faceデモを利用できます。
以下は単画像と複数視点のコマンドです。標準解像度は1536、--low_vramは必要時にモデルを読み込み1024を使います。--resolutionで変更可能です。FlashAttentionがなければATTN_BACKEND=sdpaを選べます。
python inference.py \
--image assets/images/0_img.png \
--output output.glb --low_vram
python inference_mv.py \
--views_dir assets/mv_images/example \
--output output_mv.glb --low_vram ComfyUIで使う
ComfyUIは共通テンプレートでPixal3DとTRELLIS.2を標準対応します。初期設定はPixal3Dで、スイッチでTRELLIS.2へ切り替えます。関連ガイドはメッシュ整理、UV、PBRベイク、出力を解説します。
論文実験の再現にはDirect3D-S2基盤のpaper版を使います。現在の実装はTRELLIS.2基盤です。両者の環境や重みを混在させないでください。
Pixal3Dのワークフローを選ぶ
| 手法 | 入力・基盤 | 用途 |
|---|---|---|
| 現行単画像版 | 単画像・TRELLIS.2 | PBRテクスチャ付きの精細なアセット |
| 現行複数視点版 | 画像とカメラ・専用重み | 同一物体の既知視点を統合 |
| paper版 | Direct3D-S2 | 論文実験の再現 |
| ComfyUIテンプレート | ノード型単画像処理 | メッシュ処理と材質ベイク |
よくある質問
カメラ情報なしで複数画像を使えますか?
ローカル版はtransforms.jsonが必要です。付属カメラ設定を再利用できるのは4視点の配置に合う場合のみです。それ以外は対応する変換と視野角を入力します。
低VRAMモードは何が変わりますか?
必要時にモデルを読み込み、標準解像度を1536から1024へ下げます。--resolutionで変更できますが、高解像度ほどメモリが必要です。
GLBをそのままゲームエンジンに使えますか?
導入前にポリゴン数、UV、材質、幾何を確認してください。ComfyUIには減面と材質ベイクの工程があります。