Pixal3D:入力画像に忠実な3Dモデル

参考画像の輪郭、比率、見える細部を3Dモデルに反映。Pixal3Dは画像のピクセルと生成する幾何を直接結び付けます。

Pixal3Dのキャラクター・生物・建築の参考画像と生成幾何
参考画像と生成幾何を並べ、色のテクスチャだけでなく形状の細部も確認できます。 Pixal3D

Pixal3Dは清華大学、Tencent ARC、Victoria University of WellingtonによるSIGGRAPH 2026の研究です。現在の実装はTRELLIS.2を基盤とし、PBRテクスチャと2026年9月公開の複数視点推論を備えます。

ピクセル整合が重要な理由

一般的な生成器は標準座標空間に注意機構で画像特徴を注入します。Pixal3Dは特徴を3Dへ逆投影し、入力視点との明確な対応を作ります。

狙いは忠実な輪郭と局所的な細部です。作例には生物、機械部品、建築があります。テクスチャ付き表示だけでなく幾何表示でも評価してください。

画像特徴の逆投影により、見えるピクセルと空間的に整合した3D生成を結び付けます。
画像特徴の逆投影により、見えるピクセルと空間的に整合した3D生成を結び付けます。 Pixal3D

単画像と複数視点の入力

単画像推論はGLBを出力します。複数視点版は専用重みを使い、画像フォルダとカメラを記録したtransforms.jsonが必要です。

入力は自動で切り抜き・リサイズされないため、画角をカメラ情報に合わせます。先頭は標準の正面視点です。付属例は90°間隔の4視点、仰角0°、視野角20°を前提にしています。

GLBを生成・出力する

TRELLIS.2環境を構築後、NATTENと指定utils3d wheelなどを追加します。ローカル導入なしで試す場合は公式Hugging Faceデモを利用できます。

以下は単画像と複数視点のコマンドです。標準解像度は1536、--low_vramは必要時にモデルを読み込み1024を使います。--resolutionで変更可能です。FlashAttentionがなければATTN_BACKEND=sdpaを選べます。

python inference.py \
  --image assets/images/0_img.png \
  --output output.glb --low_vram

python inference_mv.py \
  --views_dir assets/mv_images/example \
  --output output_mv.glb --low_vram

ComfyUIで使う

ComfyUIは共通テンプレートでPixal3DとTRELLIS.2を標準対応します。初期設定はPixal3Dで、スイッチでTRELLIS.2へ切り替えます。関連ガイドはメッシュ整理、UV、PBRベイク、出力を解説します。

論文実験の再現にはDirect3D-S2基盤のpaper版を使います。現在の実装はTRELLIS.2基盤です。両者の環境や重みを混在させないでください。

Pixal3Dのワークフローを選ぶ

手法入力・基盤用途
現行単画像版単画像・TRELLIS.2PBRテクスチャ付きの精細なアセット
現行複数視点版画像とカメラ・専用重み同一物体の既知視点を統合
paper版Direct3D-S2論文実験の再現
ComfyUIテンプレートノード型単画像処理メッシュ処理と材質ベイク

よくある質問

カメラ情報なしで複数画像を使えますか?

ローカル版はtransforms.jsonが必要です。付属カメラ設定を再利用できるのは4視点の配置に合う場合のみです。それ以外は対応する変換と視野角を入力します。

低VRAMモードは何が変わりますか?

必要時にモデルを読み込み、標準解像度を1536から1024へ下げます。--resolutionで変更できますが、高解像度ほどメモリが必要です。

GLBをそのままゲームエンジンに使えますか?

導入前にポリゴン数、UV、材質、幾何を確認してください。ComfyUIには減面と材質ベイクの工程があります。

公式資料

ローカル設定なしでモデルを生成

一つのアセットが必要なら、ブラウザの画像から3D生成でローカル環境の管理を省けます。

3Dアセットを生成