- ComfyUIでのMiniMax H3:オープンウェイトのAI動画生成をローカルで実行し、すべてのパラメータを完全に制御
- 3つのコアモード:テキストから動画(T2V)、画像から動画(I2V)、参照から動画(R2V)
- ネイティブステレオオーディオ:ダイアログ、効果音、音楽が動画と一緒に生成されます
- ハードウェア要件:十分なシステムRAMを搭載したNVIDIA RTX 3060以上
- 速度最適化:Sage Attentionをインストールして、生成速度をほぼ2倍に向上
MiniMax H3 ComfyUIの概要
MiniMax H3は、ComfyUIを通じて強力なオープンウェイトのAI動画生成をローカルマシンに直接もたらします。この統合により、クリエイターはネイティブステレオオーディオを備えた高品質な動画コンテンツを生成し、テキストプロンプト、参照画像、動画クリップを統合されたマルチモーダル出力にまとめることができます。ローカルで実行することで、クラウドAPIに依存することなく、すべてのパラメータを完全に制御できます。
動画のハイライト:
- RTX 3090上で枝刈りされたint8モデルを使用した、ローカルでのテキストから動画への生成
- ワイプとフェーズエフェクトを用いた、最初と最後のフレームの画像から動画へのトランジション
- 複数の画像、動画クリップ、オーディオトラックを組み合わせた参照から動画への生成
- 異なるクリップからキャラクターの外見と声を組み合わせるボイスクローニング機能
- 15秒の最大継続時間制限を超える試みに成功
MiniMax H3のライセンスでは、デフォルトで米国および欧州連合でのダウンロードが制限されています。ただし、ライセンスリクエストフォームを送信することで、個人がアクセスをリクエストできます。承認メールは通常、迅速に送信されます。特定の使用権については、常にご自身で調査を行ってください。
コア生成モード
MiniMax H3は、異なるクリエイティブユースケース向けに設計された3つの主要な生成ワークフローを通じて動作します。最適な結果を得るために、それぞれのモードをいつ使用するかを理解することが不可欠です。
テキストから動画 (T2V)
- 入力メディア不要
- テキストプロンプトのみから生成
- FL2VAモデルを使用
- 迅速なコンセプトテストに最適
画像から動画 (I2V)
- 最初や最後のフレームを制御
- オプションでキーフレームを入力
- FL2VAモデルを使用
- 静止画をアニメーション化するのに最適
参照から動画 (R2V)
- 最大9枚の画像、3つの動画、3つのオーディオクリップ
- キャラクターのアイデンティティとスタイルを固定
- Ref2VAモデルを使用
- 一貫したキャラクター制作に最適
モード比較表
| 機能 | テキストから動画 | 画像から動画 | 参照から動画 |
|---|---|---|---|
| モデルウェイト | FL2VA | FL2VA | Ref2VA |
| 最大参照画像数 | 0 | 2(最初/最後) | 9 |
| 最大参照動画数 | 0 | 0 | 3 |
| 単体オーディオ入力数 | 0 | 0 | 3 |
| ネイティブオーディオ出力 | あり | あり | あり |
| 最適なユースケース | コンセプト探索 | キーフレームアニメーション | キャラクターの整合性 |
T2VおよびI2Vワークフローは同じFL2VAモデルウェイトを共有しています。R2Vは別のRef2VA拡散モデルを使用します。カスタムワークフローを構築する際は、モデルローダーグループに接続されたブールスイッチを使用して、それらを簡単に切り替えることができます。
インストールとセットアップ
ComfyUIでMiniMax H3を実行するには、互換性のあるバージョンに更新し、Hugging Faceから適切なモデルウェイトをダウンロードする必要があります。
ComfyUIの更新
ComfyUIのインストールをバージョン0.30.0以降に更新してください。以前のバージョンには、MiniMax H3のワークフローとノードのネイティブサポートがありません。
テンプレートライブラリへのアクセス
ComfyUIインターフェース内の「Template Library > Video」に移動します。目的の生成モードに一致するMiniMax H3のワークフローを選択します。
モデルのダウンロード
ポップアップの指示に従って、必要なモデルファイルを自動的にダウンロードします。モデルはHugging FaceのComfy-Org/MiniMax-H3リポジトリでホストされています。
解像度の設定
Resolution Selectorノードを使用して、出力の寸法を設定します。H3の解像度グリッドに合わせるため、倍数は32のままにします。16:9、9:16、1:1などのプリセットから選択できます。
生成の実行
入力を接続し、プロンプトを記述して、ワークフローを実行します。生成時間は、ハードウェア、解像度、参照の数によって異なります。
ハードウェアの推奨事項
| GPU階層 | 最小要件 | 推奨 | ハイエンド |
|---|---|---|---|
| GPU | RTX 3060 | RTX 4070 | RTX 3090/4090 |
| モデルバージョン | 枝刈りint8 | 標準 | 標準 |
| 推定生成時間(10秒) | 8〜12分 | 5〜7分 | 3〜5分 |
| 最大実用解像度 | 864x480 | 1080p | 1216x672+ |
RTX 3060などの8GB VRAMを搭載したユーザーの場合、枝刈りされたint8モデルが品質とパフォーマンスの最適なバランスを提供します。24GBのカード(RTX 3090/4090)を搭載したユーザーは、妥協することなく、より高い解像度でフル精度のモデルを実行できます。
プロンプト作成の戦略
MiniMax H3での効果的なプロンプト作成には、シーン、カメラの動き、オーディオのキューを1つのプロンプトブロック内で記述する構造化されたアプローチが必要です。このモデルは、複雑な複数文のプロンプトを効果的に処理します。
モード別のプロンプト構造
| モード | プロンプト構造 | 主な構文 |
|---|---|---|
| T2V | シーンの説明、ショットの内訳、カメラワーク、オーディオのキュー | プレーンテキスト |
| I2V | 動きの説明、トランジションのスタイル、オーディオ要素 | プレーンテキスト |
| 最初/最後のフレーム | 最初の画像から最後の画像へのトランジションを記述 | <Picture 0> および <Picture 1> タグ |
| R2V | 各参照に役割を明示的に割り当てる | <Picture 1>、<Video 1>、<Audio 1> タグ |
プロンプト作成のベストプラクティス
- シーン全体を最初に記述する:タイミングを指定したショットに分割する前に、場所、キャラクター、アクションを記述します
- オーディオの指示を含める:同じプロンプトブロック内でダイアログ、効果音、音楽を指定します
- R2Vで参照タグを使用する:接続順に従って各入力をタグで参照します(例:
<Picture 1>、<Video 1>) - 各参照に役割を割り当てる:どの参照がアイデンティティ、スタイル、動き、カメラ、または声を決定するかを明示的に記述します
- 最初/最後のフレームタグを活用する:モデルは開始フレームと終了フレームを自動的にマッピングしますが、
<Picture 0>と<Picture 1>を使用することは、R2Vワークフローのための良い習慣になります
継続時間の入力は、24fpsでモデルの17フレーム/ブロック(17k+5)のグリッドにスナップします。記載されている最大値は15秒ですが、テストによると20秒まで延長しても、出力が乱れることなく一貫した結果を生成できることが示されています。
Sage Attentionによる速度最適化
大規模な動画モデルをローカルで実行する場合、生成速度は重要な要素です。Sage Attentionは、品質の低下を最小限に抑えてパフォーマンスを大幅に向上させます。
SageAttentionのインストール
SageAttentionのリリースページから、お使いのPyTorchおよびCUDAバージョンに一致するPython wheelをダウンロードします。pip install <wheel-file>を使用してインストールします。
KJNodesのインストール
ComfyUI Managerを使用して、KJNodesカスタムノードパッケージをインストールします。または、リポジトリをComfyUI/custom_nodes/ディレクトリにクローンして、ComfyUIを再起動します。
パッチノードの追加
UNETLoaderノードとBasicGuiderノードの間にPatch Sage Attention KJノードを挿入します。sage_attentionパラメータをautoに設定します。
ワークフローの実行
いつも通りにワークフローを実行します。パッチが必要なのはガイダーのみです。スケジューラは変更されません。
Sage Attentionには、float16またはbfloat16テンソルが必要です。MiniMax H3は一部のレイヤーを他のdtypeで実行するため、「Input tensors must be in dtype of torch.float16 or torch.bfloat16, using pytorch attention instead」というメッセージが表示される場合があります。これは予期された動作であり、生成は正常に機能します。
最適化の比較
| 設定 | 標準のAttention | Sage Attention | グローバルフラグ |
|---|---|---|---|
| 速度 | ベースライン | 約2倍高速 | 約2倍高速 |
| 品質 | 完全な忠実度 | 最小限の低下 | 最小限の低下 |
| セットアップ | なし | ノードベース | --use-sage-attention |
| コンソール警告 | なし | 予想されるフォールバックメッセージ | 予想されるフォールバックメッセージ |
ワークフローのアーキテクチャとチェックリスト
ノードのアーキテクチャを理解することで、カスタムのMiniMax H3ワークフローを構築およびトラブルシューティングするのに役立ちます。ワークフローは、モデルローダー、コンディショニングノード、標準のKサンプラー、および出力設定で構成されています。
主要なノードコンポーネント
| コンポーネント | 機能 | 備考 |
|---|---|---|
| モデルローダー | FL2VAまたはRef2VAのウェイトをロード | 最初/最後用と参照用で別々のグループ |
| CLIPおよびVAE | テキストのエンコードとデコード | 両方のモデルタイプで共有 |
| RG3 Fast Group Bypass | アクティブなモデルグループを切り替え | 一度に1つのグループのみが実行されることを保証 |
| Resolution Selector | 幅と高さを計算 | 出力はH3ノードの入力に接続 |
| K Sampler | 標準のサンプリング | 特別な設定は不要 |
| Video Output | 最終的なMP4をレンダリング | GIF、フレーム補間をサポート |
デフォルトのワークフローでは限られた数の入力しか表示されませんが、システムはさらに多くの入力をサポートしています。入力ノードを複製してプロンプトタグを適切に更新することで、簡単に5〜6枚の画像に拡張したり、追加の動画やオーディオの参照を追加したりできます。
MiniMax H3 ComfyUI セットアップチェックリスト:
- ComfyUIをバージョン0.30.0以降に更新
- Hugging Face (Comfy-Org/MiniMax-H3) からモデルウェイトをダウンロード
- GPUに少なくとも8GBのVRAMがあることを確認 (RTX 3060+)
- モデルのロードに十分なシステムRAMがあることを確認
- 適切なモデルバリアントを選択 (低VRAM用には枝刈りint8)
- Resolution Selectorで解像度の倍数を32に設定
- より高速な生成のためにSage AttentionとKJNodesをインストール
- お住まいの地域のMiniMax H3ライセンス条項を確認
よくある質問
Q: ComfyUIでMiniMax H3を実行するにはどのようなGPUが必要ですか?
十分なシステムRAMを搭載したNVIDIA RTX 3060が最小要件です。最適なパフォーマンスを得るには、特に高い解像度で複数の参照入力を操作する場合、RTX 3090または4090を推奨します。枝刈りされたint8モデルバリアントは、VRAMが少ないカードで適切に機能します。
Q: MiniMax H3は動画と一緒にオーディオを生成できますか?
はい、MiniMax H3は、ダイアログ、効果音、音楽を含むネイティブステレオオーディオを、動画と一緒に1つのMP4ファイルとして生成します。また、R2Vモードで参照オーディオクリップを提供して、声をクローンしたり、特定のオーディオスタイルに合わせたりすることもできます。
Q: 参照から動画モードではいくつの参照入力を使用できますか?
R2Vは、最大9枚の参照画像、3つの参照動画(それぞれに専用のサウンドトラックを含む)、3つの単体参照オーディオクリップをサポートしています。これらの入力を組み合わせて、キャラクターのアイデンティティ、スタイル、動き、カメラワーク、声を固定できます。
Q: 15秒の最大動画継続時間を超えることは可能ですか?
公式の最大値は15秒ですが、テストによると長さを20秒に設定しても一貫した結果を生成できることが示されています。継続時間の入力は24fpsでモデルの17フレーム/ブロックのグリッドにスナップするため、継続時間は特定の増分パターンに従います。
Q: 1つのワークフローでテキストから動画と参照から動画を切り替えるにはどうすればよいですか?
RG3 Fast Group Bypassノードを使用して、一度に1つのモデルローダーグループのみがアクティブになるようにします。モデルローダーグループに設定されたラベルに基づくブールスイッチを使用すると、FL2VAとRef2VAのコンディショニングと潜在変数を簡単に切り替えることができます。