- ComfyUIでのMiniMax H3: モジュール式でカスタマイズ可能なノードワークフローを使用して、AI動画モデルをローカルで実行できます
- ハードウェアのベースライン: 安定した生成を行うために、NVIDIA RTX 3060以上と十分なシステムRAMが必要です
- 複数の入力モード: テキストから動画、最初と最後のフレーム、および複数の参照画像/動画入力をサポートしています
- 音声生成: モデルは同期した音声、ボイスクローニング、およびBGMを生成できます
- ライセンス要件: 米国およびEUのユーザーは、ダウンロード前にライセンスフォームからアクセスをリクエストする必要があります
MiniMax H3 ComfyUI 概要
ComfyUIでMiniMax H3を実行すると、AI動画生成を完全にローカルで制御できるようになります。クラウドAPIに依存する代わりに、テキストプロンプト、画像、参照動画をすべて自分のハードウェア上で処理するモジュール式のノードベースワークフローを構築できます。このモデルは、複雑なプロンプト、複数画像の参照、音声合成、さらにはボイスクローニングも処理できます。
動画のハイライト:
- pruned int8モデルを使用した864x480解像度でのテキストから動画の生成
- 動画の遷移を制御するための最初と最後のフレームの画像入力
- 最大4つの画像、動画クリップ、オーディオトラックを組み合わせた複数参照入力
- 2つの異なる動画ソースからの音声を合成してのボイスクローニング
- モデルの切り替えを容易にするRG3 fast group bypassノードを使用したワークフローアーキテクチャ
ComfyUIをMiniMax H3に使用する最大の利点は柔軟性です。シンプルなブールスイッチを使用して、最初と最後のフレームモデルと参照モデルを切り替えることができます。Kサンプラーと動画出力ノードは標準的なComfyUIの規則に従っているため、ワークフローの変更や拡張が容易です。
NVIDIA RTX 3090ユーザーの場合、pruned int8モデル(FL2va)は品質とパフォーマンスの優れたバランスを提供します。3060または3070をお持ちの場合でも、十分なシステムRAMがあれば、ComfyUIの最適化によりワークロードを処理できます。
ハードウェア要件とモデルバリエーション
MiniMax H3は、コンシューマー向けのNVIDIA GPUで実行されるように設計されています。ComfyUIはRTX 3060以上をサポートしていることを確認していますが、ハードウェアのグレードによって生成時間は大きく異なります。
| GPUモデル | 最小RAM | 期待されるパフォーマンス | 推奨モデル |
|---|---|---|---|
| RTX 3060 | 32GBシステム | 生成が遅い、基本解像度 | Pruned int8 |
| RTX 3070/3080 | 32GBシステム | 中程度の速度、標準解像度 | Pruned int8 |
| RTX 3090/4090 | 64GBシステム | 高速生成、高解像度 | Pruned int8またはフル |
生成時間は入力の複雑さに大きく依存します。864x480のシンプルなテキストから動画のプロンプトはすぐに完了する場合がありますが、動画や音声入力を含む複数参照ワークフローは、RTX 3090でも5分以上かかる場合があります。
モデルは公式に最大15秒の動画をサポートしています。ただし、テストでは、20秒にプッシュしても、乱れた結果になることなく、一貫した出力を生成できることが示されています。これは保証ではなく、実験的なものとして扱ってください。
入力モードと生成機能
MiniMax H3は、それぞれ異なるクリエイティブな目標に適した、いくつかの異なる入力モードを提供しています。各モードをいつ使用するかを理解することで、最良の結果を得ることができます。
テキストから動画
- 入力画像は不要
- 複雑で詳細なプロンプトを処理
- 純粋なクリエイティブな生成に最適
- イラスト風およびリアルなスタイルをサポート
最初と最後のフレーム
- 開始フレームと終了フレームを定義
- プロンプトで遷移スタイルを制御
- picture zeroとpicture oneタグを使用
- 動画は常に指定された画像から始まり、終わる
参照モデル
- 複数の画像と動画を受け入れる
- 画像は正確なフレームではなく、外観のガイドとして機能
- 最大6つ以上の組み合わせ入力をサポート
- ボイスクローニングと音声のマージを可能にする
解像度オプション
ワークフローには、利用可能なすべての出力サイズの参照プレビューを備えた解像度セレクターが含まれています。
| 解像度 | アスペクト比 | 使用例 | 備考 |
|---|---|---|---|
| 864x480 | 16:9 | 標準動画 | 最速の生成時間 |
| 1216x672 | 16:9 | 高品質 | 処理時間は長いが、より鮮明な詳細 |
| カスタム | 各種 | 特別なフォーマット | conditioningノードで幅/高さを調整 |
MiniMax H3は動画と同時に同期した音声を生成します。BGM、キャラクターのダイアログ、さらには参照動画クリップから声をクローニングすることもできます。別々のオーディオトラックを持つ2つの入力動画を使用する場合、モデルは両方の声を新しく生成されたシーンにマージできます。
ステップバイステップのワークフロー設定
ComfyUIでMiniMax H3ワークフローを構築するには、モデルローダー、conditioningノード、入力セレクターを慎重に整理する必要があります。以下の手順に従って、機能的なワークフローを作成してください。
モデルを読み込む
MiniMax H3モデルファイル(pruned int8 FL2vaなど)をComfyUIのmodelsディレクトリに配置します。最初と最後のフレームバージョン、または参照動画バージョンのいずれか専用のモデルローダーノードを使用します。どちらも同じCLIPおよびVAEモデルを必要とします。
RG3バイパスを設定する
RG3 fast group bypassノードを追加して、一度に1つのモデルグループのみがアクティブになるようにします。このノードはトグルとして機能し、最初と最後のフレームのconditioningと参照動画のconditioning間の競合を防ぎます。
conditioningを設定する
最初と最後のフレームモードの場合、最初と最後のフレーム画像を、プロンプトテキスト、幅、高さ、動画の長さのパラメータとともにconditioningノードに接続します。参照モードの場合、すべての画像、動画、音声入力をreference-to-videoノードに接続します。
Kサンプラーを設定する
標準のKサンプラーノードを使用します。通常のsteps、CFG、denoise設定以外に特別な設定は必要ありません。サンプラーは、どちらかのモデルパスからのconditioningされた潜在表現を処理します。
出力オプションを設定する
お好みのプレフィックスとフォーマットで動画出力ノードを設定します。オプションにはMP4やアニメーションGIFが含まれます。後でFILMまたはRIFEモデルを使用してフレーム補間を行う予定の場合は、最終的な画像と音声を個別に保存してください。
モデルローダーグループに設定されたラベルにリンクされたブールスイッチを使用します。これにより、最初と最後のフレームモデルと参照モデルを切り替える際に、正しいconditioningと潜在表現がパイプラインに送信されます。
プロンプトのテクニックと参照インデックス
MiniMax H3ワークフローでの効果的なプロンプト作成には、モデルが画像や動画の参照をどのように解釈するかを理解する必要があります。参照モデルは、山括弧インデックスを使用して異なる入力ソースを識別します。
プロンプトの参照構文
| 構文 | 目的 | 使用例 |
|---|---|---|
| [picture zero] | 最初の画像入力を参照 | キャラクターの外観ガイドとして使用 |
| [picture one] | 2番目の画像入力を参照 | サブキャラクターやオブジェクトに使用 |
| [video zero] | 最初の動画入力を参照 | モーションやシーンの参照として使用 |
| [video one] | 2番目の動画入力を参照 | 遷移ターゲットやスタイルに使用 |
| [audio zero] | 音声のみの入力を参照 | 音声や音楽のガイドとして使用 |
インデックスシステムは柔軟です。好みに応じてゼロまたはoneから始めることができます。モデルは厳密な番号付けを強制しませんが、単一のワークフロー内では一貫性を保つことをお勧めします。
最初と最後のフレーム画像を使用する場合、2つの画像の間で何が起こるかを説明する変換プロンプトを記述します。最初の方にpicture zeroを記載し、最後の方にpicture oneを記載します。プロンプトの内容に関わらず、モデルは常に指定されたフレームから始まり、終わりますが、プロンプトが遷移がいつどのように発生するかを決定します。
高度な複数入力の例
参照モデルは、入力の複雑な組み合わせを処理できます。テストされた構成の1つでは、異なるスタイルとサイズの4つの入力画像、1つの動画クリップ、およびその動画からの音声を使用し、合計6つの異なる入力としました。プロンプトは、部屋に4人のキャラクターを作成し、最終的な動画クリップが鏡を通して見ているかのように表示されて終わるようモデルに指示しました。
参照モードでは、画像は正確な開始または終了フレームとしてではなく、外観のガイドとして機能します。モデルはそれらを使用してキャラクターやオブジェクトがどのように見えるかを決定しますが、生成された動画は必ずしもそれらの画像から始まったり、終わったりするわけではありません。これは、指定された画像が開始と終了として保証されている最初と最後のフレームモードとは異なります。
ライセンスとポストプロセッシング
ライセンスの考慮事項
MiniMax H3のライセンスは現在、米国と欧州連合でのダウンロードを制限しています。ただし、個人はライセンスリクエストフォームを送信することでアクセスをリクエストできます。2026年現在のユーザーレポートに基づくと、送信後すぐに承認メールが届きます。
このガイドは法的助言を構成するものではありません。ライセンス条項は時間の経過とともに変更される場合があります。モデルをダウンロードして使用する前に、必ず公式のライセンス契約を読み、独自の調査を行ってください。商用利用には追加の制限が適用される場合があります。
フレーム補間
動画を生成した後、ComfyUIで利用可能なフレーム補間モデルを使用して、滑らかさを向上させることができます。
| 補間モデル | 出力FPS | 倍率 | 品質 |
|---|---|---|---|
| FILM | 48 fps | 2x | 滑らかで自然な動き |
| RIFE | 48 fps | 2x | シャープで詳細なフレーム |
| RIFE | 72 fps | 3x | 非常に滑らか、処理時間は長い |
生成前チェックリスト:
- 選択した解像度に対してGPUに十分なVRAMがあることを確認する
- 両方のモデルパスに対してCLIPおよびVAEモデルが読み込まれていることを確認する
- RG3バイパスのトグルがモデル間で正しく切り替わるかテストする
- ポストプロセッシングのために最終的な画像と音声を個別に保存する
- 動画の出力形式が意図した使用法と一致しているか確認する
FAQ
Q: ComfyUIでMiniMax H3を実行するにはどのようなGPUが必要ですか?
ComfyUIはNVIDIA RTX 3060以上のサポートを確認しています。GPUとともに十分なシステムRAMが必要です。64GBのシステムRAMを搭載したRTX 3090は高速な生成時間を提供しますが、32GBのRAMを搭載した3060でも標準解像度で結果を生成できます。
Q: MiniMax H3は動画と一緒に音声を生成できますか?
はい。このモデルはBGM、ダイアログ、効果音を含む同期した音声を生成します。また、参照動画クリップからのオーディオトラックを使用したボイスクローニングもサポートしています。2つの異なる動画からの音声を1つの新しいシーンにマージできます。
Q: MiniMax H3の最大動画長はどれくらいですか?
公式の最大値は15秒です。ただし、テストでは、20秒にプッシュしても、一貫した出力を生成できることが示されています。プロンプトの複雑さと入力タイプに応じて結果が異なる場合があるため、15秒を超える場合は実験的として扱う必要があります。
Q: 1つのワークフローで最初と最後のフレームと参照モデルを切り替えるにはどうすればよいですか?
RG3 fast group bypassノードを使用して、一度に1つのモデルグループのみがアクティブになるようにします。モデルローダーグループに設定されたラベルにリンクされたブールスイッチを追加します。これにより、選択したモデルに基づいて、正しいconditioningと潜在表現がパイプラインを通じてルーティングされます。
Q: 3つ以上の参照画像を使用できますか?
はい。参照モデルは複数の画像、動画、音声のみの入力をサポートしています。テストされた構成には、音声付きの動画1つに4つの画像を加えた、合計6つの入力が含まれます。ワークフローに追加の入力ノードを追加することで、5〜6枚の画像への拡張は簡単です。