
HunyuanVideo-I2V
Tencent Hunyuan Team · 動画
HunyuanVideo-I2VはTencentのオープンソース画像から動画へのモデルで、1枚の静止画とテキストプロンプトを受け取り、短いアニメーションクリップに変換する。以前のHunyuanVideoテキストから動画へのシステムを土台にしているが、出発点を文章の記述から実際の画像に替えたため、最初のフレームは常にアップロードした内容と一致する。モデルはHugging Faceでオープンウェイトとして配布され、推論コードとLoRAトレーニングスクリプトも付属する。つまり、クリップごとに料金を払うのではなく、自分で動かすのだ。

HunyuanVideo-I2V について
HunyuanVideo-I2Vとは
HunyuanVideo-I2Vは、TencentのHunyuanチームが2025年3月に公開した画像から動画へのAIモデルだ。ホスティングサービスとは違い、ダウンロードするモデルファミリーである。PyTorchの定義、学習済みウェイト、サンプリングコードが揃い、すべてTencent Hunyuan Community Licenseの下にある。魅力は制御にある。パイプラインは自分のもので、ハードウェア上で何を動かすかも自分で決められ、生成回数を課金されることもない。
これは特定の問題を解決する。テキストから動画へのモデルは、思い描いた映像から外れがちだ。言葉で場面を表すのは曖昧だからである。画像から始めればその曖昧さが消える。出力は参照フレームの被写体、照明、構図を保ち、その上に動きを加える。製品写真、ポートレート、コンセプトアートを動かすとき、この点が効いてくる。
難点はハードウェアだ。130億パラメータのモデルで、720pのパイプラインは大量のVRAMを求める。コミュニティの報告では実用上の下限は45から60GBあたりで、Tencent自身のガイドは最も滑らかな実行に80GBのカードを挙げている。量子化ウェイトはその壁を下げるが、ノートPCの領域までは下がらない。ゲーミングPCがある? それでは足りない。データセンター向けのGPUがなければ、カードを買うよりクラウドの計算資源を借りたほうがいい。
はじめ方
- 公式のGitHubリポジトリをクローンしてPython環境を整え、requirements.txtに載っている依存関係をインストールする。
- Hugging Face(tencent/HunyuanVideo-I2V)からモデルウェイトをckptsフォルダにダウンロードするか、huggingface-cliツールで取得する。
- 参照画像、望む動きを書いたテキストプロンプト、解像度設定を指定して、付属の推論スクリプトを実行する。
- サンプリング処理が終わるのを待ち、出力された動画を確認する。動きが思い通りでなければプロンプトやシードを調整する。
- 繰り返し使いたい効果やスタイルがあれば、自分のクリップでLoRAを微調整してもよい。
AIツール情報
HunyuanVideo-I2Vの料金、対応プラットフォーム、性能を簡単に確認できます。
こんな人におすすめ
このツールが最も力を発揮するユーザー、タスク、シーン。
ユーザー
- AI研究者とMLエンジニア
- インディーアニメーターとモーションデザイナー
- 動画機能を作る開発者
タスク
- 静止画を動かす
- 独自の動画エフェクトを作る
- 研究とベンチマーク
シーン
- クライアントの静止モックアップを提案動画にする
- 短い場面のプリビズ
- 自前の動画ツールを作る
主な機能
画像から動画への生成
中心となる仕事は単純だ。参照画像とプロンプトを渡すと、720pで最大129フレーム、24fpsでおよそ5秒のクリップを返す。モデルは画像をアンカーに使うため、冒頭フレームは書いた説明を一から解釈し直すのではなく、渡した内容と一致する。
最初のフレームの一貫性
初期のオープン動画モデルには、動きが出た途端に被写体を変形させる厄介な癖があった。Tencentは2025年3月、身元が変わる不具合を修正し、更新されたウェイトは最初のフレームをはるかに忠実に保つ。見覚えのある顔やブランドの物体が関わるなら、この一貫性こそが肝心だ。実際に機能する。多くの人が乗り換えた理由もそこにある。
独自エフェクト向けのLoRAトレーニング
この公開にはLoRAトレーニングスクリプトが含まれ、自分の素材で小さなアダプタを微調整できる。特定の動きや視覚スタイルをモデルに教えて再利用でき、130億のモデル全体を再学習する必要はない。汎用モデルを自分の仕事向けに仕立てる機能だ。
MLLMエンコーダによるマルチモーダル理解
HunyuanVideo-I2Vは、通常のCLIPとT5の組み合わせではなく、デコーダのみのマルチモーダル言語モデルをテキストエンコーダに使う。平たく言えば、画像とプロンプトを一緒に読み、両者を同時に推論する。何がどう動くべきかという細かい指示に従いやすくなる。
マルチGPU並列推論
TencentはxDiTに支えられた並列推論コードを同梱し、1回の生成を複数のGPUに分散できる。弱いハードウェアにモデルが収まるようにはならないが、マルチGPUマシンとレンダリングするクリップの束がすでにあるなら、実時間を短縮できる。1枚でのレンダリングが遅い? 2枚か4枚つなげば待ち時間はすぐ縮む。
メリットとデメリット
メリット
- ウェイトとコードが完全にオープンで、生成ごとに料金を払わずに実行、調査、変更できる。
- 2025年3月の修正後は最初のフレームの一貫性が強く、顔やブランドの物体で効いてくる。
- LoRAトレーニングスクリプトが付属し、既製のものに甘んじず独自エフェクトを作れる。
- 720pで最大129フレームの出力に対応し、使える数秒の素材には十分だ。
- 並列推論コードが複数GPUマシンでのレンダリング時間を短縮する。
デメリット
- 130億のモデルで、実用上のVRAM下限は45から60GBあたり。量子化してもコンシューマー向けカードでは厳しい。
- このリポジトリに紐づく公式のホスティングAPIはなく、配信基盤、スケーリング、稼働率は自分で担う。
- クリップは5秒前後が上限なので、長いシーケンスはつなぎ合わせと丁寧なプロンプト設計が要る。
- セットアップはPython環境、モデルウェイト、コマンドラインの扱いに慣れている前提で、非技術者には向かない。
よくある質問
静止画から動画を生成し、入力フレームを視覚的なアンカーとして保つ。典型的な用途は、コンセプトアートを動かす、製品写真に動きを足す、研究やプリビズ用の短いクリップを作る、といったものだ。
関連コンテンツ
HunyuanVideo-I2Vに関連するツール、スキル、記事を探す。
HunyuanVideo-I2Vの代替ツール
Vadu AI
Vadu AI · 画像 · 動画Vadu AIは、書いたプロンプトや静止画を短いクリップに変えるウェブベースのAI動画ジェネレーターで、単体で画像を生成することもできる。作りたい内容を打ち込み、モデルとスタイルを選べば、プラットフォームが数分で結果を書き出す。無料プランは軽い試し書きをまかなえる範囲で、有料プランは消費するクレジットに応じて月9ドルから77.40ドルまで幅がある。
Mykaraoke Video
MyKaraoke Video · 動画Mykaraoke Videoは、オンラインで使えるカラオケ動画・歌詞動画メーカーだ。どんな曲でも、ブラウザ上で歌詞を同期した完成動画に変える。面倒な部分を代わりに処理してくれる。AIがミックスからボーカルを抜き出し、歌詞をビートに合わせ、その後で背景やフォント、色をカスタマイズしてから1080pのMP4で書き出せる。SNS向け、パーティー用、音楽プロモーション用に歌詞動画を作るなら、ソフトのインストールも手作業のタイミング合わせも丸ごと省ける。 一晩を丸ごと奪わないカラオケ動画ジェネレーターが欲しい?それがこのツールの売りだ。
Finalframe
Finalframe · 動画Finalframeは、動画クリップから正確なフレームを取り出すための無料ブラウザツール群だ。最も有名な機能である「最後のフレーム抽出」では、あらゆる動画の最後のフレームを取り出し、Luma Dream Machine、Runway、KlingといったAI動画ツールの開始画像として使える。クリップを続けたいなら、その最後のフレームが起点になる。ツールは自分のブラウザ上で動き、登録も費用も不要だ。同じチームによる別の有料AI動画生成アプリは、作り直しのため現在オフラインだ。
