
HunyuanVideo-I2V
Tencent Hunyuan Team · 影片
HunyuanVideo-I2V 是騰訊的開源圖片轉影片模型,它取一張靜態圖片加上一段文字提示,把兩者變成一段短動畫。它建立在先前的 HunyuanVideo 文字轉影片系統之上,但把起點從文字描述換成真實圖片,因此第一格畫面永遠與你上傳的內容一致。這個模型以開放權重形式在 Hugging Face 發布,並附上推論程式碼與 LoRA 訓練腳本。也就是說,你自行執行它,而不必為每段短片付費。

關於 HunyuanVideo-I2V
什麼是 HunyuanVideo-I2V
HunyuanVideo-I2V 是騰訊 Hunyuan 團隊於 2025 年 3 月發布的圖片轉影片 AI 模型。它不像託管服務,而是一套讓你下載的模型家族:PyTorch 定義、預訓練權重與取樣程式碼,全部採用 Tencent Hunyuan Community License。它的吸引力在於掌控權。流程歸你所有,跑在硬體上的內容由你決定,也沒有人對你的生成次數計費。
它解決了一個具體問題。文字轉影片模型常常偏離你腦中的畫面,因為文字描述場景本來就不精確。從一張圖片起步就消除了這種模糊。輸出會保留你參考影格的被攝主體、光線與構圖,再疊加上動態。當你要讓產品照、人像或概念藝術動起來時,這一點很關鍵。
問題在硬體。這是個 130 億參數的模型,720p 流程需要大量 VRAM。社群回報指出實務門檻約在 45 到 60GB,而騰訊自家的指引則建議用 80GB 顯示卡才能跑得順。量化權重能降低門檻,但降不到筆電的等級。你有電競主機嗎?那還不夠。若沒有資料中心等級的 GPU,租用雲端算力會比買卡划算。
開始使用
- 複製官方 GitHub 儲存庫並建立 Python 環境,接著安裝 requirements.txt 中列出的相依項目。
- 從 Hugging Face(tencent/HunyuanVideo-I2V)下載模型權重到 ckpts 資料夾,或用 huggingface-cli 工具取得。
- 用你的參考圖片、描述想要動態的文字提示,以及你的解析度設定,執行提供的推論腳本。
- 等取樣流程跑完,檢查輸出的影片;若動態不如預期,調整提示或種子值。
- 若想要可重複使用的效果或風格,也可以選擇用自己的短片微調一個 LoRA。
產品資訊
快速了解 HunyuanVideo-I2V 的定價、支援平台與效能。
適合對象
這項工具最適合的使用者、任務與情境。
使用者
- AI 研究人員與 ML 工程師:完整的權重與程式碼讓你檢視並修改模型的運作方式,前提是你有執行它的 GPU 預算。
- 獨立動畫師與動態設計師:適合在沒有算圖農場的情況下,把概念藝術或關鍵影格變成動態鏡頭。720p 上限與 5 秒長度是實際限制。
- 打造影片功能的開發者:你可以把模型包在自己的 API 後面,但服務架構與授權條款得由你負責。
任務
- 讓靜態圖片動起來:輸入人像、產品照或寬闊風景照,並描述你想要的動態。模型會讓第一格畫面與你的輸入保持一致。
- 製作自訂影片效果:內附的 LoRA 訓練程式碼讓你教模型一種特定的視覺效果,之後可在多段短片中重複使用。
- 研究與效能評測:由於權重開放,你可以用自己的測試集,把它的動態品質與連貫性拿來和其他開源影片模型比較。
情境
- 把客戶的靜態樣稿變成提案影片:在投入完整製作流程前,快速展示概念上的動態效果。
- 為短場景做前期視覺化:生成幾秒動態,測試某個鏡頭構想在開拍前是否成立。
- 打造自架的影片工具:若你的團隊已有 GPU,又不能把素材送往第三方 API,本地模型能讓一切留在自家環境。
主要功能
圖片轉影片生成
核心工作很單純。你給它一張參考圖片與一段提示,它就回傳一段 720p、最多 129 格的短片,以 24fps 計算約五秒。模型以圖片為錨點,因此開頭影格與你提供的內容一致,而不是從頭重新詮釋你的文字描述。
首格畫面一致性
早期的開源影片模型有個壞毛病:一有動態就開始把你的主體變形。騰訊在 2025 年 3 月修掉了一個會導致身分改變的錯誤,更新後的權重對首格畫面的忠實度高得多。只要涉及可辨識的臉孔或品牌物件,這種一致性就是一切。它真的有效。這也是許多人轉而採用它的原因。
自訂效果的 LoRA 訓練
這次發布內含 LoRA 訓練腳本,讓你用自己的素材微調一個小型適配器。你可以教模型一種特定的動態或視覺風格並重複使用,不必重新訓練整個 130 億參數的模型。正是這項功能,把通用模型變成貼合你工作需求的工具。
透過 MLLM 編碼器的多模態理解
HunyuanVideo-I2V 採用純解碼器的多模態語言模型作為文字編碼器,而非慣用的 CLIP 加 T5 組合。簡單說,它會同時讀取你的圖片與提示並一起推理,這有助於它遵循關於什麼該動、該怎麼動的詳細指示。
多 GPU 平行推論
騰訊附上了由 xDiT 支援的平行推論程式碼,讓你能把單次生成分散到多張 GPU 上。它不會讓模型塞進更弱的硬體,但當你已經有多 GPU 機器、又有一批短片要算圖時,能縮短實際等待時間。單卡算圖太慢?接上兩張或四張,等待時間很快就會減少。
優缺點
優點
- 權重與程式碼完全開放,你可以執行、檢視並修改模型,不必為每次生成付費。
- 2025 年 3 月修正後首格畫面一致性很強,對臉孔與品牌物件尤其重要。
- 內含 LoRA 訓練腳本,讓你能打造自訂效果,而不必屈就制式選項。
- 支援 720p、最多 129 格的輸出,足以產出幾秒可用的素材。
- 平行推論程式碼能縮短多 GPU 機器的算圖時間。
缺點
- 這是個 130 億參數的模型,實務上 VRAM 門檻約在 45 到 60GB,消費級顯示卡即使量化也很吃力。
- 這個儲存庫沒有官方託管 API,意味著你得自行處理服務架構、擴充與穩定性。
- 短片長度上限約五秒,較長的序列需要拼接並仔細規劃提示。
- 安裝流程預設你熟悉 Python 環境、模型權重與命令列,這把非技術使用者排除在外。
常見問題
它從靜態圖片生成影片,並以輸入影格作為視覺錨點。典型用途包括讓概念藝術動起來、為產品照加入動態,以及產出供研究或前期視覺化的短片。
相關內容
探索與 HunyuanVideo-I2V 相關的工具、技能與文章。
HunyuanVideo-I2V 替代方案
Vadu AI
Vadu AI · 圖片 · 影片Vadu AI 是一款網頁式 AI 影片生成器,能把文字提示或靜態圖片變成短影片,也能自行生成圖片。你輸入想要的內容,挑選模型與風格,平台就會在幾分鐘內算好成品。免費方案足以應付輕度測試,付費方案則依你消耗的點數,每月從 9 美元到 77.40 美元不等。
Mykaraoke Video
MyKaraoke Video · 影片Mykaraoke Video 是一款線上卡拉 OK 影片與歌詞影片製作工具,能直接在瀏覽器裡把任何歌曲變成成品影片,歌詞也同步完成。它幫你處理最費時的部分。AI 會從混音中抽出人聲,並把歌詞對上節拍,接著讓你自訂背景、字型與顏色,最後匯出 1080p 的 MP4。如果你要為社群媒體、派對夜晚或音樂宣傳製作歌詞影片,它讓你完全省去安裝軟體與手動對時間的功夫。 想要一款不會吃掉你整個晚上的卡拉 OK 影片產生器嗎?這就是它的賣點。
Finalframe
Finalframe · 影片Finalframe 是一組免費的瀏覽器工具,用來從影片片段中抓出精確的影格。它最知名的功能「最後一格擷取工具」讓你擷取任何影片的最後一格,當作 Luma Dream Machine、Runway 或 Kling 等 AI 影片工具的起始圖片。想把片段接下去?那一格就是你的起點。這項工具在你的瀏覽器本機執行,不必註冊,也不收費。同一個團隊另一款付費的 AI 影片生成 App 目前下線中,正在重新打造。
