HunyuanImage 3.0

HunyuanImage 3.0

Tencent Hunyuan · 圖片 · 中國 AI

HunyuanImage 3.0 是騰訊開源的文字轉圖像 AI 模型,建立在 80 億參數規模的專家混合(Mixture-of-Experts)架構上,能把文字提示變成細節豐富、佈滿文字的圖像。它的過人之處,在於動筆前會先推理提示到底在講什麼,以及能在畫面裡渲染出可讀的文字,而非糊成一團的色塊。如果你想要一個能自己跑、能研究、也能透過 API 呼叫的圖像生成器,這算是目前開源選項裡最強的一款。

HunyuanImage 3.0 的介面預覽

關於 HunyuanImage 3.0

HunyuanImage 3.0 是什麼

HunyuanImage 3.0 是騰訊 Hunyuan 推出的原生多模態 AI 模型,把圖像理解與圖像生成統合在單一自迴歸框架內。大多數生成器是把語言模型硬接到另一個繪圖模型上,這款開源圖像生成器卻用同一組權重處理文字與圖像。這項設計選擇,就是它能針對請求推理、而不只是把關鍵字對應到像素的原因。

模型總參數約 80B,推論時每個 token 只會啟動約 13B,因此生成過程不必每一步都動用整個網路。騰訊把權重發布在 GitHub 與 Hugging Face 上,任何人都能下載、微調或部署,不必逐張付費。這正是重點。騰訊表示,發表時它是當時最大的開源圖像生成模型。

問題在硬體。它很吃資源。在本機跑完整模型需要相當可觀的 GPU 記憶體,所以多數一般使用者會走網頁版展示或付費 API,而不是自己家裡那台機器。

開始使用

  1. 在桌機瀏覽器開啟 Hunyuan 圖像頁面,用騰訊帳號登入,或直接使用模型 playground。
  2. 輸入描述你想要的圖像的提示。如果你的工具提供相關設定,可以指定尺寸、長寬比等參數。
  3. 若介面提供生成模式,挑一個。選項包括單純生成、先規劃版面的推理模式、提示改寫,以及幫你決定的自動模式。
  4. 檢視結果並調整提示。補上文字、構圖或風格的細節,然後重新生成,直到符合你心中所想。
  5. 若要程式化使用,到騰訊雲 TokenHub 主控台取得 API 金鑰,把請求送到 hy-image-v3 端點。

產品資訊

快速了解 HunyuanImage 3.0 的定價、支援平台與效能。

免費方案是
付費方案$0 - pay-per-call API pricing
平台Web (hunyuan.tencent.com), API via Tencent Cloud TokenHub, local deployment on NVIDIA GPU hardware
開發者Tencent Hunyuan
類別圖片 · 中國 AI
發布日期Sep 2025
最近更新Nov 2025
網站訪問量1.5M
網站全球排名N/A
API 提供狀態是

適合對象

這項工具最適合的使用者、任務與情境。

使用者

  • 想把圖像生成嵌進自家應用的開發者:開源權重加上同步 API,讓你能自架或呼叫雲端,不受單一供應商綁死。
  • 研究多模態模型的學者與學生:完整技術報告與程式碼都公開,可以深入了解自迴歸圖像生成怎麼運作。
  • 需要海報、插圖或含真實文字的漫畫的內容創作者:精準的文字渲染能處理多數生成器會搞砸的標題與說明文字。

任務

  • 生成含有可讀文字的圖像:比起擴散式對手,這個模型渲染短文字與長文句更可靠。
  • 把簡短模糊的提示變成完整場景:它的推理步驟會自行補齊版面與物件。
  • 從單一描述產出結構化視覺,例如多格漫畫或逐步說明圖。

情境

  • 架設私有圖像流程,讓提示與輸出永遠不離開自家伺服器。
  • prototyping 創意工具,並隨負載在本地推論與雲端 API 間切換。
  • 製作社群媒體封面與廣告 mockup,其中圖上文字的正確性很關鍵。

主要功能

世界知識推理

模型運用世界知識解讀提示,接著在決定像素前先規劃圖像。請它畫一篇解釋日食的漫畫,它會自己理出分鏡與順序,不必你逐格描述。完全不用手把手帶。這份推理能力,正是它與只會比對詞語的生成器之間的分野。

精準文字渲染

生成圖像裡的文字,是圖像 AI 最棘手的問題之一,而 HunyuanImage 3.0 處理小標籤與長段落文字都有罕見的準確度。這很少見。對海報、資訊圖表,以及任何帶標題的作品來說,意味著重新生成的次數更少、成品更乾淨。

開源權重與程式碼

騰訊在 GitHub 與 Hugging Face 發布了模型權重、推論程式碼,以及一份加速用的蒸餾版本,可免費商用與後續開發。你能檢視架構、用自己的資料微調,或嵌入離線應用。這種規模的參數還願意開放,相當少見。多數對手都把最強的模型藏在封閉 API 後面。

原生多模态架構

HunyuanImage 3.0 不是把語言模型縫到另一個圖像模型上,而是用單一網路處理文字、圖像與跨模态對齊。這讓它能在同一個框架內既理解參考圖像,又據此生成。

彈性的生成模式

幾種模式對應不同需求。單純圖像生成是最快的路徑,推理模式會先規劃構圖,改寫模式會重寫你的提示以取得更好結果,自動模式則幫你挑方法。尺寸預設涵蓋 1:1、4:3、16:9 等標準比例。挑一個就能上。

可精細控制的 API

Hy-Image-3.0 API 接受最多 8,192 字元的提示,並同步回傳圖像,因此沒有任務佇列要輪詢。你能自訂尺寸、固定 seed 以取得可重現的輸出,還能加上小小的浮水印註記,全都在單一請求內完成。夠簡單了。

優缺點

優點

  • 完全開放的權重讓你自架、稽核與微調,不必逐張付費。
  • 文字渲染與提示推理的表現,足以應付需要可讀文字的海報與漫畫。
  • 同步 API 一次呼叫就回傳結果,簡化了整合工作。
  • 免費網頁展示涵蓋一般用途,完全不需設定。
  • 除了文字提示外,也支援參考圖像以進行引導式生成。

缺點

  • 本機部署需要非常大的 GPU 記憶體,一般家用機器難以觸及。
  • 圖像編輯與多輪互動不在首發功能內,因此編輯工具落後於競品。
  • 目前最強的體驗偏向中文與騰訊自家場景。
  • 雲端 API 採用量計費,大量生成時費用會累積。

常見問題

可以。網頁展示免費,模型權重也開放商用與修改,不收授權費。若是透過騰訊雲 TokenHub API 呼叫,則按請求計費。