Janus Pro
DeepSeek · 圖片
Janus Pro 是 DeepSeek 推出的開源多模態 AI 模型,既能讀懂圖片,也能生成圖片。它運行在單一 Transformer 架構中,把理解與生成拆成兩條視覺路徑,因此同一個模型可以先描述一張照片,再依照文字提示畫出新的一張。7B 版本在 GenEval 的文字轉圖片基準測試中得分高於 DALL-E 3,權重以 MIT 授權釋出,你可以下載並在自己的硬體上執行。janusai.pro 的免費網頁版 Demo 讓你不用安裝任何東西就能試用這個多模態 AI 模型,它同時也是隨手可用的文字轉圖片生成器。

關於 Janus Pro
Janus Pro 是什麼
Janus Pro 是 DeepSeek 對 AI 領域一個難解問題的回應:多數模型不是看懂圖片,就是生成圖片,很少兩者都做得好。它的解法是把視覺編碼拆成兩條路徑,一條負責讀圖,一條負責產圖,同時保留單一 Transformer 處理全部工作。這個名字來自羅馬的雙面神,用在一个既看圖又畫圖的模型上相當貼切。
它建立在 DeepSeek 自家的語言模型之上,以 384x384 的解析度進行文字轉圖片生成。由於權重開放,你可以下載 1B 或 7B 版本,在本機執行,並用於商業用途而不必支付授權費。這一點讓它與只能透過 API 存取的閉源模型有所區別。
限制也同樣重要。以現代標準來看,輸出解析度偏低,所以生成圖片中的細節與小字可能顯得模糊。OCR 準確度也因同樣原因而不穩定。而且在本機執行 7B 模型需要夠水準的 GPU,輕量機器無法勝任。這算致命缺點嗎?對日常使用來說,不算。
開始使用
- 如果只是想試試,用瀏覽器打開 janusai.pro,然後選擇多模態理解或文字轉圖片分頁。
- 依你想進行的任務,上傳圖片或輸入提示,然後送出。
- 若要在本機使用,從 GitHub 複製 Janus 儲存庫,並架設含 PyTorch 的 Python 環境。
- 從 Hugging Face 把 Janus-Pro-1B 或 Janus-Pro-7B 權重下載到本機資料夾。
- 啟動 Demo 腳本,打開它印出的本機位址,然後離線執行你自己的提示。
產品資訊
快速了解 Janus Pro 的定價、支援平台與效能。
適合對象
這項工具最適合的使用者、任務與情境。
使用者
- AI 研究者:開放的權重與 MIT 授權,讓你容易近距離研究一個同時統合理解與生成的模型。
- 預算有限的開發者:在本機執行 1B 或 7B 可省下每次呼叫 API 的費用。你只需要自備 GPU。
- 對文字轉圖片生成好奇的玩家:免費網頁 Demo 讓你在決定本機安裝前先測試提示。
任務
- 圖片描述與視覺問答:問照片裡有什麼,取回一段文字答案。
- 文字轉圖片生成:把簡短提示變成一組圖片,並支援圖片中的簡單文字。
- 多模態實驗:把圖片與文字同時餵進一個模型,比較它如何處理各項任務。
情境
- 在沒有註冊託管 API 的情況下,先做出圖片功能的原型。
- 在下載好幾 GB 權重之前,先用免費線上 Demo 測試提示。
- 研究解耦的視覺編碼如何改變生成圖片的品質。
主要功能
統合的理解與生成
賣點是一個模型做兩份工作。Janus Pro 讀懂一張圖並回答相關問題,接著切換成依文字提示生成新圖片。多數開源模型只選一邊。DeepSeek 聲稱,拆分編碼讓它兩者兼顧,而不會出現硬要單一編碼器處理互相衝突任務時常見的效能損失。整個論點就是這個。
分離的視覺路徑
DeepSeek 讓理解與生成走不同的編碼器。圖片理解使用 384x384 的 SigLIP-L 視覺編碼器,生成則仰賴下採樣率為 16 的向量量化分詞器。該公司表示,把兩者分開正是修好舊款統合模型中角色衝突的關鍵。對你而言,這代表同一份下載能帶來更乾淨的描述與更穩定的圖片輸出。一個模型,兩份工作。
亮眼的基準測試成績
根據 DeepSeek 的說法,Janus-Pro-7B 在理解測試 MMBench 拿下 79.2,在文字轉圖片指令遵循基準 GenEval 拿下 0.80。這個 0.80 勝過 DALL-E 3 的 0.67 與 Stable Diffusion 3 Medium 的 0.74。基準測試的勝利在實務上未必等於更好的圖片,但它確實顯示這個模型足以與大得多、貴得多、而且你無法下載或檢視的閉源系統一較高下。
MIT 授權的開放權重
1B 與 7B 版本可從 Hugging Face 下載,程式碼儲存庫採 MIT 授權,允許商業使用。你可以在離線執行模型、微調它,或把它放進產品裡而不必事先取得許可。模型權重本身遵循 DeepSeek 自家的模型授權,所以在推出任何商業產品前請先讀過。
可在消費級硬體上執行
7B 模型可以跑在單張 VRAM 足夠的現代 GPU 上,1B 版本所需的資源更少。這讓本機部署對個人而言變得實際,而不只是實驗室的專利。社群外掛也把 Janus Pro 帶進 ComfyUI,讓你能把圖片描述與生成接上既有的工作流程。佔用小。成果實在。
免費線上 Demo
如果你不想安裝任何東西,janusai.pro 為這兩項任務提供瀏覽器 Demo。流量可能很大,它自己的頁面也註明有時會壅塞。這是在你為下載撥出硬碟空間之前,最快看出模型輸出風格是否合你口味的方式。免安裝。免註冊。
優缺點
優點
- 以單一模型同時處理圖片理解與文字轉圖片生成,這在開源釋出中相當少見。
- 可免費下載與執行,程式碼儲存庫採 MIT 授權,允許商業使用。
- 兩種尺寸意味著 1B 模型能在普通硬體上執行,而 7B 主攻品質。
- 公布的基準測試成績亮眼,在 GenEval 指令遵循上勝過 DALL-E 3。
- 免費網頁 Demo 讓你完全不需設定就能測試。
缺點
- 輸出上限為 384x384,所以生成的圖片與現代生成器相比顯得解析度偏低。
- 低解析度也傷及細節與 OCR,圖片中的小字往往無法辨讀。
- 在本機執行 7B 模型需要夠力的 GPU,而下載動輒好幾 GB。
- 沒有官方的託管 API,要大規模提供服務得靠自己。
常見問題
Janus Pro 涵蓋兩份工作:理解圖片,以及依文字生成圖片。你可以問它照片裡發生了什麼,或輸入提示取回圖片。它鎖定研究、原型開發,以及任何想要一個能自行執行的開源多模態 AI 模型的人。
相關內容
探索與 Janus Pro 相關的工具、技能與文章。
Janus Pro 替代方案
X Ray Interpreter
X-ray Interpreter · 圖片X Ray Interpreter 是一款以網頁為基礎的 AI 放射科工具,能把 X 光、電腦斷層、磁振造影、超音波與 PET 影像變成白話報告。你上傳一張掃描影像,片刻之間就得到初步的 X 光判讀結果,之後若有需要解釋的地方,還能繼續追問。它的定位是第二意見與學習輔助,而非醫療診斷。
Aieasypic
AIEasyPic · 圖片AIEasyPic 是一款 AI 圖片生成器,能在幾秒內把單純的文字提示變成完成的藝術作品。你也可以用自己照片訓練自訂模型、在現有圖片中替換臉部,並從文字建立短影片片段,全部都能在瀏覽器中完成。它適合想要快速視覺素材的休閒創作者,也適合想打造個人模型、又不想碰任何程式的業餘玩家。
Chargen
Chargen · 圖片Chargen 是一款 AI 角色生成器與世界觀建構工具,專為《龍與地下城》與其他桌上角色扮演遊戲打造。它能將一句構想變成手繪風格的肖像,在同一場工作階段中生出 NPC、怪物、地圖與遭遇,並把每隻生物的細節放在手邊。桌上角色扮演美術這部分靠一套名為 Gold 的點數系統運作,而文字生成器則對所有人保持免費。
