Janus Pro

Janus Pro

DeepSeek · 圖片

Janus Pro 是 DeepSeek 推出的開源多模態 AI 模型,既能讀懂圖片,也能生成圖片。它運行在單一 Transformer 架構中,把理解與生成拆成兩條視覺路徑,因此同一個模型可以先描述一張照片,再依照文字提示畫出新的一張。7B 版本在 GenEval 的文字轉圖片基準測試中得分高於 DALL-E 3,權重以 MIT 授權釋出,你可以下載並在自己的硬體上執行。janusai.pro 的免費網頁版 Demo 讓你不用安裝任何東西就能試用這個多模態 AI 模型,它同時也是隨手可用的文字轉圖片生成器。

Janus Pro 的介面預覽

關於 Janus Pro

Janus Pro 是什麼

Janus Pro 是 DeepSeek 對 AI 領域一個難解問題的回應:多數模型不是看懂圖片,就是生成圖片,很少兩者都做得好。它的解法是把視覺編碼拆成兩條路徑,一條負責讀圖,一條負責產圖,同時保留單一 Transformer 處理全部工作。這個名字來自羅馬的雙面神,用在一个既看圖又畫圖的模型上相當貼切。

它建立在 DeepSeek 自家的語言模型之上,以 384x384 的解析度進行文字轉圖片生成。由於權重開放,你可以下載 1B 或 7B 版本,在本機執行,並用於商業用途而不必支付授權費。這一點讓它與只能透過 API 存取的閉源模型有所區別。

限制也同樣重要。以現代標準來看,輸出解析度偏低,所以生成圖片中的細節與小字可能顯得模糊。OCR 準確度也因同樣原因而不穩定。而且在本機執行 7B 模型需要夠水準的 GPU,輕量機器無法勝任。這算致命缺點嗎?對日常使用來說,不算。

開始使用

  1. 如果只是想試試,用瀏覽器打開 janusai.pro,然後選擇多模態理解或文字轉圖片分頁。
  2. 依你想進行的任務,上傳圖片或輸入提示,然後送出。
  3. 若要在本機使用,從 GitHub 複製 Janus 儲存庫,並架設含 PyTorch 的 Python 環境。
  4. 從 Hugging Face 把 Janus-Pro-1B 或 Janus-Pro-7B 權重下載到本機資料夾。
  5. 啟動 Demo 腳本,打開它印出的本機位址,然後離線執行你自己的提示。

產品資訊

快速了解 Janus Pro 的定價、支援平台與效能。

免費方案是
付費方案$0
平台Web, Windows, macOS, Linux
開發者DeepSeek
類別圖片
發布日期Jan 2025
最近更新Feb 2025
網站訪問量30K
網站全球排名1M
API 提供狀態N/A

適合對象

這項工具最適合的使用者、任務與情境。

使用者

  • AI 研究者:開放的權重與 MIT 授權,讓你容易近距離研究一個同時統合理解與生成的模型。
  • 預算有限的開發者:在本機執行 1B 或 7B 可省下每次呼叫 API 的費用。你只需要自備 GPU。
  • 對文字轉圖片生成好奇的玩家:免費網頁 Demo 讓你在決定本機安裝前先測試提示。

任務

  • 圖片描述與視覺問答:問照片裡有什麼,取回一段文字答案。
  • 文字轉圖片生成:把簡短提示變成一組圖片,並支援圖片中的簡單文字。
  • 多模態實驗:把圖片與文字同時餵進一個模型,比較它如何處理各項任務。

情境

  • 在沒有註冊託管 API 的情況下,先做出圖片功能的原型。
  • 在下載好幾 GB 權重之前,先用免費線上 Demo 測試提示。
  • 研究解耦的視覺編碼如何改變生成圖片的品質。

主要功能

統合的理解與生成

賣點是一個模型做兩份工作。Janus Pro 讀懂一張圖並回答相關問題,接著切換成依文字提示生成新圖片。多數開源模型只選一邊。DeepSeek 聲稱,拆分編碼讓它兩者兼顧,而不會出現硬要單一編碼器處理互相衝突任務時常見的效能損失。整個論點就是這個。

分離的視覺路徑

DeepSeek 讓理解與生成走不同的編碼器。圖片理解使用 384x384 的 SigLIP-L 視覺編碼器,生成則仰賴下採樣率為 16 的向量量化分詞器。該公司表示,把兩者分開正是修好舊款統合模型中角色衝突的關鍵。對你而言,這代表同一份下載能帶來更乾淨的描述與更穩定的圖片輸出。一個模型,兩份工作。

亮眼的基準測試成績

根據 DeepSeek 的說法,Janus-Pro-7B 在理解測試 MMBench 拿下 79.2,在文字轉圖片指令遵循基準 GenEval 拿下 0.80。這個 0.80 勝過 DALL-E 3 的 0.67 與 Stable Diffusion 3 Medium 的 0.74。基準測試的勝利在實務上未必等於更好的圖片,但它確實顯示這個模型足以與大得多、貴得多、而且你無法下載或檢視的閉源系統一較高下。

MIT 授權的開放權重

1B 與 7B 版本可從 Hugging Face 下載,程式碼儲存庫採 MIT 授權,允許商業使用。你可以在離線執行模型、微調它,或把它放進產品裡而不必事先取得許可。模型權重本身遵循 DeepSeek 自家的模型授權,所以在推出任何商業產品前請先讀過。

可在消費級硬體上執行

7B 模型可以跑在單張 VRAM 足夠的現代 GPU 上,1B 版本所需的資源更少。這讓本機部署對個人而言變得實際,而不只是實驗室的專利。社群外掛也把 Janus Pro 帶進 ComfyUI,讓你能把圖片描述與生成接上既有的工作流程。佔用小。成果實在。

免費線上 Demo

如果你不想安裝任何東西,janusai.pro 為這兩項任務提供瀏覽器 Demo。流量可能很大,它自己的頁面也註明有時會壅塞。這是在你為下載撥出硬碟空間之前,最快看出模型輸出風格是否合你口味的方式。免安裝。免註冊。

優缺點

優點

  • 以單一模型同時處理圖片理解與文字轉圖片生成,這在開源釋出中相當少見。
  • 可免費下載與執行,程式碼儲存庫採 MIT 授權,允許商業使用。
  • 兩種尺寸意味著 1B 模型能在普通硬體上執行,而 7B 主攻品質。
  • 公布的基準測試成績亮眼,在 GenEval 指令遵循上勝過 DALL-E 3。
  • 免費網頁 Demo 讓你完全不需設定就能測試。

缺點

  • 輸出上限為 384x384,所以生成的圖片與現代生成器相比顯得解析度偏低。
  • 低解析度也傷及細節與 OCR,圖片中的小字往往無法辨讀。
  • 在本機執行 7B 模型需要夠力的 GPU,而下載動輒好幾 GB。
  • 沒有官方的託管 API,要大規模提供服務得靠自己。

常見問題

Janus Pro 涵蓋兩份工作:理解圖片,以及依文字生成圖片。你可以問它照片裡發生了什麼,或輸入提示取回圖片。它鎖定研究、原型開發,以及任何想要一個能自行執行的開源多模態 AI 模型的人。