LiveAvatar by HeyGen

LiveAvatar by HeyGen

HeyGen · 圖片 · 語音與語言

HeyGen 的 LiveAvatar 是一款即時虛擬人 API,用來打造會用一張臉回應的 AI 代理。你送出音訊或文字,平台就回傳一段同步的影片串流,畫面中是栩栩如生的數位人物,嘴型與表情都能對上。開發者用它把會說話的虛擬人放進銷售展示、支援櫃檯、語言家教與虛擬主持人,通常不必自己重建語音與串流架構。聽起來不錯吧?但那要看你手邊有沒有開發者。

LiveAvatar by HeyGen 的介面預覽

關於 LiveAvatar by HeyGen

什麼是 HeyGen 的 LiveAvatar

LiveAvatar 是 HeyGen 旗下面向開發者的產品。它給 AI 代理一張臉和一副嗓子,透過直播串流送出 1080p 的虛擬人影片,讓人們對著螢幕對話,而不是讀一整面文字牆。這家公司主打的是規模,說法很簡單:一場工作階段,或是一萬場同時跑。串流費率在最高用量級距會降到每分鐘 0.01 美元,而額外的並行工作階段不收費。

核心的建構單位是工作階段。它背後是一組可重複使用的元件:虛擬人(視覺身分)、聲音(聽覺身分)、情境(知識與個性)與記憶(跨工作階段的連續性)。你把這些接起來,再把結果串流進自己的網站或 App。這部分很簡單。

主要的限制在於對象。這是 API 產品,不是點幾下就能用的編輯器。你需要一位開發者來產生工作階段權杖、啟動工作階段,並連上一個即時房間,通常得透過 LiveKit。如果你只想要一段現成的說話頭像影片,一般的 HeyGen 訂閱會更合適。LiveAvatar 是為即時互動對話而打造,這點在設定階段就看得出來。

開始使用

  1. 在 app.liveavatar.com 註冊,並從開發者頁面取得 API 金鑰。
  2. 在你的後端建立一個工作階段權杖。權杖會設定虛擬人、聲音、情境與工作階段設定。
  3. 用該權杖啟動工作階段,會回傳一個直播房間網址與一個用戶端權杖。
  4. 從瀏覽器或用前端搭配 Web SDK 加入房間,就能看到虛擬人串流。
  5. 如果想在不花點數的情況下試做整合,先以沙盒模式測試。

產品資訊

快速了解 LiveAvatar by HeyGen 的定價、支援平台與效能。

免費方案否
付費方案$0.01 - $0.10/min
平台Web, API
開發者HeyGen
類別圖片 · 語音與語言
發布日期Jan 2025
最近更新Sep 2025
網站訪問量104.5K
網站全球排名348.1K
API 提供狀態是

適合對象

這項工具最適合的使用者、任務與情境。

使用者

  • 打造對話介面的開發者:你拿到的是工作階段 API 與 Web SDK,不必自己拼湊語音活動偵測、語音轉文字與文字轉語音,附帶條件是得有後端能力。
  • 產品與支援團隊:一個出現在畫面上的虛擬人代理,看起來比聊天視窗更有存在感。團隊裡還是得有人負責整合。
  • 語言學習與家教新創:虛擬人能進行即時的口說練習,而情境與記憶元件讓它能跨工作階段持續追蹤學習者。

任務

  • 進行即時產品展示:虛擬人在同一段串流裡解說功能並回答口頭提問,很適合展攤、新手導引與虛擬銷售助理。
  • 值勤 AI 支援櫃檯:FULL 模式在一套流程中處理語音偵測、轉錄、語言模型與語音,所以你大致只需提供情境與外觀。
  • 主持互動角色:家教、講者與 NPC 式的主持人能即時開口與反應,而不是播放預錄片段。

情境

  • 讓即時助理同時服務大量使用者:無限並行加上額外工作階段 0 元加價,意味著上市當天的爆量不需要重新設計架構。
  • 把虛擬人嵌入既有的網頁產品:Embed 模式著重於快速嵌進頁面,FULL 與 LITE 模式則涵蓋較重的建置。
  • 在正式投入前先做原型:沙盒模式讓你在不燒點數的情況下測試整合,同時摸索正確的模式。

主要功能

即時 1080p 虛擬人串流

LiveAvatar 會渲染出 Full HD 的虛擬人並即時串流,首帧中位數時間低於 300 毫秒。這個延遲正是產品的重點:回應要快到像一場對話。這家公司也提到 99.99% 的 API 上線率,那是虛擬人一旦面對客戶就會顯得重要的數字。這個上線率可不是小事。

完整模式流程

FULL 模式替你包辦整條即時鏈路。它執行語音活動偵測來察覺使用者何時開口,轉錄音訊,用語言模型產生回應,把回應變成語音,再驅動虛擬人影片。你不必再做平常那件苦差事,去協調各家供應商與它們各自的串流怪癖。對沒有即時技術專家的團隊來說,這是捷徑。

多種整合模式

你不會被綁在一條建置路徑上。Embed 模式用最少的程式碼把虛擬人放上頁面。FULL 模式交出整套流程,LITE 模式則把更多架構留在你手上。怎麼選取決於你想對模型與延遲掌握多少。給程式助理用的 Agent Skills 會帶你挑一個並實作。這個決定由你來做。

可重複使用的虛擬人元件

虛擬人、聲音、情境與記憶只需定義一次,就能跨工作階段重複使用。你設定視覺身分、聽覺身分、回應背後的知識與個性,以及代理在對話之間記得多少。記憶正是讓家教能從上一堂課結束處接續,而不是把每個人都當陌生人打招呼的關鍵。

情境與個性控制

情境裡放的是虛擬人取用的知識與語氣。你把角色寫一次,之後虛擬人出現在哪裡都重複使用,因此支援代理在網站、App 與展示中聽起來都一致。這樣你就能在不必為每個介面重寫提示詞的情況下,維持一致的品牌聲音。

安全的第三方整合

一套機密系統負責管理 API 金鑰,並連接外部供應商,而不必把憑證寫死在你的前端裡。如果你的虛擬人需要即時資料來源或外部服務,你把連線存在伺服器端,讓平台代為中介。這樣金鑰就不會留在瀏覽器裡,否則就會外洩。

擴充不受並行懲罰

額外的並行工作階段不加價,而每分鐘串流費率在最高用量級距會降到 0.01 美元。單場展示與一千名同時使用者跑的是同一套定價邏輯。這種可預測性在影片領域很罕見,因為那裡串流一多,通常就代表成本更高、基礎設施的活也更多。

優缺點

優點

  • 首帧時間低(中位數低於 300 毫秒),讓對話感覺即時而不卡頓。
  • 無限並行且額外工作階段不加價,讓突如其來的流量尖峰更容易吸收。
  • FULL 模式免去自己接上語音辨識、語言模型與文字轉語音的需要。
  • 可重複使用的虛擬人、聲音、情境與記憶,減少跨工作階段與介面的重複設定。
  • 即時虛擬人 API 的定價在高用量下可降到每分鐘 0.01 美元,成本隨用量走。

缺點

  • 沒有免費方案,所以任何超出沙盒模式的實際測試都有成本。
  • 這是開發者產品,代表非技術團隊想出貨就得靠工程協助。
  • LiveKit 是建議設定的核心。那會多出一個你得學習與維護的相依項目。
  • 如果你只想要一段錄好的說話頭像影片,這種 API 優先的模式就過頭了。

常見問題

它用來為 AI 代理加上會說話的即時虛擬人,讓人們能對著有臉的對象進行口語對話。常見用途包括虛擬銷售助理、AI 支援與訓練代理、家教與互動主持人。