
TraceLLM
TraceLLM · 程式設計
TraceLLM 是為正式環境執行 AI 應用程式的團隊所打造、以本機優先的 LLM 可觀測性平台。它會記錄工作階段、span、提示與輸出(在你允許時)、token 用量、延遲與錯誤,涵蓋聊天機器人、代理與 RAG 管線,然後把所有內容顯示在同一條追蹤時間軸上。政策層決定哪些內容會被擷取、遮蔽或捨棄,而 OpenTelemetry 匯出路徑會把選定的追蹤轉送到 SigNoz 或 Honeycomb 等後端。那這能帶給你什麼?一個能回答「為什麼某個回答出錯」的單一位置。

關於 TraceLLM
TraceLLM 是什麼
TraceLLM 是專為 AI 應用程式打造的可觀測性平台。它不把線索散落在各家供應商儀表板、應用程式日誌與使用者錯誤回報之間,而是給每個 AI 工作流程一條追蹤時間軸:是什麼觸發了它、執行了哪次模型呼叫、每個步驟花了多久、消耗了多少 token,以及在哪裡失敗。
本專案是 MIT 授權的開源專案,程式碼在 GitHub,代管應用程式在 tracellm.in。它源自一個常見問題:正式環境出現錯誤回答,但應用程式程式碼、向量儲存與模型供應商各自只掌握故事的一小部分。TraceLLM 把這些片段縫回成一筆可檢視的紀錄。
主要限制在於成熟度。TraceLLM 還很年輕。Node SDK 是工作區套件,而非發佈到 npm 的版本,文件也還指向本機快速入門來完成設定。如果你今天就需要一款久經驗證、整合資源豐富的工具,它還不是。如果你想讀程式碼並自行架設,它很合適。
開始使用
- 在 tracellm.in 建立帳號,或以
pnpm install、pnpm infra:build、pnpm infra:up在本機執行整套堆疊。 - 建立專案,並複製專案範圍的 API 金鑰(
trllm_...)。 - 在你的應用程式安裝 Node SDK,並以你的端點、API 金鑰與服務名稱啟動一個工作階段。
- 把模型呼叫包進 span,接著記錄事件、token 數量與錯誤。
- 開啟追蹤總管檢視每個工作階段,並可選擇加入 OTLP 端點,把追蹤轉送到你自己的後端。
產品資訊
快速了解 TraceLLM 的定價、支援平台與效能。
適合對象
這項工具最適合的使用者、任務與情境。
使用者
- AI 工程師與後端開發者:只要你能接受 Node SDK 與自行架設,就能把模型、代理與 RAG 呼叫包進 span,看見完整的執行路徑。
- 沒有平台預算的小型產品團隊:MIT 授權與本機優先的設計代表沒有按人計費的帳單。設定與維護得自己扛。
- 專注除錯的支援人員:依名稱、狀態或時間戳搜尋工作階段,讓你能找到某位使用者的失敗執行,而不必翻找原始日誌。
任務
- 追蹤一個糟糕的聊天機器人回答:時間軸會依發生順序顯示檢索、工具呼叫與模型 span,這正是找出第一個錯誤步驟所需的東西。
- 觀察 token 花費:每個 span 的 token 用量就顯示在延遲旁邊,讓你能找出悄悄膨脹的提示。
- 讓錯誤緊跟著真實的工作階段:例外會在同一個追蹤上保留訊息、類型與堆疊,與觸發它們的使用者回合並列。
- 匯出到既有的 APM:客戶自有的 OTLP 端點只把你選定的訊號轉送到 SigNoz、Tempo、Honeycomb 或 Datadog。
情境
- 把代理送上正式環境,且需要重現失敗對話的方法:工作階段會擷取每個回合周遭的事件序列。
- 在提示含個人資料的內容規範下作業:擷取政策可以儲存中介資料與用量,同時略過提示與輸出的內容。
- 在多個 AI 服務間統一可觀測性:與供應商無關的 span 在同一個模型下涵蓋 OpenAI、Claude、Gemini 與自訂閘道。
主要功能
工作階段與 span 追蹤
TraceLLM 把一個 AI 工作流程組織成帶有巢狀 span 的工作階段。一個工作階段容納使用者回合。每個 span 涵蓋一個工作單位,例如一次供應商呼叫、一個檢索步驟或一次工具執行。這就是 LLM 追蹤的核心。你啟動一個工作階段,在其中開啟 span,事件發生時就記錄,最後以狀態關閉兩者。這個結構把散亂一堆的日誌行變成一場可重現的執行。
擷取政策控管
不是所有東西都該被儲存。你可以逐專案設定政策:是否擷取提示與輸出的內容、保留多少中介資料與用量,以及遮蔽是否在 API 金鑰與 bearer token 進入資料庫前先加以遮掩。提示追蹤的防護欄就在這裡。取樣可以擷取 0% 到 100% 的工作階段,特定種類的 span 也能完全略過。
token 用量與延遲追蹤
每個 span 都能在屬性旁帶著 token 數量與時間。成本與速度就和呼叫本身顯示在同一個檢視中。你能看出哪個步驟慢、哪個步驟貴。不必合併兩個儀表板。這就是「知道帳單漲了」與「知道是哪個提示造成的」之間的差別。
OpenTelemetry 與 OTLP 匯出
TraceLLM 保有自己的產品時間軸,也能把選定的追蹤轉送到客戶自有的 OTLP HTTP 收集器。你貼上端點、選擇要轉送的訊號,資料就會流向 SigNoz、Honeycomb、Tempo、Datadog 或任何相容於 OTLP 的後端。已經在跑 APM 的團隊可以保留現有堆疊,把 TraceLLM 當成上層的 AI 專屬層。
與供應商無關的埋點
把它想成一款不把你綁死在單一供應商的 AI 除錯工具。span 不在乎你呼叫哪個模型。TraceLLM 可搭配 OpenAI、Claude、Gemini、自訂路由器、內部服務與 MCP 形式的工作流程,因為是你自己包住呼叫,而非依賴供應商專屬外掛。換模型或換閘道都不會弄壞你的追蹤設定。
專案範圍 API 金鑰
每個 API 金鑰把請求對應到一個專案,並把該專案的擷取政策帶進 SDK 執行環境。建立多個金鑰。為它們命名。當某個服務不再使用時就撤銷舊金鑰。這樣共用的政策就不會外洩到無關的應用程式,金鑰輪替也成為簡單的兩步工作。
優缺點
優點
- MIT 授權且開源,所以沒有訂閱費,程式碼也能閱讀。
- 本機優先的設計讓你自行架設,把追蹤資料留在自己的基礎架構上。
- 擷取政策把內容、中介資料、用量與錯誤分開,對敏感的提示有幫助。
- OTLP 匯出代表你不必放棄既有的 SigNoz 或 Datadog 設定。
- 與供應商無關的 span 無需外掛就能涵蓋 OpenAI、Claude、Gemini 與自訂閘道。
缺點
- Node SDK 尚未發佈到 npm,所以早期採用者得從儲存庫或工作區套件安裝。
- 這是個年輕專案,所以預期預建整合與社群範例會比成熟工具少。
- 自行架設代表部署、升級與儲存容量規劃都得自己處理。
- 文件還在補齊,所以有些設定步驟需要閱讀原始碼。
常見問題
TraceLLM 用來除錯與監控正式環境的 AI 應用程式。它記錄聊天機器人、代理與 RAG 管線的工作階段、span、token 用量、延遲與錯誤,然後顯示在同一條時間軸上,讓你找出某個特定回答為何出錯。
相關內容
探索與 TraceLLM 相關的工具、技能與文章。
TraceLLM 替代方案
Forefront
Forefront · 程式設計Forefront 是一個用來打造開源 AI 的網頁平台。你可以用自己的資料微調主流的開源語言模型、評估它們的表現,再透過 API 執行,或匯出後自行架設。想要封閉式平台的便利、卻堅持要自己擁有模型與資料的開發者,就是這裡的目標客群。
Startkit
StartKit.AI · 程式設計Startkit 是一套用來打造 AI SaaS 與 AI 包裝產品的樣板。可以把它想成一個 AI 新創樣板,把枯燥的部分都先接好了:驗證、Stripe 與 Lemon Squeezy 付款、用量限制、交易型電子郵件,以及一套能與 OpenAI、Anthropic、Groq 或 Llama 溝通的 AI API 啟動套件。你複製儲存庫、設定價格,然後專心在產品中使用者真正願意付費的部分。它建構於 React 與 Tailwind 之上的 Next.js,所以大部分的樣板程式碼對你來說並不陌生。
Testim
Tricentis · 程式設計Testim 是專為網頁、行動與 Salesforce 應用程式打造的 AI 測試自動化平台,用來建立並執行端到端測試。它靠機器學習在介面變動時維持測試穩定,團隊因此少花時間修補壞掉的定位器。對於一款今天就能開始使用的自動化測試工具來說,這表現不算差。你透過在瀏覽器錄製動作來建立測試,需要更多控制時再補上 JavaScript。對忙碌的 QA 團隊來說,這是個可靠的選擇。
