Reflection AI 端出第一款開放權重模型 Beam,帳面 5010 億參數,卻只讓其中一小塊動起來。它打得進編碼前段班,而且官方說跑起來比同級模型更省算力。權重這個月才會放出來。
Reflection Beam 是什麼
Reflection AI 是美國的實驗室,10 月 5 日發表 Beam。它是一款稀疏的混合專家模型(Mixture-of-Experts,只有一部分參數會對每個詞元動手,所以實際運算量比帳面參數小得多),總參數 5010 億,每個詞元只啟動 230 億。
這個設計的用意不難懂。模型在紙面上很龐大,但每次生字只叫醒一部分,跑起來的花費遠低於那個嚇人的參數數字。
訓練重點放在編碼、推理,以及智慧代理(能自己規劃步驟、動用工具、把一整件事做完的 AI)。它只吃文字,不處理圖片或音訊。
想下載的人得再等等。Reflection 說 Beam 還在最後的紅隊測試與評測,已開放早鳥註冊。權重、技術報告、模型卡與開發者資源,本月稍晚會以 Apache 2.0 授權釋出。這個授權對企業很關鍵,Apache 2.0 允許商業使用與修改,不必背上某些開放模型的附加使用條款。
Beam 的訓練:23.8 兆詞元與一億次嘗試
Reflection 用 23.8 兆個詞元預訓練 Beam,來源涵蓋網路與授權資料集,數字和同量級的開放基礎模型差不多。這是它累積通用知識的底子。
真正特別的是強化學習那一關。Reflection 用了 1.05 萬張 NVIDIA GB300 顯示卡,跑四週,產生超過一億次嘗試(rollout),最大上下文長度 25.6 萬詞元。公司說,這是目前開放實驗室裡規模數一數二大的強化學習訓練。強化學習就是讓模型反覆解題、被打分、再修正的階段,練得越久,通常多步驟推理就越穩。
為什麼這件事值得一般讀者在意?著重強化學習的訓練,效果會落在必須「試了再改」的任務上,例如除錯,或是在好幾個檔案之間追一個問題。Reflection 說,隨著強化學習的算力往上加,分數也一直往上爬。
官方自測的 Beam 編碼成績
這一段的數字全部來自 Reflection 自己,沒有經過獨立驗證。在衡量能否修好真實 GitHub 問題的 SWE-bench Verified,Beam 拿到 80.9。在測試命令列與多步驟終端任務的 Terminal Bench v2.1,拿到 80.1。
成績不弱,但排在一些中國開放模型後面。Kimi K3 在 Terminal Bench 是 88.3,DeepSeek V4.1 Flash 是 90.6,Qwen 3.8-Max 是 86.6,GLM 5.3 是 88.2。Beam 跟 GLM 5.2 咬得很近,80.1 對上 81.0。
Reflection 沒有粉飾差距。公司說 Beam 在編碼與代理任務上跟 GLM 5.2 有得比、也逼近 Qwen 3.8-Max,但像 Kimi K3 這種在原始能力上還是領先。
模型 | Terminal Bench v2.1 | SWE-bench Verified |
|---|---|---|
Reflection Beam | 80.1 | 80.9 |
GLM 5.2 | 81.0 | 未公布 |
GLM 5.3 | 88.2 | 未公布 |
Kimi K3 | 88.3 | 未公布 |
Qwen 3.8-Max | 86.6 | 未公布 |
Beam 的賣點不是搶排行榜第一,而是接近領先群,同時又跑得比較省。
真正的賣點:推理效率
Beam 到底贏在哪?贏在推理時的效率,也就是模型回答請求的那一刻。Reflection 說,Beam 達到跟 GLM 5.2 相當的推理分數,用的推理算力只要對方的三分之一到四分之一,對上 Qwen 3.8-Max 這類參數兩兆以上的家族,差距還會拉大。
這個說法要小心看。它不是量到的實際費用,而是 Reflection 用近似公式估的:以每次啟用的參數乘上生成詞元數,推出前向運算量,資料引自 Artificial Analysis 與 DataCurve。估算排除了提示處理、注意力運算與服務端的額外開銷,公司自己也承認這只是粗略比較,不等於真實成本。
不過背後的邏輯站得住。一款每個詞元只啟動 230 億參數的稀疏模型,本來就該比同實力的密集模型少吃算力。對照詞元計費的團隊來說,這在高量的編碼與代理工作流上有機會換成較低的帳單。
權重釋出前該注意什麼
最大的問號是驗證。目前所有分數都出自 Reflection 自家的評測,外界還沒真正跑過 Beam。釋出後的獨立測試,才會決定效率的說法在實際環境裡是否成立。
現在給的是承諾,不是證據。
可用性是另一個變數。權重可望在幾週內、以寬鬆授權釋出,正在權衡開放模型與純 API 服務的團隊,有理由先別急著簽長約,等能自己測過 Beam 再說。如果效率數字禁得起檢視,一款跑起來像小模型、帳面卻有 5010 億參數的模型,會是企業編碼工作上真正實用的選項。






