AI 模型

Reflection Beam 登場:5010 億參數的開放權重編碼模型

Reflection AI 發表 Beam,一款 5010 億參數、主打編碼與代理任務的開放權重模型。權重本月以 Apache 2.0 釋出,但目前的基準分數都是 Reflection 自己測的。

陳柏宇陳柏宇
熱度:1,250
Reflection Beam 登場:5010 億參數的開放權重編碼模型

Reflection AI 端出第一款開放權重模型 Beam,帳面 5010 億參數,卻只讓其中一小塊動起來。它打得進編碼前段班,而且官方說跑起來比同級模型更省算力。權重這個月才會放出來。

Reflection Beam 是什麼

Reflection AI 是美國的實驗室,10 月 5 日發表 Beam。它是一款稀疏的混合專家模型(Mixture-of-Experts,只有一部分參數會對每個詞元動手,所以實際運算量比帳面參數小得多),總參數 5010 億,每個詞元只啟動 230 億。

這個設計的用意不難懂。模型在紙面上很龐大,但每次生字只叫醒一部分,跑起來的花費遠低於那個嚇人的參數數字。

訓練重點放在編碼、推理,以及智慧代理(能自己規劃步驟、動用工具、把一整件事做完的 AI)。它只吃文字,不處理圖片或音訊。

想下載的人得再等等。Reflection 說 Beam 還在最後的紅隊測試與評測,已開放早鳥註冊。權重、技術報告、模型卡與開發者資源,本月稍晚會以 Apache 2.0 授權釋出。這個授權對企業很關鍵,Apache 2.0 允許商業使用與修改,不必背上某些開放模型的附加使用條款。

Beam 的訓練:23.8 兆詞元與一億次嘗試

Reflection 用 23.8 兆個詞元預訓練 Beam,來源涵蓋網路與授權資料集,數字和同量級的開放基礎模型差不多。這是它累積通用知識的底子。

真正特別的是強化學習那一關。Reflection 用了 1.05 萬張 NVIDIA GB300 顯示卡,跑四週,產生超過一億次嘗試(rollout),最大上下文長度 25.6 萬詞元。公司說,這是目前開放實驗室裡規模數一數二大的強化學習訓練。強化學習就是讓模型反覆解題、被打分、再修正的階段,練得越久,通常多步驟推理就越穩。

為什麼這件事值得一般讀者在意?著重強化學習的訓練,效果會落在必須「試了再改」的任務上,例如除錯,或是在好幾個檔案之間追一個問題。Reflection 說,隨著強化學習的算力往上加,分數也一直往上爬。

官方自測的 Beam 編碼成績

這一段的數字全部來自 Reflection 自己,沒有經過獨立驗證。在衡量能否修好真實 GitHub 問題的 SWE-bench Verified,Beam 拿到 80.9。在測試命令列與多步驟終端任務的 Terminal Bench v2.1,拿到 80.1。

成績不弱,但排在一些中國開放模型後面。Kimi K3 在 Terminal Bench 是 88.3,DeepSeek V4.1 Flash 是 90.6,Qwen 3.8-Max 是 86.6,GLM 5.3 是 88.2。Beam 跟 GLM 5.2 咬得很近,80.1 對上 81.0。

Reflection 沒有粉飾差距。公司說 Beam 在編碼與代理任務上跟 GLM 5.2 有得比、也逼近 Qwen 3.8-Max,但像 Kimi K3 這種在原始能力上還是領先。

模型

Terminal Bench v2.1

SWE-bench Verified

Reflection Beam

80.1

80.9

GLM 5.2

81.0

未公布

GLM 5.3

88.2

未公布

Kimi K3

88.3

未公布

Qwen 3.8-Max

86.6

未公布

Beam 的賣點不是搶排行榜第一,而是接近領先群,同時又跑得比較省。

真正的賣點:推理效率

Beam 到底贏在哪?贏在推理時的效率,也就是模型回答請求的那一刻。Reflection 說,Beam 達到跟 GLM 5.2 相當的推理分數,用的推理算力只要對方的三分之一到四分之一,對上 Qwen 3.8-Max 這類參數兩兆以上的家族,差距還會拉大。

這個說法要小心看。它不是量到的實際費用,而是 Reflection 用近似公式估的:以每次啟用的參數乘上生成詞元數,推出前向運算量,資料引自 Artificial Analysis 與 DataCurve。估算排除了提示處理、注意力運算與服務端的額外開銷,公司自己也承認這只是粗略比較,不等於真實成本。

不過背後的邏輯站得住。一款每個詞元只啟動 230 億參數的稀疏模型,本來就該比同實力的密集模型少吃算力。對照詞元計費的團隊來說,這在高量的編碼與代理工作流上有機會換成較低的帳單。

權重釋出前該注意什麼

最大的問號是驗證。目前所有分數都出自 Reflection 自家的評測,外界還沒真正跑過 Beam。釋出後的獨立測試,才會決定效率的說法在實際環境裡是否成立。

現在給的是承諾,不是證據。

可用性是另一個變數。權重可望在幾週內、以寬鬆授權釋出,正在權衡開放模型與純 API 服務的團隊,有理由先別急著簽長約,等能自己測過 Beam 再說。如果效率數字禁得起檢視,一款跑起來像小模型、帳面卻有 5010 億參數的模型,會是企業編碼工作上真正實用的選項。

分享這則新聞

來源

相關 AI 新聞

GPT-6 與 Intelligent UI 開放給全體 ChatGPT 使用者
AI 模型

GPT-6 與 Intelligent UI 開放給全體 ChatGPT 使用者

ChatGPT 的回答正從文字變成按鈕、圖表和迷你工具。背後的 GPT-6 與 Intelligent UI,現在連免費用戶也用得到。

熱度:1,700
Claude Haiku 5.5 讓小型模型 API 成本降 75%
AI 模型

Claude Haiku 5.5 讓小型模型 API 成本降 75%

Anthropic 推出旗下最便宜的小型模型,跑起來的成本大約只有前一代的四分之一。對按用量計費的團隊來說,這代表什麼?

熱度:1,500
大型神經網路核心置於歐洲資料中心框架中的編輯插圖
AI 模型

Mistral Large 4 預覽登場:1T 開源權重,歐洲的最大一注

法國 Mistral 端出兆級參數的 Mistral Large 4,代號「Le Chonk」,先讓開發者在 API 上試用。完整權重月底才會公開,這中間的空窗期,正是觀察歐洲開源路線能走多遠的窗口。

熱度:1,600
香蕉造型遊標在極簡畫布上編修照片的編輯插圖
AI 模型

Nano Banana 2.1 上線:圖片半價,但輸入漲三倍

Google 的 Nano Banana 2.1 正式上線,單張 1K 圖片價格砍到上一代的一半。但別急著高興,同一份價目表裡,輸入費用悄悄漲了三倍,帳單未必真的變輕。

熱度:1,300