Reflection AIが初のオープンウェイトモデル「Beam」を公開した。狙いはコーディングとエージェント作業。大きさより、推論の安さで勝負をかける。
Reflection AIのBeamとは何か
米Reflection AIは10月5日、初のオープンウェイトモデル「Beam」を発表した。総パラメータ数は5010億、1トークンあたりの実働パラメータは230億。スパースなMixture-of-Experts(MoE、入力ごとに使う専門家だけを呼び出す構造)を採用し、コーディング、推論、ツールを扱うエージェント作業に向けて作られている。
オープンウェイトとは、モデルの重みを誰でもダウンロードして自前の環境で動かせる形を指す。API経由でしか使えないクローズドモデルと違い、企業は自社サーバーで運用できる。Reflectionはこの重みを今月中にApache 2.0ライセンスで公開する予定だ。ただし現時点では最終的なレッドチーミング(悪用耐性の検査)と評価の途中にあり、利用できるのは登録制の早期アクセスだけだ。
つまりBeamは「発表済み、重みは今月下旬」という段階にある。すぐに手元で試せるモデルではない。
Reflection Beamの設計と学習規模
Beamの特徴は、事前学習と強化学習の両方に大規模な投資をした点にある。
事前学習には238億トークン分のテキストを使った。Reflectionの説明では、同規模のオープンモデルと比べて同等かそれ以上だという。ここで効いてくるのが強化学習で、こちらに同社は力を割いている。1万500台のNVIDIA GB300 GPUを4週間動かし、1億回を超えるロールアウト(モデルに何度も試行させ、うまくいった道筋を学習させる手法)を生成した。Reflectionは「オープン系のラボが実施した強化学習としては最大級」と主張している。
規模の数字だけを追っても意味は薄い。注目したいのは、同社が推論時の効率を軸に据えている点だ。パラメータを増やす競争ではなく、同じ賢さをより少ない計算で出す方向に賭けている。
Reflection Beamが公開したベンチマーク
Reflection自身の公表値は強い。コーディングの実務寄りテスト「SWE-bench Verified」で80.9、コマンド操作を測る「Terminal Bench v2.1」で80.1を記録した。
ただし、この数字の読み方には注意がいる。すべてReflectionの自社計測であり、第三者による検証はまだ受けていない。同じTerminal Bench v2.1で他社の公表値を見ると、Kimi K3が88.3、Qwen 3.8-Maxが86.6、DeepSeek V4.1 Flashが90.6と、Beamより上に位置する。Beamが競合を圧倒した、という話ではない。
Reflection自身もその線は認めている。同社は、Kimi K3のような最先端のオープンモデルが「生の能力では依然として上」だと明言し、Beamの強みは推論時の効率にあると説明している。
Reflection Beamの効率という売り
効率はどのくらい効くのか。Reflectionは、高度な推論ベンチマークでGLM-5.2と同等のスコアを、推論の計算量で3〜4分の1で出せると主張している。
この比較の根拠は押さえておきたい。同社はArtificial AnalysisとDataCurveのデータを使い、生成時の計算量を「実働パラメータ数×生成トークン数」で概算し、それを他モデルと並べた。プロンプトの読み込み、文脈に応じた注意計算、配信のオーバーヘッドは含めていない。つまり実測の請求額ではなく、あくまで概算の比較だ。
それでも、この指標が示す方向ははっきりしている。同じ仕事を、より少ない計算でこなせるなら、APIの費用や応答時間は下がる。企業が大量のコーディング作業を回す場面では、そこが効いてくる。
Beamが売りにする点
- 総パラメータ501B、実働23BのスパースMoE
- 重みをApache 2.0で今月公開予定
- 推論の計算量をGLM-5.2比で3〜4分の1に抑えると主張
- コンテキスト窓は100万トークン
- SWE-bench Verifiedは自社計測で80.9
Beamが及ばない点
- 生の能力ではKimi K3が上とReflectionも認める
- Terminal Bench v2.1はKimi K3、Qwen 3.8-Max、DeepSeek V4.1 Flashが上
- ベンチマークはすべて自社計測、第三者検証は未実施
- 重みは未公開、利用は登録制の早期アクセスのみ
- 効率比較は概算で、実測コストではない
Reflection Beamが示すオープンウェイトの行方
Beamが面白いのは、性能の高さより、勝ち筋の置き方にある。中国勢が巨大なモデルを次々と出し、パラメータ数と能力で競う中、Reflectionは「同じ賢さを安く」という軸を選んだ。NVIDIAの支援を受け、米国発のオープンウェイトとして、実用のコストで勝負をかける構図だ。
開発者にとっての判断材料は明快だ。Beamの実力が本物なら、自前で動かせるうえに推論コストを抑えられる選択肢が増える。ただし重みが出るまでは何も確定しない。まず早期アクセスに登録し、今月下旬の技術レポートとモデルカードを待って、第三者による検証を確かめるのが順当な進め方だ。オープンウェイトの競争は、大きさから効率へと軸を移しつつある。






