AIモデル

Reflection AIのBeam解説:501Bのオープンウェイトモデル

Reflection AIが初のオープンウェイトモデル「Beam」を公開した。狙いはコーディングとエージェント作業。大きさより、推論の安さで勝負をかける。

佐藤健太佐藤健太
人気度:1,250
Reflection AIのBeam解説:501Bのオープンウェイトモデル

Reflection AIが初のオープンウェイトモデル「Beam」を公開した。狙いはコーディングとエージェント作業。大きさより、推論の安さで勝負をかける。

Reflection AIのBeamとは何か

米Reflection AIは10月5日、初のオープンウェイトモデル「Beam」を発表した。総パラメータ数は5010億、1トークンあたりの実働パラメータは230億。スパースなMixture-of-Experts(MoE、入力ごとに使う専門家だけを呼び出す構造)を採用し、コーディング、推論、ツールを扱うエージェント作業に向けて作られている。

オープンウェイトとは、モデルの重みを誰でもダウンロードして自前の環境で動かせる形を指す。API経由でしか使えないクローズドモデルと違い、企業は自社サーバーで運用できる。Reflectionはこの重みを今月中にApache 2.0ライセンスで公開する予定だ。ただし現時点では最終的なレッドチーミング(悪用耐性の検査)と評価の途中にあり、利用できるのは登録制の早期アクセスだけだ。

つまりBeamは「発表済み、重みは今月下旬」という段階にある。すぐに手元で試せるモデルではない。

Reflection Beamの設計と学習規模

Beamの特徴は、事前学習と強化学習の両方に大規模な投資をした点にある。

事前学習には238億トークン分のテキストを使った。Reflectionの説明では、同規模のオープンモデルと比べて同等かそれ以上だという。ここで効いてくるのが強化学習で、こちらに同社は力を割いている。1万500台のNVIDIA GB300 GPUを4週間動かし、1億回を超えるロールアウト(モデルに何度も試行させ、うまくいった道筋を学習させる手法)を生成した。Reflectionは「オープン系のラボが実施した強化学習としては最大級」と主張している。

規模の数字だけを追っても意味は薄い。注目したいのは、同社が推論時の効率を軸に据えている点だ。パラメータを増やす競争ではなく、同じ賢さをより少ない計算で出す方向に賭けている。

Reflection Beamが公開したベンチマーク

Reflection自身の公表値は強い。コーディングの実務寄りテスト「SWE-bench Verified」で80.9、コマンド操作を測る「Terminal Bench v2.1」で80.1を記録した。

ただし、この数字の読み方には注意がいる。すべてReflectionの自社計測であり、第三者による検証はまだ受けていない。同じTerminal Bench v2.1で他社の公表値を見ると、Kimi K3が88.3、Qwen 3.8-Maxが86.6、DeepSeek V4.1 Flashが90.6と、Beamより上に位置する。Beamが競合を圧倒した、という話ではない。

Reflection自身もその線は認めている。同社は、Kimi K3のような最先端のオープンモデルが「生の能力では依然として上」だと明言し、Beamの強みは推論時の効率にあると説明している。

Reflection Beamの効率という売り

効率はどのくらい効くのか。Reflectionは、高度な推論ベンチマークでGLM-5.2と同等のスコアを、推論の計算量で3〜4分の1で出せると主張している。

この比較の根拠は押さえておきたい。同社はArtificial AnalysisとDataCurveのデータを使い、生成時の計算量を「実働パラメータ数×生成トークン数」で概算し、それを他モデルと並べた。プロンプトの読み込み、文脈に応じた注意計算、配信のオーバーヘッドは含めていない。つまり実測の請求額ではなく、あくまで概算の比較だ。

それでも、この指標が示す方向ははっきりしている。同じ仕事を、より少ない計算でこなせるなら、APIの費用や応答時間は下がる。企業が大量のコーディング作業を回す場面では、そこが効いてくる。

Beamが売りにする点

  • 総パラメータ501B、実働23BのスパースMoE
  • 重みをApache 2.0で今月公開予定
  • 推論の計算量をGLM-5.2比で3〜4分の1に抑えると主張
  • コンテキスト窓は100万トークン
  • SWE-bench Verifiedは自社計測で80.9

Beamが及ばない点

  • 生の能力ではKimi K3が上とReflectionも認める
  • Terminal Bench v2.1はKimi K3、Qwen 3.8-Max、DeepSeek V4.1 Flashが上
  • ベンチマークはすべて自社計測、第三者検証は未実施
  • 重みは未公開、利用は登録制の早期アクセスのみ
  • 効率比較は概算で、実測コストではない

Reflection Beamが示すオープンウェイトの行方

Beamが面白いのは、性能の高さより、勝ち筋の置き方にある。中国勢が巨大なモデルを次々と出し、パラメータ数と能力で競う中、Reflectionは「同じ賢さを安く」という軸を選んだ。NVIDIAの支援を受け、米国発のオープンウェイトとして、実用のコストで勝負をかける構図だ。

開発者にとっての判断材料は明快だ。Beamの実力が本物なら、自前で動かせるうえに推論コストを抑えられる選択肢が増える。ただし重みが出るまでは何も確定しない。まず早期アクセスに登録し、今月下旬の技術レポートとモデルカードを待って、第三者による検証を確かめるのが順当な進め方だ。オープンウェイトの競争は、大きさから効率へと軸を移しつつある。

このニュースを共有

出典

関連AIニュース

GPT-6とIntelligent UI、ChatGPT全ユーザーへ提供開始
AIモデル

GPT-6とIntelligent UI、ChatGPT全ユーザーへ提供開始

ChatGPTの回答が、文章の壁から「操作できる画面」へ変わり始めた。GPT-6とIntelligent UIは無料プランを含む全ユーザーに広がる。

人気度:1,700
Claude Haiku 5.5公開、小型モデルのAPIコストを約75%削減
AIモデル

Claude Haiku 5.5公開、小型モデルのAPIコストを約75%削減

Anthropicの小型モデルが、前世代のおよそ4分の1のコストで動くようになった。トークン単位で課金される開発チームにとって、Claude Haiku 5.5は何を変えるのか。

人気度:1,500
Mistral Large 4プレビュー、1兆パラメータの欧州製オープンウェイト
AIモデル

Mistral Large 4プレビュー、1兆パラメータの欧州製オープンウェイト

フランスのMistralが公開プレビューを始めたフラッグシップ「Mistral Large 4」は、1兆パラメータのネイティブ・マルチモーダルモデルだ。ただし重みが配布されるのは10月末。今すぐ試せるのはAPIだけになる。

人気度:1,600
Nano Banana 2.1が正式提供、半額の裏側と23日の移行期限
AIモデル

Nano Banana 2.1が正式提供、半額の裏側と23日の移行期限

Googleの画像生成モデル「Nano Banana 2.1」は、1K画像の価格がほぼ半額になった代わりに、旧版「Nano Banana 2」は9月29日に関停する。移行の猶予は23日しかない。

人気度:1,300