Reflectionが総パラメータ数501Bのオープンウェイトモデル「Beam」発表

Reflectionが総パラメータ数501Bのオープンウェイトモデル「Beam」発表

基本情報

項目 内容
公開日 2026-10-06
出典の種類 公開元の一次情報(公式ブログURLがソースに含まれ、一次情報として裏付けられている)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

Reflectionは、同社初となるオープンウェイトのAIモデル「Beam」を発表しました。Beamは、総パラメータ数5,010億、アクティブパラメータ数230億のスパースMixture-of-Experts(MoE)モデルであり、コーディングや推論、エージェントとしてのタスクに特化して設計されています。この発表を受けて、開発者コミュニティでは性能やコスト、ベンチマークの比較方法などを巡って活発な議論が交わされています。

話題になっている理由

Beamが注目を集めている理由は、その圧倒的な開発規模と、西洋発の強力なオープンウェイトモデルとしての期待感にあります。事前学習にはウェブや独自のライセンスデータセットから23.8兆トークンが使用され、強化学習(RL)のプロセスでは10.5K台のNVIDIA GB300 GPUを4週間稼働させ、1億回以上のロールアウトを生成したと報告されています。このように莫大な計算資源を投じて開発されたモデルが、今月後半にウェイトや技術レポートを含めて公開される予定であることから、手元でモデルを動かす技術者たちの間で大きな関心を呼んでいます。また、推論時の効率性を高めつつ、高度なコーディングやエージェントタスクに対応できるとされている点も、実用的なワークホースモデルを求める層から注目されています。

議論の論点

コミュニティでは、公開された情報やベンチマーク結果に対して、以下のような複数の論点について意見が交わされています。

既存の中国製モデルとの性能・コスト比較

参加者の間では、すでに公開されている中国製のオープンウェイトモデルと比較して、Beamの優位性に疑問を投げかける声が上がっています。具体的には、DeepSeek v4.1 Flashなどの既存のモデルと比較した場合、Beamはモデルサイズが大きく、実行コストが高くなる一方で、測定されたすべてのメトリクスで劣っているのではないかという指摘がなされています。一方で、中国の研究所が強力なモデルを次々とリリースする中で、西洋のプレイヤーがこの競争に参加し、開発を継続していくこと自体を歓迎する意見も見られます。

ベンチマーク比較の提示方法と透明性

発表で示された性能チャートや比較対象の選定についても議論が起きています。一部の参加者からは、性能チャートにおいて、より優れたオープンソースモデルが目立たないように配置されており、Beamがそれらを上回っているかのように見せる誤解を招く表現になっているという批判があります。また、比較対象がSOTA(最先端)ではないInklingやGLM 5.2といったモデルに偏っている点や、表にはデータがあるGLM 5.3やDeepSeek V4.1 Flashがチャートから除外されている点について、自社モデルを良く見せるための意図的な操作ではないかと疑う声も存在します。さらに、現時点でウェイトが未公開であり、API経由での広範な検証もできない段階での発表であるため、第三者による客観的な評価が不足していることも指摘されています。

一般化能力を証明するデモへの疑問

モデルの一般化能力を示すために提示された「Land or Water Generalization Experiment(陸か水かの一般化実験)」のデモに対しても、技術的な観点から異論が唱えられています。このデモでは、数日前にSNSで流行したパズルを解かせたことで、学習データに含まれていない新規タスクへの一般化が証明されたと主張されています。しかしコミュニティの参加者からは、世界地図の緯度・経度から陸地か水かを判定するグリッドを生成するタスク自体は、トレンドになる以前から存在する古典的なものであり、これが「数日前の新しいパズルだから学習データにない」として一般化の証拠とするのは不正確であるという指摘がなされています。

ハードウェア要件と推論効率の実態

Beamがアピールしている「推論効率の高さ」が、実際にどのようなハードウェア環境でどのようなパフォーマンス特性を示すのかについて、強い関心が寄せられています。推論速度の最適化が、より小規模なローカルハードウェアでの動作に有利に働くのか、それともパラメータ数の多さゆえに、実際にはより多くのリソースを要求するのかについて、具体的な検証結果を待ち望む声が上がっています。

コミュニティの反応

既存モデルとの比較に対する賛否

コミュニティでは、既存のモデル、特に中国の研究所が開発したモデルとの比較について多くの意見が交わされています。

一部の参加者からは、BeamはDeepSeek v4.1 Flashと比較してモデルサイズが大きく、実行コストも高いにもかかわらず、測定されたすべての指標において劣っているように見えるという厳しい指摘がなされています。また、中国製の優れたオープンモデルに比べてサイズが大きく性能が劣る点について、「西洋のモデルは中国のモデルに大きく遅れをとっているのではないか」という懸念を示す声もあります。

一方で、このような競争状況を前向きに捉える意見もあります。中国のモデルが非常に強力であることは認めつつも、「少なくとも西洋のプレイヤーがこの競争に参加したことは喜ばしいことであり、今後もこのペースを維持して開発を継続してほしい」という期待が寄せられています。特定の国や企業による独占状態はリスクが大きいため、オープンなモデルの選択肢やプロバイダーが増えること自体を歓迎する姿勢が見られます。

ベンチマークの提示方法に対する疑問

発表資料に掲載されているベンチマークの提示方法や、比較対象の選び方については、不信感や疑問を抱く声が多く上がっています。

性能チャートの配置について、「より優れたオープンソースモデルが後ろに隠れるように配置されており、まるでBeamがそれらを上回っているかのように見せかけている。この発表は誤解を招くものである」という批判的な指摘があります。

また、比較対象が最先端ではないInklingやGLM 5.2といったモデルに偏っている点も議論の的となっています。表の中にはGLM 5.3やDeepSeek V4.1 Flashのスコアが掲載されているにもかかわらず、チャートからは除外されていることについて、「これらのモデルをチャートに含めると、Beamの見栄えが悪くなってしまうからではないか」という推測がなされています。さらに、現時点ではウェイトが公開されておらず、API経由で広く利用できる状態でもないため、第三者による客観的な検証や、AA Index、Arenaなどの信頼できるベンチマークでの評価結果が不足していることを懸念する声もあります。

一般化デモに対する技術的な指摘

モデルの一般化能力を示すために提示された「Land or Water Generalization Experiment(陸か水かの一般化実験)」のデモに対しても、冷ややかな意見が寄せられています。

発表資料では、このパズルが数日前にSNSで流行したものであるため、学習データに含まれておらず、モデルの一般化能力を証明できると主張されています。しかし、技術者からは「世界地図の緯度と経度から陸地か水かを判定するグリッドを生成するというタスク自体は、最近トレンドになったとしても、古典的なものであり、学習データに含まれていないとする主張は不正確である」という反論がなされています。

ハードウェア要件と推論効率への期待

Beamがアピールしている推論効率の高さが、実際の運用においてどのような意味を持つのかについて、技術的な関心が集まっています。

「どのようなハードウェアで動作させることができ、どのようなパフォーマンス特性があるのか非常に興味深い」という意見が見られます。推論速度の最適化が、より小規模なハードウェアでのローカル実行に有利に働くのか、それともパラメータ数が大きい(総パラメータ数5,010億、アクティブパラメータ数230億)ために、実際にはパラメータ数に見合った、あるいはそれ以上の多くのリソースを要求するのかについて、具体的な情報や検証結果を求める声が上がっています。

その他の反応

このほかにも、モデル名である「Beam」という言葉から、Erlangの仮想マシンである「BEAM VM」を連想したという開発者ならではの反応や、業界で「Workhorse(ワークホース:実用的な馬)」という表現が多用されていることへの興味深い指摘などが見られました。また、事前学習の初日からモニタリングを手伝っていたという開発関係者からは、「初日からトレーニングを見守ることは素晴らしい経験だった」という好意的なコメントも寄せられています。

出典