Modèles

Beam de Reflection AI : le modèle ouvert de 501 B pensé pour le code

Beam est le premier modèle à poids ouverts de Reflection AI : 501 milliards de paramètres qui frôlent des systèmes chinois bien plus gros sur les tests de code. Les poids et la pile d'affinage sont annoncés pour la fin du mois.

Julien MartinJulien Martin
Popularité : 1,250
Beam de Reflection AI : le modèle ouvert de 501 B pensé pour le code

Beam est le premier modèle à poids ouverts de Reflection AI : 501 milliards de paramètres qui frôlent des systèmes chinois bien plus gros sur les tests de code. Les poids, le rapport technique et la pile d'affinage sont annoncés pour la fin du mois.

Ce qu'est vraiment Beam, le modèle de Reflection AI

Reflection AI, un laboratoire américain, a présenté Beam le 5 octobre. Il s'agit d'un modèle à mélange d'experts (MoE), une architecture qui découpe le réseau en plusieurs spécialistes et n'en active qu'une partie à chaque mot produit. Beam affiche 501 milliards de paramètres au total, dont 23 milliards activés par jeton. Cette conception lui permet de rester imposant sur le papier tout en coûtant moins à faire tourner que ce que laisse croire le nombre de paramètres.

L'entreprise l'a entraîné en visant surtout le code, le raisonnement et les tâches dites agentiques, autrement dit celles où le modèle planifie des étapes, appelle des outils et mène un travail de bout en bout plutôt que de répondre à une seule question. C'est un modèle texte uniquement : il ne traite ni images ni sons.

Beam n'est pas encore téléchargeable. Reflection mène ses derniers tests de robustesse et ses évaluations, et a ouvert les inscriptions en accès anticipé. La publication des poids sous licence Apache 2.0, accompagnée du rapport technique, de la fiche modèle et des outils pour développeurs, est prévue pour la fin du mois. Cette licence compte pour les entreprises : Apache 2.0 les autorise à exécuter et à modifier le modèle à des fins commerciales, sans les restrictions d'usage qui accompagnent certaines sorties ouvertes.

L'entraînement de Beam : 23,8 billions de jetons et 100 millions de rollouts

Reflection a préentraîné Beam sur 23,8 billions de jetons tirés du web et de jeux de données sous licence, un volume comparable à celui des autres modèles ouverts de même taille. C'est le régime de base qui lui donne ses connaissances générales.

La partie la plus inhabituelle arrive à l'étape de l'apprentissage par renforcement. Reflection l'a fait tourner sur 10 500 GPU NVIDIA GB300 pendant quatre semaines, générant plus de 100 millions de rollouts avec une longueur de contexte maximale de 256 000 jetons. Le laboratoire affirme qu'il s'agit de l'une des plus grosses phases de renforcement jamais menées par un laboratoire ouvert. Concrètement, c'est l'étape où le modèle s'exerce sur des problèmes, reçoit une note et ajuste son comportement : un entraînement plus long se traduit en général par un meilleur raisonnement en plusieurs étapes.

Pourquoi cela vous concerne-t-il ? Un renforcement intensif se remarque sur les tâches où le modèle doit essayer, vérifier et se corriger, comme déboguer du code ou traquer un défaut à travers plusieurs fichiers. Reflection indique que ses scores continuaient de grimper à mesure que le calcul de renforcement augmentait.

Les scores de Beam en code, selon Reflection AI

Tous les chiffres de cette partie sont publiés par Reflection et n'ont pas été vérifiés de manière indépendante. Sur SWE-bench Verified, qui mesure si un modèle sait résoudre de vraies anomalies GitHub, Beam obtient 80,9. Sur Terminal Bench v2.1, un test de commandes en ligne et de tâches en plusieurs étapes au terminal, il atteint 80,1.

Ce sont de bons résultats, mais ils restent derrière plusieurs modèles ouverts chinois. Kimi K3 annonce 88,3 sur Terminal Bench, DeepSeek V4.1 Flash 90,6, Qwen 3.8-Max 86,6 et GLM 5.3 88,2. Face à GLM 5.2, Beam reste proche : 80,1 contre 81,0.

Reflection reconnaît l'écart. L'entreprise dit que Beam est compétitif avec GLM 5.2 et s'approche de Qwen 3.8-Max sur le code et les tâches agentiques, tandis que des modèles comme Kimi K3 gardent l'avantage en capacité brute.

Modèle

Terminal Bench v2.1

SWE-bench Verified

Reflection Beam

80,1

80,9

GLM 5.2

81,0

non communiqué

GLM 5.3

88,2

non communiqué

Kimi K3

88,3

non communiqué

Qwen 3.8-Max

86,6

non communiqué

L'argument de Beam n'est pas de trôner en tête du classement. C'est d'approcher les meneurs en coûtant moins cher à exécuter. Voilà toute la nuance.

L'efficacité d'inférence, son vrai atout

Là où Beam revendique un avantage, c'est sur l'efficacité à l'inférence, le moment où le modèle répond à une requête. Reflection assure atteindre des scores de raisonnement comparables à ceux de GLM 5.2 en consommant trois à quatre fois moins de calcul d'inférence, et que l'écart se creuse face aux modèles de la famille des 2 000 milliards de paramètres comme Qwen 3.8-Max.

À prendre avec prudence. La comparaison n'est pas un coût mesuré en euros. Reflection a estimé le calcul des passes avant à partir d'une approximation fondée sur les paramètres actifs et les jetons générés, en s'appuyant sur des données d'Artificial Analysis et de DataCurve. Le calcul laisse de côté le traitement du prompt, l'attention et la surcharge de service, ce que l'entreprise admet elle-même. C'est donc une comparaison approximative, pas une mesure réelle de coût.

La logique de fond tient toutefois debout. Un modèle creux qui active 23 milliards de paramètres par jeton devrait consommer moins de calcul qu'un modèle dense d'une capacité voisine. Pour les équipes qui paient au jeton, cela peut se traduire par des factures plus légères sur les charges de travail de code et d'agents à fort volume.

Ce qu'il faut surveiller avant l'arrivée des poids

La grande question ouverte, c'est la vérification. Chaque score vient de la propre batterie de tests de Reflection, et le public n'a pas encore fait tourner Beam. Les tests indépendants après la sortie diront si la promesse d'efficacité tient en production.

La disponibilité est l'autre facteur. Avec des poids annoncés sous quelques semaines et sous licence permissive, les équipes qui hésitent entre modèles ouverts et offres exclusivement accessibles par API ont une raison d'attendre avant de s'engager sur le long terme. Si les chiffres d'efficacité résistent à l'examen, un modèle de 501 milliards de paramètres qui se comporte comme un plus petit sera une option réellement utile pour le travail de code en entreprise.

Partager cet article

Sources

Actualités liées à l’IA

GPT-6 débarque sur ChatGPT avec Intelligent UI, gratuit compris
Modèles

GPT-6 débarque sur ChatGPT avec Intelligent UI, gratuit compris

OpenAI déploie GPT-6 auprès de tous les utilisateurs de ChatGPT, y compris la version gratuite, avec Intelligent UI qui transforme les réponses en interfaces manipulables.

Popularité : 1,700
Claude Haiku 5.5 : Anthropic divise la facture du petit modèle par quatre
Modèles

Claude Haiku 5.5 : Anthropic divise la facture du petit modèle par quatre

Anthropic lance Claude Haiku 5.5, son petit modèle le plus rapide à ce jour. Son exploitation coûte environ 75 % moins cher que Haiku 4.5, et Sonnet 5.5 voit aussi son cache baisser de moitié.

Popularité : 1,500
Mistral Large 4 (Le Chonk) : la preview du modèle 1T aux poids ouverts
Modèles

Mistral Large 4 (Le Chonk) : la preview du modèle 1T aux poids ouverts

Mistral présente son nouveau modèle amiral, un modèle multimodal de 1 000 milliards de paramètres. Pour l'instant, seule l'API d'aperçu est accessible : les poids ne seront publiés qu'à la fin du mois.

Popularité : 1,600
Nano Banana 2.1 : moitié prix, 23 jours pour migrer
Modèles

Nano Banana 2.1 : moitié prix, 23 jours pour migrer

Google lance Nano Banana 2.1 et divise presque par deux le tarif de ses images générées, mais augmente le coût des entrées. L'ancien modèle disparaît le 29 octobre.

Popularité : 1,300