Beam est le premier modèle à poids ouverts de Reflection AI : 501 milliards de paramètres qui frôlent des systèmes chinois bien plus gros sur les tests de code. Les poids, le rapport technique et la pile d'affinage sont annoncés pour la fin du mois.
Ce qu'est vraiment Beam, le modèle de Reflection AI
Reflection AI, un laboratoire américain, a présenté Beam le 5 octobre. Il s'agit d'un modèle à mélange d'experts (MoE), une architecture qui découpe le réseau en plusieurs spécialistes et n'en active qu'une partie à chaque mot produit. Beam affiche 501 milliards de paramètres au total, dont 23 milliards activés par jeton. Cette conception lui permet de rester imposant sur le papier tout en coûtant moins à faire tourner que ce que laisse croire le nombre de paramètres.
L'entreprise l'a entraîné en visant surtout le code, le raisonnement et les tâches dites agentiques, autrement dit celles où le modèle planifie des étapes, appelle des outils et mène un travail de bout en bout plutôt que de répondre à une seule question. C'est un modèle texte uniquement : il ne traite ni images ni sons.
Beam n'est pas encore téléchargeable. Reflection mène ses derniers tests de robustesse et ses évaluations, et a ouvert les inscriptions en accès anticipé. La publication des poids sous licence Apache 2.0, accompagnée du rapport technique, de la fiche modèle et des outils pour développeurs, est prévue pour la fin du mois. Cette licence compte pour les entreprises : Apache 2.0 les autorise à exécuter et à modifier le modèle à des fins commerciales, sans les restrictions d'usage qui accompagnent certaines sorties ouvertes.
L'entraînement de Beam : 23,8 billions de jetons et 100 millions de rollouts
Reflection a préentraîné Beam sur 23,8 billions de jetons tirés du web et de jeux de données sous licence, un volume comparable à celui des autres modèles ouverts de même taille. C'est le régime de base qui lui donne ses connaissances générales.
La partie la plus inhabituelle arrive à l'étape de l'apprentissage par renforcement. Reflection l'a fait tourner sur 10 500 GPU NVIDIA GB300 pendant quatre semaines, générant plus de 100 millions de rollouts avec une longueur de contexte maximale de 256 000 jetons. Le laboratoire affirme qu'il s'agit de l'une des plus grosses phases de renforcement jamais menées par un laboratoire ouvert. Concrètement, c'est l'étape où le modèle s'exerce sur des problèmes, reçoit une note et ajuste son comportement : un entraînement plus long se traduit en général par un meilleur raisonnement en plusieurs étapes.
Pourquoi cela vous concerne-t-il ? Un renforcement intensif se remarque sur les tâches où le modèle doit essayer, vérifier et se corriger, comme déboguer du code ou traquer un défaut à travers plusieurs fichiers. Reflection indique que ses scores continuaient de grimper à mesure que le calcul de renforcement augmentait.
Les scores de Beam en code, selon Reflection AI
Tous les chiffres de cette partie sont publiés par Reflection et n'ont pas été vérifiés de manière indépendante. Sur SWE-bench Verified, qui mesure si un modèle sait résoudre de vraies anomalies GitHub, Beam obtient 80,9. Sur Terminal Bench v2.1, un test de commandes en ligne et de tâches en plusieurs étapes au terminal, il atteint 80,1.
Ce sont de bons résultats, mais ils restent derrière plusieurs modèles ouverts chinois. Kimi K3 annonce 88,3 sur Terminal Bench, DeepSeek V4.1 Flash 90,6, Qwen 3.8-Max 86,6 et GLM 5.3 88,2. Face à GLM 5.2, Beam reste proche : 80,1 contre 81,0.
Reflection reconnaît l'écart. L'entreprise dit que Beam est compétitif avec GLM 5.2 et s'approche de Qwen 3.8-Max sur le code et les tâches agentiques, tandis que des modèles comme Kimi K3 gardent l'avantage en capacité brute.
Modèle | Terminal Bench v2.1 | SWE-bench Verified |
|---|---|---|
Reflection Beam | 80,1 | 80,9 |
GLM 5.2 | 81,0 | non communiqué |
GLM 5.3 | 88,2 | non communiqué |
Kimi K3 | 88,3 | non communiqué |
Qwen 3.8-Max | 86,6 | non communiqué |
L'argument de Beam n'est pas de trôner en tête du classement. C'est d'approcher les meneurs en coûtant moins cher à exécuter. Voilà toute la nuance.
L'efficacité d'inférence, son vrai atout
Là où Beam revendique un avantage, c'est sur l'efficacité à l'inférence, le moment où le modèle répond à une requête. Reflection assure atteindre des scores de raisonnement comparables à ceux de GLM 5.2 en consommant trois à quatre fois moins de calcul d'inférence, et que l'écart se creuse face aux modèles de la famille des 2 000 milliards de paramètres comme Qwen 3.8-Max.
À prendre avec prudence. La comparaison n'est pas un coût mesuré en euros. Reflection a estimé le calcul des passes avant à partir d'une approximation fondée sur les paramètres actifs et les jetons générés, en s'appuyant sur des données d'Artificial Analysis et de DataCurve. Le calcul laisse de côté le traitement du prompt, l'attention et la surcharge de service, ce que l'entreprise admet elle-même. C'est donc une comparaison approximative, pas une mesure réelle de coût.
La logique de fond tient toutefois debout. Un modèle creux qui active 23 milliards de paramètres par jeton devrait consommer moins de calcul qu'un modèle dense d'une capacité voisine. Pour les équipes qui paient au jeton, cela peut se traduire par des factures plus légères sur les charges de travail de code et d'agents à fort volume.
Ce qu'il faut surveiller avant l'arrivée des poids
La grande question ouverte, c'est la vérification. Chaque score vient de la propre batterie de tests de Reflection, et le public n'a pas encore fait tourner Beam. Les tests indépendants après la sortie diront si la promesse d'efficacité tient en production.
La disponibilité est l'autre facteur. Avec des poids annoncés sous quelques semaines et sous licence permissive, les équipes qui hésitent entre modèles ouverts et offres exclusivement accessibles par API ont une raison d'attendre avant de s'engager sur le long terme. Si les chiffres d'efficacité résistent à l'examen, un modèle de 501 milliards de paramètres qui se comporte comme un plus petit sera une option réellement utile pour le travail de code en entreprise.






