Reflection AI stellt sein erstes offenes Modell vor: 501 Milliarden Parameter, gebaut fürs Programmieren. Die Gewichte sollen noch in diesem Monat unter Apache 2.0 erscheinen. Bis dahin gibt es nur eine Warteliste.
Was hinter Reflection Beam steckt
Das US-Labor Reflection AI hat am 5. Oktober Beam vorgestellt. Beam ist ein sparse Mixture-of-Experts-Modell, kurz MoE. Solche Modelle haben viele Parameter, aktivieren aber pro Wort nur einen kleinen Teil davon. Bei Beam sind es 501 Milliarden Parameter insgesamt und 23 Milliarden, die pro Token tatsächlich rechnen.
Der Ansatz spart Geld bei der Ausführung. Ein dichtes Modell mit 501 Milliarden Parametern würde bei jeder Antwort alle Gewichte durchlaufen lassen, was selbst dann viel Rechenleistung kostet, wenn die Aufgabe klein ist. Beam weckt nur die Experten, die für den jeweiligen Schritt gebraucht werden. Für Teams, die pro Token bezahlen, ist das der eigentliche Reiz.
Beam arbeitet mit Text. Bilder oder Audio verarbeitet es nicht. Der Schwerpunkt liegt auf Code, logischem Schlussfolgern und agentischen Aufgaben, also Jobs, bei denen das Modell eigenständig Schritte plant, Werkzeuge aufruft und eine Aufgabe durcharbeitet, statt nur eine einzelne Frage zu beantworten und danach still zu warten.
Herunterladen lässt sich Beam noch nicht. Reflection führt nach eigenen Angaben die letzten Red-Team-Tests und Bewertungen durch und hat eine Frühzugangsliste geöffnet. Die Gewichte, der technische Bericht, die Modellkarte und Entwickler-Artefakte sollen später in diesem Monat folgen.
Warum die Apache-2.0-Lizenz für Unternehmen zählt
Das ist mehr als ein Fußnotendetail. Apache 2.0 erlaubt es Firmen, das Modell kommerziell zu betreiben und anzupassen, ohne die Nutzungsauflagen, die manche offenen Veröffentlichungen mitbringen. Wer Beam in ein eigenes Produkt einbaut, muss keine Nutzerzahlen offenlegen und keine Lizenzgebühren abführen.
Reflection positioniert Beam als westliche Antwort auf die offenen Gewichte aus China. Die Konkurrenz ist gut: DeepSeek, Kimi, GLM und Qwen haben in den vergangenen Monaten starke offene Modelle nachgelegt. Ein permissiv lizenziertes Modell aus den USA mit ähnlicher Klasse füllt für europäische Firmen eine Lücke, die sich zuletzt immer stärker bemerkbar gemacht hat.
Beam und das Training mit über 100 Millionen Rollouts
Reflection hat Beam auf 23,8 Billionen Token vortrainiert, gezogen aus dem Web und aus lizenzierten Datensätzen. Das ist die Lese-Diät, aus der das Modell sein Allgemeinwissen bezieht, und die Zahl bewegt sich im Rahmen vergleichbarer offener Basismodelle.
Der auffälligere Teil ist die Phase des bestärkenden Lernens, also jenes Trainingsschritts, in dem ein Modell Aufgaben löst, bewertet wird und sich danach anpasst. Reflection lief diese Phase eigenen Angaben zufolge auf 10.500 NVIDIA-GB300-GPUs über vier Wochen und erzeugte mehr als 100 Millionen Rollouts mit einer maximalen Kontextlänge von 256.000 Token. Zum Vergleich: Inkling kam laut Reflection auf 30 Millionen Rollouts.
Für Leser ohne Hintergrundwissen: Ein größerer RL-Lauf heißt meist besseres mehrstufiges Schlussfolgern. Schwere RL zeigt sich in Aufgaben, bei denen ein Modell versuchen, prüfen und sich selbst korrigieren muss, etwa beim Debuggen von Code oder beim Verfolgen eines Fehlers über mehrere Dateien. Reflection gibt an, dass die Ergebnisse mit steigendem RL-Aufwand weiter zulegten, ohne dass ein Plateau sichtbar wurde.
Beams Coding-Ergebnisse laut Reflection
Alle folgenden Zahlen stammen von Reflection selbst. Sie sind nicht unabhängig überprüft. Auf SWE-bench Verified, das misst, ob ein Modell echte GitHub-Probleme beheben kann, erreicht Beam 80,9 Punkte. Auf Terminal Bench v2.1, einem Test für Kommandozeilen- und mehrstufige Terminal-Aufgaben, kommt es auf 80,1.
Das sind starke Werte, doch sie liegen unter mehreren chinesischen offenen Modellen. Kimi K3 meldet 88,3 auf Terminal Bench, DeepSeek V4.1 Flash 90,6, Qwen 3.8-Max 86,6 und GLM 5.3 88,2. Gegen GLM 5.2 ist Beam mit 80,1 zu 81,0 knapp dahinter.
Modell | Terminal Bench v2.1 | SWE-bench Verified |
|---|---|---|
Reflection Beam | 80,1 | 80,9 |
GLM 5.2 | 81,0 | nicht berichtet |
GLM 5.3 | 88,2 | nicht berichtet |
Kimi K3 | 88,3 | nicht berichtet |
Qwen 3.8-Max | 86,6 | nicht berichtet |
Reflection räumt die Lücke offen ein. Beam sei auf Coding- und Agenten-Aufgaben konkurrenzfähig mit GLM 5.2 und nähere sich Qwen 3.8-Max an, während Modelle wie Kimi K3 bei der rohen Fähigkeit vorn blieben. Der Anspruch lautet also nicht, die Bestenliste anzuführen.
Der eigentliche Verkaufsargument: Effizienz bei der Ausführung
Wo gewinnt Beam dann? Bei der Effizienz zur Inferenzzeit, also in dem Moment, in dem ein Modell eine Anfrage beantwortet. Reflection sagt, Beam erreiche Reasoning-Werte vergleichbar mit GLM 5.2 und brauche dafür drei- bis viermal weniger Rechenleistung. Gegen Modelle der Zwei-Billionen-Parameter-Klasse wie Qwen 3.8-Max werde der Abstand noch deutlicher.
Diese Angabe sollten Sie mit Vorsicht lesen. Der Vergleich ist kein gemessener Dollarbetrag. Reflection hat den Rechenaufwand des Vorwärtsdurchlaufs geschätzt, auf Basis der aktiven Parameterzahl und der erzeugten Token, mit Daten von Artificial Analysis und DataCurve. Die Schätzung lässt Prompt-Verarbeitung, Attention und Serving-Overhead außen vor. Das Unternehmen räumt selbst ein, dass dies ein ungefährer Rechenvergleich ist und kein gemessener Kostenbenchmark.
Die Logik dahinter bleibt trotzdem solide. Ein sparse Modell, das pro Token 23 Milliarden Parameter aktiviert, sollte weniger Rechenleistung ziehen als ein dichtes Modell ähnlicher Fähigkeit. Für Teams, die pro Token zahlen, kann sich das in niedrigeren Rechnungen bei rechenintensiven Coding- und Agenten-Workflows niederschlagen.
Was für Beam spricht
- Permissive Apache-2.0-Lizenz für kommerziellen Einsatz
- Hohe Effizienz laut Herstellerangabe
- Vollständig von Grund auf trainiert
- Starker Fokus auf Coding und Agenten
Was noch offen ist
- Gewichte noch nicht veröffentlicht
- Keine unabhängigen Tests
- Effizienzwerte sind Schätzungen
- Rückstand bei roher Fähigkeit
Was Sie vor der Veröffentlichung der Gewichte beobachten sollten
Die größte offene Frage ist die Überprüfung. Jeder bisherige Wert stammt aus dem eigenen Testprogramm von Reflection, und die breite Öffentlichkeit hat Beam noch nicht laufen lassen. Unabhängige Tests nach der Veröffentlichung werden zeigen, ob das Effizienzversprechen im Produktivbetrieb hält.
Die zweite Frage betrifft die Verfügbarkeit. Wenn die Gewichte in wenigen Wochen unter einer permissiven Lizenz kommen, haben Teams, die offene Modelle gegen reine API-Angebote abwägen, einen Grund, mit langfristigen Verträgen zu warten, bis sie Beam selbst testen können. Hält die Effizienz einer genaueren Prüfung stand, wäre ein 501B-Modell, das sich wie ein deutlich kleineres betreiben lässt, eine ernstzunehmende Option für Unternehmens-Coding.
Bis dahin gilt: Interessierte können sich für den Frühzugang registrieren. Ein Urteil steht erst an, wenn die Gewichte da sind und unabhängige Tester sie in die Hand bekommen.






