Grok 4.7 kostet genauso viel wie Grok 4.6, rund einen Monat nach dessen Start. Der Zugewinn verteilt sich aber ungleich: Bei Terminal-Aufgaben fast eine Verdopplung, anderswo kaum ein Unterschied. Dazu steigt der Token-Verbrauch deutlich.
Gleicher Preis, neues Modell darunter
Auf den ersten Blick sieht der Wechsel harmlos aus, weil beide Modelle 2 US-Dollar pro eine Million Input-Tokens und 6 US-Dollar pro eine Million Output-Tokens kosten. Wer nur den Listenpreis vergleicht, findet keinen Grund zum Umsteigen.
Unter der Oberfläche hat xAI jedoch ein größeres Basismodell eingebaut und länger mit Reinforcement Learning trainiert. Die Trainingsphase zielt auf Aufgaben, die mehrere Stunden dauern können, etwa das Durcharbeiten einer großen Codebasis oder mehrstufige Recherchen. Das erklärt, warum sich die Unterschiede nicht gleichmäßig über alle Tests verteilen, sondern sich an wenigen Stellen bündeln.
Wo der Sprung am größten ist
Der auffälligste Unterschied zeigt sich beim Terminal-Bench 4.0, wo sich der Wert innerhalb eines Monats fast verdoppelt hat. Laut xAI kommt Grok 4.7 auf 38,0 Prozent, Grok 4.6 auf 20,3 Prozent.
Auch auf CursorBench 4.0 legt das neue Modell zu: 46,3 gegenüber 40,4 Prozent, was einem Zuwachs von knapp sechs Prozentpunkten entspricht. Beim AA Briefcase steht es 1.657 zu 1.546 Punkten. Der Gewinn sammelt sich also vor allem dort, wo ein Modell mehrere Arbeitsschritte am Terminal durchhalten muss, statt nach einer einzelnen Antwort abzubrechen.
Ein Vorbehalt gehört dazu, weil die Werte nicht dieselbe Reasoning-Stufe messen und der Vergleich deshalb nicht ganz sauber ist: Grok 4.7 trat mit xhigh an, Grok 4.6 mit high.
Wo sich kaum etwas ändert
Abseits der Terminal- und Coding-Aufgaben bleibt der Unterschied klein, was sich im Intelligence Index von Artificial Analysis zeigt: Grok 4.7 liegt bei 46 Punkten, Grok 4.6 bei 44. Der Abstand beträgt zwei Punkte.
Bei der Genauigkeit gibt es sogar eine leichte Verschiebung nach unten. Sie fällt von 48 auf 47 Prozent, praktisch unverändert. Beim Index geht es dagegen von 30 auf 32 Punkte nach oben.
Interessanter ist die Fehlerquote. Im Omniscience-Test von Artificial Analysis kommt Grok 4.7 bei hohem Aufwand auf 29 Prozent, Grok 4.6 bei 34 Prozent. Das neue Modell erfindet also etwas seltener Inhalte. Der Rückgang um fünf Prozentpunkte ist der zweite klare Gewinn neben den Terminal-Werten, und für Anwendungen, bei denen erfundene Angaben echten Schaden anrichten, wiegt er schwerer als ein paar Punkte beim Score.
Der Token-Verbrauch frisst einen Teil des Vorteils
Ein Punkt wird in den Werbetexten gern übersehen. Für eine Aufgabe erzeugte Grok 4.7 rund 81.000 Output-Tokens, Grok 4.6 nur etwa 36.000. Das neue Modell braucht also gut das Doppelte, um ans Ziel zu kommen.
Bei gleichem Listenpreis kann dieselbe Aufgabe dadurch teurer werden, weil jede Anfrage mehr Rechenzeit und mehr ausgegebene Token verursacht. Wer Grok 4.7 einsetzt, sollte den tatsächlichen Verbrauch messen und nicht nur den Preis pro Million Token. xAI verlangt zudem höhere Sätze, sobald der Prompt über 200.000 Token steigt, und die Fast-Variante kostet das Doppelte.
Die Zahl der Parameter bleibt unbestätigt
In Berichten taucht die Angabe auf, Grok 4.7 habe 2,1 Billionen Parameter, rund 40 Prozent mehr als die 1,5 Billionen von Grok 4.6. Diese Zahl stammt aus Medienberichten und geht auf Elon Musk zurück, xAI hat sie nicht offiziell bestätigt.
Wer die Modellgröße als Argument für einen Wechsel nimmt, sollte das im Hinterkopf behalten, weil sich Größe nicht direkt in Leistung umrechnen lässt. Sicher belegt sind bislang nur der größere Basisansatz und die längere Trainingsphase.
Wann ein Wechsel in Frage kommt
Ob sich der Umstieg lohnt, hängt vom eigenen Aufgabentyp ab. Wer viel mit Coding-Agenten, Terminal-Abläufen und mehrstündigen Aufgaben arbeitet, profitiert vom Zuwachs beim Terminal-Bench und von der niedrigeren Fehlerquote. Wer hauptsächlich kurze Anfragen stellt, merkt dagegen kaum einen Unterschied und zahlt durch den höheren Token-Verbrauch womöglich mehr. Lohnt sich der Wechsel für Sie?
Wer sich unsicher ist, kann beide Modelle auf den eigenen Aufgaben laufen lassen und die Kosten pro erledigter Aufgabe vergleichen. Der Listenpreis liefert dafür keine Antwort.





