Grok 4.6 e Grok 4.7 custam exatamente o mesmo: US$ 2 na entrada e US$ 6 na saída por milhão de tokens. O que muda é o esforço que o modelo novo coloca em cada tarefa, e esse esforço aparece no consumo de tokens. Compare os dois antes de decidir se vale trocar.
A troca aconteceu em um só lugar
O Grok 4.7 saiu no dia 21 de setembro, 40 dias depois do Grok 4.6. Os dois têm o mesmo preço, a mesma janela de contexto de 500 mil tokens e a mesma entrada de texto e imagem. A diferença construída pela SpaceXAI está em outro ponto: o 4.7 usa uma base maior e treinou por mais tempo em tarefas difíceis, com foco em trabalho que dura horas.
Essa escolha concentra o ganho. Em quase todos os testes divulgados, o avanço aparece onde a tarefa é longa e exige várias etapas. Em perguntas simples, a mudança é pequena.
Mesma tabela de preços
Não há economia nem custo extra na taxa por token:
Item | Grok 4.6 | Grok 4.7 |
|---|---|---|
Entrada | US$ 2 (R$ 10,24) | US$ 2 (R$ 10,24) |
Saída | US$ 6 (R$ 30,72) | US$ 6 (R$ 30,72) |
Entrada em cache | US$ 0,50 | US$ 0,50 |
Acima de 200 mil tokens | US$ 4 / US$ 12 | US$ 4 / US$ 12 |
A tabela é idêntica linha por linha. O que muda é quanto o modelo gasta para completar uma tarefa.
Onde o 4.7 avança
O ganho mais forte está em Terminal-Bench 4.0, que mede uso de terminal por agentes. A SpaceXAI reporta 37,6% para o 4.7 contra 20,3% do 4.6, praticamente o dobro. No CursorBench 4.0, voltado a tarefas longas de programação, o 4.7 marca 46,3% contra 40,4%.
O Artificial Analysis, que roda testes próprios, também enxergou avanço na parte de código. Com o Grok Build, o Grok 4.7 subiu para 56 no Coding Agent Index, contra 47 do Grok 4.6. Nas três partes que compõem o índice, o DeepSWE v1.1 foi de 65% para 73%, o Terminal-Bench 4.0 de 18% para 33% e o SWE-Atlas-QnA de 58% para 63%.
Em trabalho de conhecimento, o Artificial Analysis registrou ganho de 111 pontos de Elo no AA-Briefcase, chegando a 1657, atrás apenas de Claude Opus 5 e Claude Fable 5.1.
O que melhorou no Grok 4.7
- Terminal-Bench 4.0: 20,3% para 37,6%
- CursorBench 4.0: 40,4% para 46,3%
- Coding Agent Index: 47 para 56
- AA-Briefcase: +111 pontos de Elo
O que ficou igual ou piorou
- Preço por token: idêntico ao Grok 4.6
- Janela de contexto: 500 mil tokens nos dois
- Precisão em conhecimento: 48% para 47%
- AA-LCR: queda de 3,7 pontos
O que ficou igual ou piorou
Nem tudo melhorou. O Artificial Analysis aponta regressão de 3,7 pontos percentuais no AA-LCR, teste de raciocínio sobre documentos longos, e de 1,1 ponto no AutomationBench-AA. No índice principal, o 4.7 ficou em 46 pontos, dois a mais que o 4.6, o que é uma evolução modesta para uma geração nova.
Na parte de conhecimento, os dois praticamente empatam. A precisão do Grok 4.7 ficou em 47% contra 48% do Grok 4.6, uma diferença dentro da margem de medição. O que melhorou foi a taxa de alucinação: caiu de 34% para 29%. Esse número mede a taxa entre as respostas incorretas, não a frequência de erro no total de respostas.
A conta que muda
Aqui está o ponto que mais pesa na prática. Em uma tarefa do Intelligence Index, o Grok 4.7 consome cerca de 81 mil tokens de saída, contra 36 mil do Grok 4.6. É mais que o dobro. Como o preço por token não mudou, uma tarefa que parecia custar o mesmo pode sair bem mais cara.
O Artificial Analysis registrou ainda queda na pontuação do maior índice: 15 pontos abaixo do valor do Grok 4.6 nesse composto. Parte da diferença vem de metodologia e da mistura de testes, mas o dado serve de alerta. Mais tokens para um resultado que não é proporcionalmente maior significa custo por tarefa mais alto.
Existe também um ruído a esclarecer: o número de 2,1 trilhões de parâmetros foi citado pelo próprio Elon Musk e não aparece na documentação oficial da SpaceXAI. Trate a cifra com cautela.
Se vale trocar
O Grok 4.7 compensa quem trabalha com agentes autônomos e tarefas longas de programação, exatamente onde o modelo novo avançou. Para esse perfil, o ganho no Terminal-Bench e no Coding Agent Index justifica testar.
Para quem usa o modelo em perguntas curtas, resumos e tarefas simples, o ganho é pequeno e o consumo maior de tokens tende a encarecer a conta. Nesse caso, o Grok 4.6 continua fazendo sentido.
O caminho mais seguro é rodar as suas próprias tarefas nos dois modelos e comparar o custo total, não só a pontuação. E não deixe de conferir a variante rápida, que está no Cursor e no Grok Build mas fora da API pública: ela custa o dobro, e pode ser a diferença entre esperar e entregar no prazo.





