ComparaçõesEm alta

Grok 4.7 ou 4.6: o que muda com o mesmo preço

O Grok 4.7 mantém o preço do Grok 4.6, mas quase dobra a pontuação no Terminal-Bench 4.0 e reduz a taxa de alucinação de 34% para 29%. Em troca, consome mais que o dobro de tokens por tarefa. Veja onde a troca compensa e onde não compensa.

Emily CarterEmily Carter
Popularidade: 980
Grok 4.7 comparado ao Grok 4.6

Grok 4.6 e Grok 4.7 custam exatamente o mesmo: US$ 2 na entrada e US$ 6 na saída por milhão de tokens. O que muda é o esforço que o modelo novo coloca em cada tarefa, e esse esforço aparece no consumo de tokens. Compare os dois antes de decidir se vale trocar.

A troca aconteceu em um só lugar

O Grok 4.7 saiu no dia 21 de setembro, 40 dias depois do Grok 4.6. Os dois têm o mesmo preço, a mesma janela de contexto de 500 mil tokens e a mesma entrada de texto e imagem. A diferença construída pela SpaceXAI está em outro ponto: o 4.7 usa uma base maior e treinou por mais tempo em tarefas difíceis, com foco em trabalho que dura horas.

Essa escolha concentra o ganho. Em quase todos os testes divulgados, o avanço aparece onde a tarefa é longa e exige várias etapas. Em perguntas simples, a mudança é pequena.

Mesma tabela de preços

Não há economia nem custo extra na taxa por token:

Item

Grok 4.6

Grok 4.7

Entrada

US$ 2 (R$ 10,24)

US$ 2 (R$ 10,24)

Saída

US$ 6 (R$ 30,72)

US$ 6 (R$ 30,72)

Entrada em cache

US$ 0,50

US$ 0,50

Acima de 200 mil tokens

US$ 4 / US$ 12

US$ 4 / US$ 12

A tabela é idêntica linha por linha. O que muda é quanto o modelo gasta para completar uma tarefa.

Onde o 4.7 avança

O ganho mais forte está em Terminal-Bench 4.0, que mede uso de terminal por agentes. A SpaceXAI reporta 37,6% para o 4.7 contra 20,3% do 4.6, praticamente o dobro. No CursorBench 4.0, voltado a tarefas longas de programação, o 4.7 marca 46,3% contra 40,4%.

O Artificial Analysis, que roda testes próprios, também enxergou avanço na parte de código. Com o Grok Build, o Grok 4.7 subiu para 56 no Coding Agent Index, contra 47 do Grok 4.6. Nas três partes que compõem o índice, o DeepSWE v1.1 foi de 65% para 73%, o Terminal-Bench 4.0 de 18% para 33% e o SWE-Atlas-QnA de 58% para 63%.

Em trabalho de conhecimento, o Artificial Analysis registrou ganho de 111 pontos de Elo no AA-Briefcase, chegando a 1657, atrás apenas de Claude Opus 5 e Claude Fable 5.1.

O que melhorou no Grok 4.7

  • Terminal-Bench 4.0: 20,3% para 37,6%
  • CursorBench 4.0: 40,4% para 46,3%
  • Coding Agent Index: 47 para 56
  • AA-Briefcase: +111 pontos de Elo

O que ficou igual ou piorou

  • Preço por token: idêntico ao Grok 4.6
  • Janela de contexto: 500 mil tokens nos dois
  • Precisão em conhecimento: 48% para 47%
  • AA-LCR: queda de 3,7 pontos

O que ficou igual ou piorou

Nem tudo melhorou. O Artificial Analysis aponta regressão de 3,7 pontos percentuais no AA-LCR, teste de raciocínio sobre documentos longos, e de 1,1 ponto no AutomationBench-AA. No índice principal, o 4.7 ficou em 46 pontos, dois a mais que o 4.6, o que é uma evolução modesta para uma geração nova.

Na parte de conhecimento, os dois praticamente empatam. A precisão do Grok 4.7 ficou em 47% contra 48% do Grok 4.6, uma diferença dentro da margem de medição. O que melhorou foi a taxa de alucinação: caiu de 34% para 29%. Esse número mede a taxa entre as respostas incorretas, não a frequência de erro no total de respostas.

A conta que muda

Aqui está o ponto que mais pesa na prática. Em uma tarefa do Intelligence Index, o Grok 4.7 consome cerca de 81 mil tokens de saída, contra 36 mil do Grok 4.6. É mais que o dobro. Como o preço por token não mudou, uma tarefa que parecia custar o mesmo pode sair bem mais cara.

O Artificial Analysis registrou ainda queda na pontuação do maior índice: 15 pontos abaixo do valor do Grok 4.6 nesse composto. Parte da diferença vem de metodologia e da mistura de testes, mas o dado serve de alerta. Mais tokens para um resultado que não é proporcionalmente maior significa custo por tarefa mais alto.

Existe também um ruído a esclarecer: o número de 2,1 trilhões de parâmetros foi citado pelo próprio Elon Musk e não aparece na documentação oficial da SpaceXAI. Trate a cifra com cautela.

Se vale trocar

O Grok 4.7 compensa quem trabalha com agentes autônomos e tarefas longas de programação, exatamente onde o modelo novo avançou. Para esse perfil, o ganho no Terminal-Bench e no Coding Agent Index justifica testar.

Para quem usa o modelo em perguntas curtas, resumos e tarefas simples, o ganho é pequeno e o consumo maior de tokens tende a encarecer a conta. Nesse caso, o Grok 4.6 continua fazendo sentido.

O caminho mais seguro é rodar as suas próprias tarefas nos dois modelos e comparar o custo total, não só a pontuação. E não deixe de conferir a variante rápida, que está no Cursor e no Grok Build mas fora da API pública: ela custa o dobro, e pode ser a diferença entre esperar e entregar no prazo.

Compartilhar esta notícia

Produtos mencionados

Fontes

Notícias de IA relacionadas

Grok 4.7, o novo modelo da xAI
Modelos

Grok 4.7 chega com base maior e o mesmo preço do Grok 4.6

A SpaceXAI lançou o Grok 4.7 com um modelo base maior e treinamento mais longo em tarefas de várias horas, mantendo o preço de US$ 2 e US$ 6 por milhão de tokens. Veja os benchmarks divulgados pela empresa e a leitura independente do Artificial Analysis.

Popularidade: 1,050
GPT-6 Sol e GPT-6 Luna comparados lado a lado
Comparações

GPT-6 Sol ou Luna: qual modelo escolher para cada tarefa

O GPT-6 Sol custa 20 vezes mais por token que o GPT-6 Luna, mas a diferença de desempenho em programação é de apenas 2 pontos percentuais. Compare preços, custo por tarefa e benchmarks divulgados pela OpenAI para decidir qual modelo combina com o seu caso.

Popularidade: 1,180