Modelos

Beam da Reflection AI: o modelo aberto de 501B feito para código

O Beam é o primeiro modelo de pesos abertos da Reflection AI: 501 bilhões de parâmetros que chegam perto de sistemas chineses bem maiores em testes de programação. Os pesos e a pilha de ajuste fino ficam prometidos para este mês.

Mariana SilvaMariana Silva
Popularidade: 1,250
Beam da Reflection AI: o modelo aberto de 501B feito para código

O Beam é o primeiro modelo de pesos abertos da Reflection AI: 501 bilhões de parâmetros que chegam perto de sistemas chineses bem maiores em testes de programação. Os pesos e a pilha de ajuste fino ficam prometidos para este mês.

O que o Reflection Beam é de fato

A Reflection AI, laboratório sediado nos Estados Unidos, apresentou o Beam no dia 5 de outubro. Trata-se de um modelo esparso do tipo mixture-of-experts, com 501 bilhões de parâmetros no total e 23 bilhões ativos por token. Esse desenho mantém o modelo grande no papel, mas desperta só uma parte dele a cada palavra gerada, então rodá-lo custa menos do que o número de parâmetros sugere.

O treinamento foi concentrado em programação, raciocínio e tarefas agênticas, ou seja, trabalhos em que o modelo planeja etapas, chama ferramentas e resolve uma tarefa sozinho em vez de responder a uma única pergunta. O Beam trabalha apenas com texto; não lida com imagem nem áudio.

Ainda não dá para baixar o modelo. A Reflection está na fase final de red team e de avaliações e abriu inscrições para acesso antecipado. A liberação dos pesos sob licença Apache 2.0, junto com o relatório técnico, o model card e os artefatos para desenvolvedores, está prevista para este mês. A licença importa para empresas: o Apache 2.0 permite rodar e modificar o modelo comercialmente sem as restrições de uso que acompanham alguns lançamentos abertos.

Como o Beam foi treinado: 23,8 trilhões de tokens

A Reflection pré-treinou o Beam com 23,8 trilhões de tokens vindos da web e de conjuntos de dados licenciados. É um número alinhado ao de outros modelos abertos de porte parecido, a dieta bruta que dá ao modelo o conhecimento geral.

A parte menos comum é a etapa de aprendizado por reforço. A Reflection rodou essa fase em 10,5 mil GPUs NVIDIA GB300 durante quatro semanas, gerando mais de 100 milhões de rollouts com contexto de até 256 mil tokens. Segundo a empresa, é uma das maiores rodadas de RL já feitas por um laboratório aberto. O RL é a etapa em que o modelo pratica problemas, recebe uma nota e se ajusta, então uma rodada grande costuma significar raciocínio de vários passos melhor.

Por que isso importa na prática? O RL pesado aparece em tarefas em que o modelo precisa tentar, conferir e se corrigir, como depurar código ou rastrear um bug por vários arquivos. A Reflection afirma que suas notas seguiam subindo conforme o volume de RL aumentava.

Os benchmarks do Beam, segundo a Reflection

Todos os números desta seção são da própria Reflection e não passaram por verificação independente. No SWE-bench Verified, que mede se o modelo consegue resolver issues reais do GitHub, o Beam marcou 80,9. No Terminal Bench v2.1, um teste de comandos e tarefas de terminal em vários passos, chegou a 80,1.

São marcas fortes, mas ficam abaixo de vários modelos abertos chineses. O Kimi K3 reportou 88,3 no Terminal Bench; o DeepSeek V4.1 Flash, 90,6; o Qwen 3.8-Max, 86,6; e o GLM 5.3, 88,2. Contra o GLM 5.2, o Beam fica perto: 80,1 contra 81,0.

A Reflection reconhece a distância. Diz que o Beam é competitivo com o GLM 5.2 e se aproxima do Qwen 3.8-Max em código e tarefas agênticas, enquanto modelos como o Kimi K3 seguem à frente em capacidade bruta.

Modelo

Terminal Bench v2.1

SWE-bench Verified

Reflection Beam

80,1

80,9

GLM 5.2

81,0

não reportado

GLM 5.3

88,2

não reportado

Kimi K3

88,3

não reportado

Qwen 3.8-Max

86,6

não reportado

A proposta do Beam não é ganhar a tabela. É se aproximar dos líderes custando menos para rodar. Simples assim.

Eficiência de inferência: o argumento de venda

Onde o Beam de fato reivindica vantagem é na eficiência de inferência, o momento em que o modelo responde a um pedido. A Reflection diz que o Beam alcança notas de raciocínio comparáveis às do GLM 5.2 usando de 3 a 4 vezes menos computação de inferência, e que a diferença aumenta contra modelos da família de 2 trilhões de parâmetros, como o Qwen 3.8-Max.

Vale tratar essa alegação com cautela. A comparação não é um custo medido em dólares. A Reflection estimou a computação das passagens diretas com uma aproximação baseada em parâmetros ativos e tokens gerados, usando dados da Artificial Analysis e da DataCurve. O cálculo deixa de fora o processamento do prompt, a atenção e a sobrecarga do serviço, algo que a própria empresa admite, o que transforma isso numa comparação aproximada e não numa medição real de custo.

Ainda assim, a lógica de fundo se sustenta. Um modelo esparso que ativa 23 bilhões de parâmetros por token deve consumir menos computação do que um modelo denso de capacidade parecida, e para equipes que pagam por token isso pode significar contas menores em cargas pesadas de código e agentes.

O que observar antes de os pesos saírem

A maior dúvida em aberto é a verificação. Cada nota veio da bateria de testes da própria Reflection, e o público ainda não rodou o Beam. Testes independentes depois do lançamento vão decidir se a promessa de eficiência se mantém em produção.

A disponibilidade é o outro fator. Com os pesos prometidos dentro de algumas semanas e sob licença permissiva, equipes que pesam modelos abertos contra opções exclusivas de API têm motivo para esperar antes de fechar compromissos de longo prazo. Se os números de eficiência resistirem ao escrutínio, um modelo de 501B que se comporta como um menor será uma opção realmente útil para trabalho de programação em empresas.

Compartilhar esta notícia

Fontes

Notícias de IA relacionadas

GPT-6 e Intelligent UI chegam a todos os usuários do ChatGPT
Modelos

GPT-6 e Intelligent UI chegam a todos os usuários do ChatGPT

O GPT-6 saiu da fase de testes e chegou a todos os usuários do ChatGPT, com uma novidade que muda a cara das respostas. Em vez de só texto, o assistente agora monta gráficos, botões e formulários na própria conversa.

Popularidade: 1,700
Anthropic corta custo do Claude Haiku 5.5 em 75%
Modelos

Anthropic corta custo do Claude Haiku 5.5 em 75%

A Anthropic lançou o Haiku 5.5, seu modelo pequeno mais barato de operar até agora. Além de mover a peça mais pesada do custo, a empresa cortou pela metade o preço da leitura de cache do Sonnet 5.5.

Popularidade: 1,500
Mistral Large 4: prévia do modelo aberto de 1 trilhão de parâmetros
Modelos

Mistral Large 4: prévia do modelo aberto de 1 trilhão de parâmetros

A Mistral apresentou o Mistral Large 4, seu maior modelo até hoje, com 1 trilhão de parâmetros e o apelido de "Le Chonk". Por enquanto, só a API está no ar. Os pesos abertos, que permitem rodar o modelo em servidor próprio, devem sair apenas no fim de outubro.

Popularidade: 1,600
Nano Banana 2.1 sai com metade do preço e 23 dias para migrar
Modelos

Nano Banana 2.1 sai com metade do preço e 23 dias para migrar

O Google colocou no ar o Nano Banana 2.1, a nova versão do seu gerador de imagens, e cortou o preço por imagem quase pela metade. O modelo antigo será desligado em 29 de outubro, o que deixa 23 dias para quem o usa na API migrar.

Popularidade: 1,300