O Beam é o primeiro modelo de pesos abertos da Reflection AI: 501 bilhões de parâmetros que chegam perto de sistemas chineses bem maiores em testes de programação. Os pesos e a pilha de ajuste fino ficam prometidos para este mês.
O que o Reflection Beam é de fato
A Reflection AI, laboratório sediado nos Estados Unidos, apresentou o Beam no dia 5 de outubro. Trata-se de um modelo esparso do tipo mixture-of-experts, com 501 bilhões de parâmetros no total e 23 bilhões ativos por token. Esse desenho mantém o modelo grande no papel, mas desperta só uma parte dele a cada palavra gerada, então rodá-lo custa menos do que o número de parâmetros sugere.
O treinamento foi concentrado em programação, raciocínio e tarefas agênticas, ou seja, trabalhos em que o modelo planeja etapas, chama ferramentas e resolve uma tarefa sozinho em vez de responder a uma única pergunta. O Beam trabalha apenas com texto; não lida com imagem nem áudio.
Ainda não dá para baixar o modelo. A Reflection está na fase final de red team e de avaliações e abriu inscrições para acesso antecipado. A liberação dos pesos sob licença Apache 2.0, junto com o relatório técnico, o model card e os artefatos para desenvolvedores, está prevista para este mês. A licença importa para empresas: o Apache 2.0 permite rodar e modificar o modelo comercialmente sem as restrições de uso que acompanham alguns lançamentos abertos.
Como o Beam foi treinado: 23,8 trilhões de tokens
A Reflection pré-treinou o Beam com 23,8 trilhões de tokens vindos da web e de conjuntos de dados licenciados. É um número alinhado ao de outros modelos abertos de porte parecido, a dieta bruta que dá ao modelo o conhecimento geral.
A parte menos comum é a etapa de aprendizado por reforço. A Reflection rodou essa fase em 10,5 mil GPUs NVIDIA GB300 durante quatro semanas, gerando mais de 100 milhões de rollouts com contexto de até 256 mil tokens. Segundo a empresa, é uma das maiores rodadas de RL já feitas por um laboratório aberto. O RL é a etapa em que o modelo pratica problemas, recebe uma nota e se ajusta, então uma rodada grande costuma significar raciocínio de vários passos melhor.
Por que isso importa na prática? O RL pesado aparece em tarefas em que o modelo precisa tentar, conferir e se corrigir, como depurar código ou rastrear um bug por vários arquivos. A Reflection afirma que suas notas seguiam subindo conforme o volume de RL aumentava.
Os benchmarks do Beam, segundo a Reflection
Todos os números desta seção são da própria Reflection e não passaram por verificação independente. No SWE-bench Verified, que mede se o modelo consegue resolver issues reais do GitHub, o Beam marcou 80,9. No Terminal Bench v2.1, um teste de comandos e tarefas de terminal em vários passos, chegou a 80,1.
São marcas fortes, mas ficam abaixo de vários modelos abertos chineses. O Kimi K3 reportou 88,3 no Terminal Bench; o DeepSeek V4.1 Flash, 90,6; o Qwen 3.8-Max, 86,6; e o GLM 5.3, 88,2. Contra o GLM 5.2, o Beam fica perto: 80,1 contra 81,0.
A Reflection reconhece a distância. Diz que o Beam é competitivo com o GLM 5.2 e se aproxima do Qwen 3.8-Max em código e tarefas agênticas, enquanto modelos como o Kimi K3 seguem à frente em capacidade bruta.
Modelo | Terminal Bench v2.1 | SWE-bench Verified |
|---|---|---|
Reflection Beam | 80,1 | 80,9 |
GLM 5.2 | 81,0 | não reportado |
GLM 5.3 | 88,2 | não reportado |
Kimi K3 | 88,3 | não reportado |
Qwen 3.8-Max | 86,6 | não reportado |
A proposta do Beam não é ganhar a tabela. É se aproximar dos líderes custando menos para rodar. Simples assim.
Eficiência de inferência: o argumento de venda
Onde o Beam de fato reivindica vantagem é na eficiência de inferência, o momento em que o modelo responde a um pedido. A Reflection diz que o Beam alcança notas de raciocínio comparáveis às do GLM 5.2 usando de 3 a 4 vezes menos computação de inferência, e que a diferença aumenta contra modelos da família de 2 trilhões de parâmetros, como o Qwen 3.8-Max.
Vale tratar essa alegação com cautela. A comparação não é um custo medido em dólares. A Reflection estimou a computação das passagens diretas com uma aproximação baseada em parâmetros ativos e tokens gerados, usando dados da Artificial Analysis e da DataCurve. O cálculo deixa de fora o processamento do prompt, a atenção e a sobrecarga do serviço, algo que a própria empresa admite, o que transforma isso numa comparação aproximada e não numa medição real de custo.
Ainda assim, a lógica de fundo se sustenta. Um modelo esparso que ativa 23 bilhões de parâmetros por token deve consumir menos computação do que um modelo denso de capacidade parecida, e para equipes que pagam por token isso pode significar contas menores em cargas pesadas de código e agentes.
O que observar antes de os pesos saírem
A maior dúvida em aberto é a verificação. Cada nota veio da bateria de testes da própria Reflection, e o público ainda não rodou o Beam. Testes independentes depois do lançamento vão decidir se a promessa de eficiência se mantém em produção.
A disponibilidade é o outro fator. Com os pesos prometidos dentro de algumas semanas e sob licença permissiva, equipes que pesam modelos abertos contra opções exclusivas de API têm motivo para esperar antes de fechar compromissos de longo prazo. Se os números de eficiência resistirem ao escrutínio, um modelo de 501B que se comporta como um menor será uma opção realmente útil para trabalho de programação em empresas.






