Reflection AI presenta Beam, su primer modelo de pesos abiertos: 501.000 millones de parámetros que prometen acercarse a los grandes modelos chinos en tareas de código. Las ponderaciones, la documentación y el kit de ajuste llegan este mes.
Qué es exactamente Reflection Beam
Reflection AI, un laboratorio con sede en Estados Unidos, presentó Beam el 5 de octubre. Es un modelo disperso de tipo Mixture of Experts: 501.000 millones de parámetros en total, de los que solo 23.000 millones se activan por cada token. En la práctica, esa arquitectura mantiene al modelo enorme sobre el papel mientras despierta únicamente una parte de él para cada palabra que genera. Resultado: usarlo cuesta menos de lo que sugiere el recuento total.
El entrenamiento se centró en código, razonamiento y flujos de trabajo agénticos. Es decir, tareas en las que el modelo planifica pasos, llama a herramientas y termina un trabajo por su cuenta en lugar de responder a una sola pregunta. Es un modelo solo de texto, así que no gestiona imágenes ni audio.
Solo texto, nada más.
Beam todavía no se puede descargar. Reflection está cerrando las pruebas de red team y las evaluaciones, y ya acepta registros para el acceso anticipado. Todavía no hay fecha exacta. Las ponderaciones bajo licencia Apache 2.0, junto con el informe técnico y la tarjeta del modelo, se publicarán este mes. La licencia importa para las empresas, porque Apache 2.0 permite ejecutar y modificar el modelo con fines comerciales sin las condiciones de uso que arrastran otras liberaciones abiertas.
Así entrenó Reflection su modelo: 23,8 billones de tokens y 100 millones de rollouts
El modelo se preentrenó con 23,8 billones de tokens procedentes de la web y de conjuntos de datos con licencia. Es una cifra al nivel de otros modelos base abiertos de tamaño parecido, la dieta básica que le da su conocimiento general.
Lo llamativo llega en la fase de aprendizaje por refuerzo. Reflection la ejecutó sobre 10.500 GPU NVIDIA GB300 durante cuatro semanas, generando más de 100 millones de rollouts con una longitud de contexto máxima de 256.000 tokens. El laboratorio dice que se trata de una de las mayores fases de RL que ha hecho un laboratorio abierto hasta ahora. El RL es el paso donde el modelo practica problemas, recibe una nota y ajusta su comportamiento, así que un entrenamiento grande debería traducirse en mejor razonamiento de varios pasos.
Para quien se pregunte por qué importa: el RL intensivo se nota en tareas donde el modelo tiene que intentar, comprobar y corregirse, como depurar código o rastrear un fallo entre varios archivos. Reflection asegura que sus resultados seguían subiendo a medida que crecía el cómputo de RL.
Los benchmarks de Beam, según Reflection AI
Todos los números de este apartado los publica Reflection y no han sido verificados de forma independiente. En SWE-bench Verified, que mide si un modelo puede resolver incidencias reales de GitHub, Beam obtiene 80,9. En Terminal Bench v2.1, una prueba de comandos de terminal y tareas de varios pasos, alcanza 80,1.
Son cifras sólidas, pero quedan por debajo de varios modelos abiertos chinos. Kimi K3 reportó 88,3 en Terminal Bench; DeepSeek V4.1 Flash, 90,6; Qwen 3.8-Max, 86,6; y GLM 5.3, 88,2. Frente a GLM 5.2, Beam queda cerca: 80,1 contra 81,0.
Reflection reconoce la distancia. Dice que Beam es competitivo con GLM 5.2 y se acerca a Qwen 3.8-Max en código y tareas agénticas, mientras modelos como Kimi K3 siguen por delante en capacidad bruta.
Modelo | Terminal Bench v2.1 | SWE-bench Verified |
|---|---|---|
Reflection Beam | 80,1 | 80,9 |
GLM 5.2 | 81,0 | no reportado |
GLM 5.3 | 88,2 | no reportado |
Kimi K3 | 88,3 | no reportado |
Qwen 3.8-Max | 86,6 | no reportado |
La propuesta de Beam no es ganar la tabla. Es acercarse a los líderes costando menos de ejecutar.
La eficiencia de inferencia, su verdadero argumento
Donde Beam sí reclama ventaja es en la eficiencia de inferencia, el momento en que el modelo responde a una petición. Reflection dice que alcanza puntuaciones de razonamiento comparables a las de GLM 5.2 usando entre 3 y 4 veces menos cómputo de inferencia, y que la brecha se agranda frente a modelos de la familia de 2 billones de parámetros como Qwen 3.8-Max.
Conviene tomarlo con cautela. La comparación no es un coste medido en dinero. Reflection estimó el cómputo de las pasadas hacia delante con una aproximación basada en parámetros activos y tokens generados, apoyándose en datos de Artificial Analysis y DataCurve. El cálculo deja fuera el procesamiento del prompt, la atención y la sobrecarga del servicio, algo que la propia empresa admite, lo que lo convierte en una comparación aproximada y no en una prueba real de costes.
Aun así, la lógica de fondo se sostiene. Un modelo disperso que activa 23.000 millones de parámetros por token debería consumir menos cómputo que un modelo denso de capacidad similar, y para los equipos que pagan por token eso puede traducirse en facturas más bajas en cargas de trabajo intensivas de código y agentes.
Qué vigilar antes de que lleguen las ponderaciones
¿Y qué falta? La verificación, sobre todo. Cada puntuación procede de la propia batería de pruebas de Reflection y el público todavía no ha ejecutado Beam. Las pruebas independientes posteriores al lanzamiento decidirán si la promesa de eficiencia se mantiene en producción.
La disponibilidad es el otro factor a tener en cuenta. Con las ponderaciones prometidas en unas semanas y bajo una licencia permisiva, los equipos que sopesan modelos abiertos frente a opciones exclusivas de API tienen razones para esperar antes de firmar compromisos a largo plazo. Si los números de eficiencia resisten el escrutinio, un modelo de 501B que se comporta como uno más pequeño será una opción realmente útil para el trabajo de código en la empresa.






