Investigación

Evaluación de LLM: cómo comparar modelos sin que te engañen

Benchmarks, arenas de votación y leaderboards miden cosas distintas y por eso se contradicen. Repasamos las herramientas clave para evaluar un LLM y cómo leer sus resultados.

Lucía GarcíaLucía García
Popularidad: 1,090
Evaluación de LLM: cómo comparar modelos sin que te engañen

Dos rankings te dicen que gana un modelo distinto y ninguno se equivoca. El problema es que miden cosas diferentes. Estas son las herramientas con las que se evalúa de verdad un LLM y cómo leer sus resultados sin confundirte.

Por qué dos rankings dicen cosas opuestas sobre el mismo modelo

Te ha pasado. Buscas "el mejor modelo de IA", abres dos comparativas y cada una corona a un campeón distinto. Antes de pensar que alguien miente, entiende que casi siempre miden cosas diferentes con propósitos diferentes.

Hay dos familias de evaluación y conviene tenerlas claras. La primera son los benchmarks automáticos, pruebas con respuestas conocidas donde el modelo puntúa sobre cien. La segunda son las arenas de votación, donde personas reales eligen qué respuesta les gusta más y esos votos acaban formando una clasificación que cambia cada semana según quién entre a votar.

¿Significa eso que una miente? En absoluto.

Un modelo puede ganar en la primera y perder en la segunda sin ninguna contradicción. El primero mide corrección; el segundo, preferencia. Y no siempre van de la mano, porque una respuesta puede ser correcta y aun así caer mal al leerla.

Benchmarks clásicos: qué mide cada uno

Los benchmarks son la base de casi todo comparativo. Conocer tres o cuatro te permite leer cualquier tabla sin perderte.

MMLU es el veterano: preguntas de cultura general y conocimiento académico en decenas de materias. Durante años fue el termómetro del sector, hasta que los modelos lo saturaron y dejó de discriminar bien entre un modelo bueno y uno excelente, que es justo lo que necesitabas saber.

GPQA Diamond es más duro. Preguntas de nivel doctorado en ciencia que un humano con acceso a internet apenas supera en un tercio, lo que la convierte en una de las pruebas más duras que existen hoy. Es una de las pruebas donde los modelos de frontera se miden de verdad.

SWE-bench, en sus distintas versiones, mide programación real: coger un problema abierto en un repositorio y resolverlo. Es la referencia para quien juzga modelos que van a escribir código.

Y luego están las pruebas de matemáticas y razonamiento, como FrontierMath, y las de uso de ordenador, como OSWorld. Cada una ilumina una esquina distinta de lo que un modelo sabe hacer.

Las arenas de votación: cuando decide la gente

Frente a las pruebas automáticas están las arenas, donde el veredicto lo dan humanos comparando respuestas anónimas. La más conocida es LMArena, antes Chatbot Arena.

Su lógica es simple: se te muestran dos respuestas sin decir de qué modelo son, eliges la mejor, y esos votos se convierten en una clasificación. Captura algo que los benchmarks no ven: si la respuesta resulta útil de verdad al leerla.

Según el blog de evaluación de DataCamp, esa es justo su valor y su trampa. Las respuestas largas y seguras de sí mismas tienden a ganar votos aunque una respuesta más corta y precisa sea mejor. La persona que vota no siempre premia lo correcto, premia lo que le convence.

Junto a las arenas conviven herramientas como MT-Bench y AlpacaEval, que automatizan parte de esa comparación con un modelo juez. Son más rápidas, y también más discutibles, porque el modelo juez arrastra sus propios sesgos igual que un votante humano.

Las plataformas donde se consultan los resultados

En la práctica, casi nadie monta su propia evaluación. Se consultan plataformas que ya lo hacen.

Hugging Face mantiene el Open LLM Leaderboard, centrado en modelos de pesos abiertos y ejecutados con el arnés de EleutherAI. Es la referencia para comparar modelos abiertos entre sí, y su límite es evidente: no cubre los grandes cerrados como GPT-6 o los Claude.

Para esos, las referencias habituales son los informes de los propios fabricantes y plataformas agregadoras como Artificial Analysis o BenchLM, que reúnen cifras de varias fuentes con su procedencia.

Entre los programadores hay preferencia por herramientas reproducibles. Según una discusión en r/LocalLLaMA, muchos se fían de Hugging Face Evals, del arnés de EleutherAI y de correr pruebas pequeñas en su propio hardware, porque medir latencia y memoria en tu máquina dice más que cualquier nota global.

Herramienta

Qué mide

Cuándo usarla

MMLU

Conocimiento general

Referencia histórica, poco discriminante hoy

GPQA Diamond

Ciencia nivel doctorado

Modelos de frontera

SWE-bench

Programación real

Si vas a usar el modelo para código

LMArena

Preferencia humana

Calidad de conversación percibida

Open LLM Leaderboard

Modelos abiertos

Comparar pesos abiertos entre sí

Tu atajo, en una tabla.

Cómo usar todo esto sin que te manipulen

La primera regla es mirar quién publica la tabla. Si la firma es el propio fabricante, ese número está elegido para lucir. Si es un tercero independiente, hay más neutralidad, aunque cada plataforma favorece un tipo de respuesta.

La segunda es no quedarte con un solo número. Un modelo que arrasa en matemáticas puede ser mediocre escribiendo correos. Elige dos o tres pruebas que se parezcan a lo que tú vas a pedirle y mira solo esas.

La tercera es desconfiar de las diferencias pequeñas. Cuando dos modelos se separan por dos puntos porcentuales, esa diferencia desaparece en el uso real. Lo que importa son los saltos grandes.

Y la cuarta, la más práctica: pruébalo tú. Ningún benchmark sustituye a pasarle tus propios casos. Cinco preguntas reales de tu trabajo dicen más que cualquier clasificación.

La evaluación de LLM es un campo en construcción, y por eso conviene tomársela como una guía, no como un veredicto. La pregunta correcta no es "cuál saca más nota" sino "en qué prueba parecida a mi tarea va mejor". Responder eso te ahorra comprar por un titular y arrepentirte una semana después.

Compartir esta noticia

Fuentes

Noticias de IA relacionadas

DeepSeek abre su pila de IA para los chips Ascend de Huawei
Investigación

DeepSeek abre su pila de IA para los chips Ascend de Huawei

DeepSeek libera en abierto un conjunto de componentes de infraestructura para los chips Ascend de Huawei, con un equivalente para cada pieza que ya había publicado para Nvidia.

Popularidad: 1,450
¿Qué significa LLM? Los modelos de lenguaje grande, explicados
Investigación

¿Qué significa LLM? Los modelos de lenguaje grande, explicados

LLM son las siglas de large language model, y detrás de ellas está un truco sencillo: predecir la siguiente palabra. Te explicamos cómo se entrenan, qué los diferencia de otras IA y dónde fallan.

Popularidad: 1,180
Del prototipo a producción: por qué tantos modelos de IA nunca llegan a usarse
Investigación

Del prototipo a producción: por qué tantos modelos de IA nunca llegan a usarse

La mayoría de los proyectos de IA fallan en el despliegue, no en el modelo. Repasamos las barreras de datos, coste, latencia y organización, y cómo reducir el riesgo antes de empezar.

Popularidad: 1,010
RAG explicado: así usa la IA tus propios datos para responder
Investigación

RAG explicado: así usa la IA tus propios datos para responder

La generación aumentada por recuperación conecta un modelo de lenguaje con tus documentos para que responda con datos actualizados y cite fuentes. Explicamos cómo funciona, sus ventajas y sus límites.

Popularidad: 1,060