ComputeArena
Base Compute Pty. Ltd. · Programación · Otro
ComputeArena es una plataforma comunitaria de benchmarks para IA local. Recoge pruebas de rendimiento de IA en máquinas reales y luego clasifica los modelos según la rapidez con la que procesan el prompt (prefill) y generan tokens (decode) en chips concretos. Instalas una CLI en macOS o Linux, ejecutas un modelo sin conexión y envías el informe firmado cuando quieras compartirlo. El resultado es una clasificación construida con hardware que la gente realmente tiene, no con el banco de pruebas de un solo laboratorio.
Acerca de ComputeArena
Qué es ComputeArena
ComputeArena responde a una pregunta que las fichas técnicas no aclaran: ¿qué tan rápido corre un modelo concreto en el hardware que ya tienes? En lugar de fiarte de las presentaciones comerciales, reúne mediciones de voluntarios que ejecutan modelos en sus propios portátiles, equipos de escritorio y estaciones de trabajo. Cada resultado enlaza a un informe firmado generado en hardware real de la comunidad.
La plataforma ordena los resultados por modelo, nivel de cuantización y chip, con cifras separadas para prefill, que es la rapidez con la que el modelo lee tu prompt, y decode, que es la rapidez con la que escribe la respuesta. Esa división importa, porque un chip que maneja bien prompts largos no siempre es el que emite tokens con fluidez.
Dos cosas impiden que sea una respuesta única para todos. Primero, los resultados dependen del runtime, la cuantización y la longitud de contexto exactos, así que configuraciones que no coinciden no se comparan directamente. Segundo, se centra en el rendimiento y no en la calidad de las respuestas, de modo que no te dirá qué modelo redacta mejor.
Primeros pasos
- Ejecuta el comando de instalación en macOS o Linux. El instalador descarga la última versión estable y necesita curl, tar y Python 3. Sin sudo.
- Elige un runtime en el menú interactivo. ComputeArena es compatible con BaseRT y llama.cpp.
- Escoge un modelo y un nivel de cuantización, y arranca el benchmark. Todo corre sin conexión.
- Espera a que termine la ejecución y revisa el informe guardado en tu propia máquina.
- Inicia sesión cuando quieras enviar los benchmarks que desees hacer públicos.
Información del producto
Un vistazo rápido a los precios, las plataformas compatibles y el rendimiento de ComputeArena.
Ideal para
Los usuarios, tareas y casos de uso en los que esta herramienta encaja mejor.
Usuarios
- Aficionados a la IA local
- Compradores de hardware
- Experimentadores de modelos
Tareas
- Medir el rendimiento de LLM local
- Elegir un nivel de cuantización
- Validar una mejora de hardware
Casos de uso
- Decidir si una máquina puede alojar un modelo con comodidad
- Comparar runtimes en un mismo equipo
- Detectar anomalías en un equipo
Funciones clave
División entre prefill y decode
ComputeArena informa dos cifras en cada ejecución: prefill PP512 y decode TG128. El prefill cubre la rapidez con la que el modelo lee tu prompt, y el decode, la rapidez con la que responde. Mantenerlas separadas ayuda a ver qué mitad de la carga maneja mejor un chip.
Benchmarks enviados por la comunidad
Los resultados vienen de voluntarios y no de un solo laboratorio, así que cada entrada enlaza a un informe firmado generado en el hardware del colaborador, y la clasificación muestra quién lo ejecutó y cuándo. Eso te da una variedad de configuraciones reales en lugar de un único banco de pruebas controlado.
Filtros por modelo, cuantización y chip
La clasificación te deja acotar los resultados por modelo, runtime, cuantización y chip. Con cientos de configuraciones listadas en todo el sitio, los filtros son la vía más rápida para encontrar una comparación que se ajuste a tu propia máquina, y te ayudan a contrastar una entrada con el chip que estás pensando en comprar.
Ejecuciones sin conexión con envío opcional
La CLI ejecuta el benchmark sin cuenta, y los informes se quedan en tu disco hasta que decidas enviarlos. Puedes probar todo lo que quieras y publicar solo las ejecuciones que te convenzan.
Elección de runtime
Eliges entre BaseRT y llama.cpp cuando arrancas una ejecución. Pasa el mismo modelo por ambos. Ejecutarlo dos veces muestra cuánto cambia tu rendimiento la pila de software, y no solo el silicio.
Cobertura de chips en Apple y GPU dedicadas
Las entradas cubren chips Apple Metal y GPU dedicadas mediante backends como Vulkan. Esa mezcla te permite comparar una pieza integrada de Apple frente a una tarjeta gráfica dedicada en cargas similares.
Perfiles públicos de contribución
Los colaboradores tienen perfiles, así que puedes seguir los envíos de una persona concreta o revisar el historial detrás de un resultado. Añade algo de responsabilidad a unas cifras que, si no, quedarían sueltas.
Ventajas y desventajas
Ventajas
- Las cifras provienen de hardware real de muchos colaboradores, así que obtienes un rango realista en lugar del resultado de un solo laboratorio.
- Separar prefill y decode es más útil que una única puntuación combinada.
- Ese es el argumento. No hace falta cuenta para ejecutar benchmarks, y los informes siguen siendo privados hasta que los envías.
- Filtrar por modelo, cuantización y chip hace que la comparación sea sencilla.
Desventajas
- Los resultados no son estrictamente comparables salvo que coincidan runtime, cuantización y longitud de contexto, así que tienes que revisar la configuración detrás de cada entrada.
- Solo mide rendimiento, lo que significa que no evalúa en absoluto la calidad de la salida, así que no te ayudará a elegir el modelo más listo para tu tarea.
- Solo para escritorio por ahora. Se admiten macOS y Linux, sin ruta para Windows en la página de inicio rápido.
Preguntas frecuentes
Es una plataforma comunitaria de benchmarks para IA local. La gente ejecuta modelos en sus propias máquinas y envía resultados de rendimiento, que se clasifican por modelo, cuantización y chip. Está pensada para quien quiera saber qué tan rápido corre un modelo en hardware real, ya sea un portátil sobre un escritorio o una estación de trabajo en un armario.
Contenido relacionado
Explora herramientas, habilidades y artículos relacionados con ComputeArena.
Alternativas a ComputeArena
Forefront
Forefront · ProgramaciónForefront es una plataforma web para construir con IA de código abierto. Te deja ajustar los principales modelos de lenguaje de código abierto con tus propios datos, evaluar cómo rinden y ejecutarlos a través de una API o exportarlos para alojarlos tú mismo. Los desarrolladores que quieren la comodidad de una plataforma cerrada pero insisten en ser dueños de sus modelos y sus datos son el público objetivo.
Startkit
StartKit.AI · ProgramaciónStartkit es un boilerplate para crear productos de SaaS con IA y wrappers de IA. Piénsalo como un boilerplate para startups de IA con las partes aburridas ya conectadas: autenticación, pagos con Stripe y Lemon Squeezy, límites de uso, correo transaccional y un kit de inicio de API de IA que habla con OpenAI, Anthropic, Groq o Llama. Clonas el repositorio, pones tu precio y te dedicas a la parte del producto por la que la gente paga de verdad. Está hecho con Next.js sobre React y Tailwind, así que buena parte del código boilerplate ya te resulta familiar.
Testim
Tricentis · ProgramaciónTestim es una plataforma de automatización de pruebas impulsada por IA para crear y ejecutar pruebas de extremo a extremo en aplicaciones web, móviles y Salesforce. Se apoya en el aprendizaje automático para mantener las pruebas estables cuando cambia una interfaz, así que los equipos dedican menos tiempo a reparar selectores rotos. No está nada mal para una herramienta de pruebas automatizadas que puedes empezar a usar hoy mismo. Creas pruebas grabando acciones en un navegador y luego añades JavaScript cuando necesitas más control. Es una opción sólida para equipos de QA con mucho trabajo.
