ComputeArena

ComputeArena

Base Compute Pty. Ltd. · Programación · Otro

ComputeArena es una plataforma comunitaria de benchmarks para IA local. Recoge pruebas de rendimiento de IA en máquinas reales y luego clasifica los modelos según la rapidez con la que procesan el prompt (prefill) y generan tokens (decode) en chips concretos. Instalas una CLI en macOS o Linux, ejecutas un modelo sin conexión y envías el informe firmado cuando quieras compartirlo. El resultado es una clasificación construida con hardware que la gente realmente tiene, no con el banco de pruebas de un solo laboratorio.

Acerca de ComputeArena

Qué es ComputeArena

ComputeArena responde a una pregunta que las fichas técnicas no aclaran: ¿qué tan rápido corre un modelo concreto en el hardware que ya tienes? En lugar de fiarte de las presentaciones comerciales, reúne mediciones de voluntarios que ejecutan modelos en sus propios portátiles, equipos de escritorio y estaciones de trabajo. Cada resultado enlaza a un informe firmado generado en hardware real de la comunidad.

La plataforma ordena los resultados por modelo, nivel de cuantización y chip, con cifras separadas para prefill, que es la rapidez con la que el modelo lee tu prompt, y decode, que es la rapidez con la que escribe la respuesta. Esa división importa, porque un chip que maneja bien prompts largos no siempre es el que emite tokens con fluidez.

Dos cosas impiden que sea una respuesta única para todos. Primero, los resultados dependen del runtime, la cuantización y la longitud de contexto exactos, así que configuraciones que no coinciden no se comparan directamente. Segundo, se centra en el rendimiento y no en la calidad de las respuestas, de modo que no te dirá qué modelo redacta mejor.

Primeros pasos

  1. Ejecuta el comando de instalación en macOS o Linux. El instalador descarga la última versión estable y necesita curl, tar y Python 3. Sin sudo.
  2. Elige un runtime en el menú interactivo. ComputeArena es compatible con BaseRT y llama.cpp.
  3. Escoge un modelo y un nivel de cuantización, y arranca el benchmark. Todo corre sin conexión.
  4. Espera a que termine la ejecución y revisa el informe guardado en tu propia máquina.
  5. Inicia sesión cuando quieras enviar los benchmarks que desees hacer públicos.

Información del producto

Un vistazo rápido a los precios, las plataformas compatibles y el rendimiento de ComputeArena.

Plan gratuitoSí
Planes de pago$0
PlataformamacOS, Linux
DesarrolladorBase Compute Pty. Ltd.
CategoríaProgramación · Otro
Fecha de lanzamientoSep 2025
Última actualizaciónSep 2025
Visitas al sitio webN/A
Ranking global del sitioN/A
Disponibilidad de la APINo

Ideal para

Los usuarios, tareas y casos de uso en los que esta herramienta encaja mejor.

Usuarios

  • Aficionados a la IA local
  • Compradores de hardware
  • Experimentadores de modelos

Tareas

  • Medir el rendimiento de LLM local
  • Elegir un nivel de cuantización
  • Validar una mejora de hardware

Casos de uso

  • Decidir si una máquina puede alojar un modelo con comodidad
  • Comparar runtimes en un mismo equipo
  • Detectar anomalías en un equipo

Funciones clave

División entre prefill y decode

ComputeArena informa dos cifras en cada ejecución: prefill PP512 y decode TG128. El prefill cubre la rapidez con la que el modelo lee tu prompt, y el decode, la rapidez con la que responde. Mantenerlas separadas ayuda a ver qué mitad de la carga maneja mejor un chip.

Benchmarks enviados por la comunidad

Los resultados vienen de voluntarios y no de un solo laboratorio, así que cada entrada enlaza a un informe firmado generado en el hardware del colaborador, y la clasificación muestra quién lo ejecutó y cuándo. Eso te da una variedad de configuraciones reales en lugar de un único banco de pruebas controlado.

Filtros por modelo, cuantización y chip

La clasificación te deja acotar los resultados por modelo, runtime, cuantización y chip. Con cientos de configuraciones listadas en todo el sitio, los filtros son la vía más rápida para encontrar una comparación que se ajuste a tu propia máquina, y te ayudan a contrastar una entrada con el chip que estás pensando en comprar.

Ejecuciones sin conexión con envío opcional

La CLI ejecuta el benchmark sin cuenta, y los informes se quedan en tu disco hasta que decidas enviarlos. Puedes probar todo lo que quieras y publicar solo las ejecuciones que te convenzan.

Elección de runtime

Eliges entre BaseRT y llama.cpp cuando arrancas una ejecución. Pasa el mismo modelo por ambos. Ejecutarlo dos veces muestra cuánto cambia tu rendimiento la pila de software, y no solo el silicio.

Cobertura de chips en Apple y GPU dedicadas

Las entradas cubren chips Apple Metal y GPU dedicadas mediante backends como Vulkan. Esa mezcla te permite comparar una pieza integrada de Apple frente a una tarjeta gráfica dedicada en cargas similares.

Perfiles públicos de contribución

Los colaboradores tienen perfiles, así que puedes seguir los envíos de una persona concreta o revisar el historial detrás de un resultado. Añade algo de responsabilidad a unas cifras que, si no, quedarían sueltas.

Ventajas y desventajas

Ventajas

  • Las cifras provienen de hardware real de muchos colaboradores, así que obtienes un rango realista en lugar del resultado de un solo laboratorio.
  • Separar prefill y decode es más útil que una única puntuación combinada.
  • Ese es el argumento. No hace falta cuenta para ejecutar benchmarks, y los informes siguen siendo privados hasta que los envías.
  • Filtrar por modelo, cuantización y chip hace que la comparación sea sencilla.

Desventajas

  • Los resultados no son estrictamente comparables salvo que coincidan runtime, cuantización y longitud de contexto, así que tienes que revisar la configuración detrás de cada entrada.
  • Solo mide rendimiento, lo que significa que no evalúa en absoluto la calidad de la salida, así que no te ayudará a elegir el modelo más listo para tu tarea.
  • Solo para escritorio por ahora. Se admiten macOS y Linux, sin ruta para Windows en la página de inicio rápido.

Preguntas frecuentes

Es una plataforma comunitaria de benchmarks para IA local. La gente ejecuta modelos en sus propias máquinas y envía resultados de rendimiento, que se clasifican por modelo, cuantización y chip. Está pensada para quien quiera saber qué tan rápido corre un modelo en hardware real, ya sea un portátil sobre un escritorio o una estación de trabajo en un armario.

Contenido relacionado

Explora herramientas, habilidades y artículos relacionados con ComputeArena.

Alternativas a ComputeArena

Forefront

Forefront

Forefront · Programación

Forefront es una plataforma web para construir con IA de código abierto. Te deja ajustar los principales modelos de lenguaje de código abierto con tus propios datos, evaluar cómo rinden y ejecutarlos a través de una API o exportarlos para alojarlos tú mismo. Los desarrolladores que quieren la comodidad de una plataforma cerrada pero insisten en ser dueños de sus modelos y sus datos son el público objetivo.

Gratis / $0 - $99/moVer detalles
Startkit

Startkit

StartKit.AI · Programación

Startkit es un boilerplate para crear productos de SaaS con IA y wrappers de IA. Piénsalo como un boilerplate para startups de IA con las partes aburridas ya conectadas: autenticación, pagos con Stripe y Lemon Squeezy, límites de uso, correo transaccional y un kit de inicio de API de IA que habla con OpenAI, Anthropic, Groq o Llama. Clonas el repositorio, pones tu precio y te dedicas a la parte del producto por la que la gente paga de verdad. Está hecho con Next.js sobre React y Tailwind, así que buena parte del código boilerplate ya te resulta familiar.

De pago / $99 - $499 one-timeVer detalles
Testim

Testim

Tricentis · Programación

Testim es una plataforma de automatización de pruebas impulsada por IA para crear y ejecutar pruebas de extremo a extremo en aplicaciones web, móviles y Salesforce. Se apoya en el aprendizaje automático para mantener las pruebas estables cuando cambia una interfaz, así que los equipos dedican menos tiempo a reparar selectores rotos. No está nada mal para una herramienta de pruebas automatizadas que puedes empezar a usar hoy mismo. Creas pruebas grabando acciones en un navegador y luego añades JavaScript cuando necesitas más control. Es una opción sólida para equipos de QA con mucho trabajo.

Gratis / Custom pricing on requestVer detalles