ComputeArena

ComputeArena

Base Compute Pty. Ltd. · Programação · Outros

O ComputeArena é uma plataforma comunitária de benchmark para IA local. Ele reúne testes de vazão de IA de máquinas reais e depois classifica os modelos pela rapidez com que processam o prompt (prefill) e geram tokens (decode) em chips específicos. Você instala uma CLI no macOS ou Linux, roda um modelo offline e envia o relatório assinado quando quiser compartilhá-lo. O resultado é um ranking montado com hardware que as pessoas realmente têm, e não com o banco de testes de um único laboratório.

Sobre ComputeArena

O que é o ComputeArena

O ComputeArena responde a uma pergunta que as fichas técnicas não esclarecem: quão rápido um determinado modelo roda no hardware que você tem? Em vez de confiar em apresentações de fabricantes, ele reúne medições de voluntários que rodam modelos nos próprios notebooks, desktops e estações de trabalho. Cada resultado leva a um relatório assinado, gerado em hardware real da comunidade.

A plataforma ordena os resultados por modelo, nível de quantização e chip, com números separados para prefill, que é a rapidez com que o modelo lê o seu prompt, e decode, que é a rapidez com que ele escreve a resposta. Essa divisão importa, porque um chip que lida bem com prompts longos nem sempre é o que emite tokens com fluidez.

Duas coisas impedem que seja uma resposta única para todos. Primeiro, os resultados dependem do runtime, da quantização e do comprimento de contexto exatos, então configurações que não coincidem não são comparáveis diretamente. Segundo, o foco é a vazão, e não a qualidade das respostas, então ele não dirá qual modelo escreve melhor.

Primeiros passos

  1. Rode o comando de instalação no macOS ou Linux. O instalador baixa a última versão estável e precisa de curl, tar e Python 3. Sem sudo.
  2. Escolha um runtime no menu interativo. O ComputeArena é compatível com BaseRT e llama.cpp.
  3. Selecione um modelo e um nível de quantização e inicie o benchmark. Tudo roda offline.
  4. Espere a execução terminar e revise o relatório salvo na sua própria máquina.
  5. Faça login quando quiser enviar os benchmarks que deseja tornar públicos.

Informações do produto

Uma visão rápida dos preços, das plataformas compatíveis e do desempenho de ComputeArena.

Plano gratuitoSim
Planos pagos$0
PlataformamacOS, Linux
DesenvolvedorBase Compute Pty. Ltd.
CategoriaProgramação · Outros
Data de lançamentoSep 2025
Última atualizaçãoSep 2025
Visitas ao siteN/A
Ranking global do siteN/A
Disponibilidade da APINão

Ideal para

Os usuários, tarefas e cenários em que esta ferramenta se encaixa melhor.

Usuários

  • Entusiastas de IA local
  • Compradores de hardware
  • Experimentadores de modelos

Tarefas

  • Medir o desempenho de LLM local
  • Escolher um nível de quantização
  • Validar um upgrade de hardware

Cenários

  • Decidir se uma máquina hospeda um modelo com folga
  • Comparar runtimes em um só dispositivo
  • Detectar anomalias em uma máquina

Principais recursos

Divisão entre prefill e decode

O ComputeArena informa dois números em cada execução: prefill PP512 e decode TG128. O prefill cobre a rapidez com que o modelo lê o seu prompt, e o decode cobre a rapidez com que ele responde. Mantê-los separados ajuda a ver qual metade da carga um chip lida melhor.

Benchmarks enviados pela comunidade

Os resultados vêm de voluntários, e não de um único laboratório, então cada entrada leva a um relatório assinado, gerado no hardware do colaborador, e o ranking mostra quem rodou e quando. Isso dá uma variedade de configurações reais em vez de um único banco de testes controlado.

Filtros por modelo, quantização e chip

O ranking permite restringir os resultados por modelo, runtime, quantização e chip. Com centenas de configurações listadas em todo o site, os filtros são o caminho mais rápido para achar uma comparação que corresponda à sua máquina, e ajudam a confrontar uma entrada com o chip que você pensa em comprar.

Execuções offline com envio opcional

A CLI roda o benchmark sem conta, e os relatórios ficam no seu disco até você decidir enviá-los. Você pode testar o quanto quiser e publicar só as execuções que aprovar.

Escolha de runtime

Você escolhe entre BaseRT e llama.cpp ao iniciar uma execução. Passe o mesmo modelo pelos dois. Rodar duas vezes mostra o quanto a pilha de software, e não só o silício, muda a sua vazão.

Cobertura de chips em Apple e GPUs dedicadas

As entradas cobrem chips Apple Metal e GPUs dedicadas por backends como Vulkan. Essa mistura permite comparar uma peça integrada da Apple com uma placa de vídeo dedicada em cargas semelhantes.

Perfis públicos de contribuição

Os colaboradores têm perfis, então você pode seguir os envios de uma pessoa específica ou conferir o histórico por trás de um resultado. Isso dá um pouco de responsabilidade a números que, de outra forma, ficariam soltos.

Prós e contras

Prós

  • Os números vêm de hardware real de muitos colaboradores, então você tem uma faixa realista em vez do resultado de um único laboratório.
  • Separar prefill e decode é mais útil do que uma única pontuação combinada.
  • É esse o argumento. Não é preciso conta para rodar benchmarks, e os relatórios ficam privados até você enviá-los.
  • Filtrar por modelo, quantização e chip torna a comparação direta.

Contras

  • Os resultados não são estritamente comparáveis a menos que runtime, quantização e comprimento de contexto coincidam, então você precisa checar a configuração por trás de cada entrada.
  • Mede apenas vazão, o que significa que não avalia em nada a qualidade da saída, então não vai ajudar a escolher o modelo mais inteligente para a sua tarefa.
  • Só desktop por enquanto. macOS e Linux são compatíveis, sem caminho para Windows na página de início rápido.

Perguntas frequentes

É uma plataforma comunitária de benchmark para IA local. As pessoas rodam modelos nas próprias máquinas e enviam resultados de vazão, que são classificados por modelo, quantização e chip. É voltada a quem quer saber quão rápido um modelo roda em hardware real, seja um notebook sobre a mesa ou uma estação de trabalho em um armário.

Conteúdo relacionado

Explore ferramentas, skills e artigos relacionados a ComputeArena.

Alternativas a ComputeArena

Forefront

Forefront

Forefront · Programação

O Forefront é uma plataforma web para construir com IA de código aberto. Você ajusta os principais modelos de linguagem de código aberto com seus próprios dados, avalia o desempenho deles e os roda por uma API ou os exporta para hospedar por conta própria. Desenvolvedores que querem a conveniência de uma plataforma fechada, mas fazem questão de ser donos dos modelos e dos dados, são o público-alvo aqui.

Grátis / $0 - $99/moVer detalhes
Startkit

Startkit

StartKit.AI · Programação

Startkit é um boilerplate para criar produtos de SaaS com IA e wrappers de IA. Pense nele como um boilerplate para startups de IA com as partes chatas já conectadas: autenticação, pagamentos com Stripe e Lemon Squeezy, limites de uso, e-mail transacional e um kit inicial de API de IA que conversa com OpenAI, Anthropic, Groq ou Llama. Você clona o repositório, define seu preço e começa pela parte do produto que as pessoas realmente pagam. Ele é feito em Next.js sobre React e Tailwind, então boa parte do código boilerplate já parece familiar.

Pago / $99 - $499 one-timeVer detalhes
Testim

Testim

Tricentis · Programação

O Testim é uma plataforma de automação de testes com IA para criar e executar testes de ponta a ponta em aplicações web, mobile e Salesforce. Ele se apoia no aprendizado de máquina para manter os testes estáveis quando uma interface muda, então as equipes gastam menos tempo consertando seletores quebrados. Nada mal para uma ferramenta de testes automatizados que você pode começar a usar hoje. Você cria testes gravando ações no navegador e depois adiciona JavaScript quando precisa de mais controle. É uma escolha sólida para equipes de QA ocupadas.

Grátis / Custom pricing on requestVer detalhes