ComputeArena
Base Compute Pty. Ltd. · Programação · Outros
O ComputeArena é uma plataforma comunitária de benchmark para IA local. Ele reúne testes de vazão de IA de máquinas reais e depois classifica os modelos pela rapidez com que processam o prompt (prefill) e geram tokens (decode) em chips específicos. Você instala uma CLI no macOS ou Linux, roda um modelo offline e envia o relatório assinado quando quiser compartilhá-lo. O resultado é um ranking montado com hardware que as pessoas realmente têm, e não com o banco de testes de um único laboratório.
Sobre ComputeArena
O que é o ComputeArena
O ComputeArena responde a uma pergunta que as fichas técnicas não esclarecem: quão rápido um determinado modelo roda no hardware que você tem? Em vez de confiar em apresentações de fabricantes, ele reúne medições de voluntários que rodam modelos nos próprios notebooks, desktops e estações de trabalho. Cada resultado leva a um relatório assinado, gerado em hardware real da comunidade.
A plataforma ordena os resultados por modelo, nível de quantização e chip, com números separados para prefill, que é a rapidez com que o modelo lê o seu prompt, e decode, que é a rapidez com que ele escreve a resposta. Essa divisão importa, porque um chip que lida bem com prompts longos nem sempre é o que emite tokens com fluidez.
Duas coisas impedem que seja uma resposta única para todos. Primeiro, os resultados dependem do runtime, da quantização e do comprimento de contexto exatos, então configurações que não coincidem não são comparáveis diretamente. Segundo, o foco é a vazão, e não a qualidade das respostas, então ele não dirá qual modelo escreve melhor.
Primeiros passos
- Rode o comando de instalação no macOS ou Linux. O instalador baixa a última versão estável e precisa de curl, tar e Python 3. Sem sudo.
- Escolha um runtime no menu interativo. O ComputeArena é compatível com BaseRT e llama.cpp.
- Selecione um modelo e um nível de quantização e inicie o benchmark. Tudo roda offline.
- Espere a execução terminar e revise o relatório salvo na sua própria máquina.
- Faça login quando quiser enviar os benchmarks que deseja tornar públicos.
Informações do produto
Uma visão rápida dos preços, das plataformas compatíveis e do desempenho de ComputeArena.
Ideal para
Os usuários, tarefas e cenários em que esta ferramenta se encaixa melhor.
Usuários
- Entusiastas de IA local
- Compradores de hardware
- Experimentadores de modelos
Tarefas
- Medir o desempenho de LLM local
- Escolher um nível de quantização
- Validar um upgrade de hardware
Cenários
- Decidir se uma máquina hospeda um modelo com folga
- Comparar runtimes em um só dispositivo
- Detectar anomalias em uma máquina
Principais recursos
Divisão entre prefill e decode
O ComputeArena informa dois números em cada execução: prefill PP512 e decode TG128. O prefill cobre a rapidez com que o modelo lê o seu prompt, e o decode cobre a rapidez com que ele responde. Mantê-los separados ajuda a ver qual metade da carga um chip lida melhor.
Benchmarks enviados pela comunidade
Os resultados vêm de voluntários, e não de um único laboratório, então cada entrada leva a um relatório assinado, gerado no hardware do colaborador, e o ranking mostra quem rodou e quando. Isso dá uma variedade de configurações reais em vez de um único banco de testes controlado.
Filtros por modelo, quantização e chip
O ranking permite restringir os resultados por modelo, runtime, quantização e chip. Com centenas de configurações listadas em todo o site, os filtros são o caminho mais rápido para achar uma comparação que corresponda à sua máquina, e ajudam a confrontar uma entrada com o chip que você pensa em comprar.
Execuções offline com envio opcional
A CLI roda o benchmark sem conta, e os relatórios ficam no seu disco até você decidir enviá-los. Você pode testar o quanto quiser e publicar só as execuções que aprovar.
Escolha de runtime
Você escolhe entre BaseRT e llama.cpp ao iniciar uma execução. Passe o mesmo modelo pelos dois. Rodar duas vezes mostra o quanto a pilha de software, e não só o silício, muda a sua vazão.
Cobertura de chips em Apple e GPUs dedicadas
As entradas cobrem chips Apple Metal e GPUs dedicadas por backends como Vulkan. Essa mistura permite comparar uma peça integrada da Apple com uma placa de vídeo dedicada em cargas semelhantes.
Perfis públicos de contribuição
Os colaboradores têm perfis, então você pode seguir os envios de uma pessoa específica ou conferir o histórico por trás de um resultado. Isso dá um pouco de responsabilidade a números que, de outra forma, ficariam soltos.
Prós e contras
Prós
- Os números vêm de hardware real de muitos colaboradores, então você tem uma faixa realista em vez do resultado de um único laboratório.
- Separar prefill e decode é mais útil do que uma única pontuação combinada.
- É esse o argumento. Não é preciso conta para rodar benchmarks, e os relatórios ficam privados até você enviá-los.
- Filtrar por modelo, quantização e chip torna a comparação direta.
Contras
- Os resultados não são estritamente comparáveis a menos que runtime, quantização e comprimento de contexto coincidam, então você precisa checar a configuração por trás de cada entrada.
- Mede apenas vazão, o que significa que não avalia em nada a qualidade da saída, então não vai ajudar a escolher o modelo mais inteligente para a sua tarefa.
- Só desktop por enquanto. macOS e Linux são compatíveis, sem caminho para Windows na página de início rápido.
Perguntas frequentes
É uma plataforma comunitária de benchmark para IA local. As pessoas rodam modelos nas próprias máquinas e enviam resultados de vazão, que são classificados por modelo, quantização e chip. É voltada a quem quer saber quão rápido um modelo roda em hardware real, seja um notebook sobre a mesa ou uma estação de trabalho em um armário.
Conteúdo relacionado
Explore ferramentas, skills e artigos relacionados a ComputeArena.
Alternativas a ComputeArena
Forefront
Forefront · ProgramaçãoO Forefront é uma plataforma web para construir com IA de código aberto. Você ajusta os principais modelos de linguagem de código aberto com seus próprios dados, avalia o desempenho deles e os roda por uma API ou os exporta para hospedar por conta própria. Desenvolvedores que querem a conveniência de uma plataforma fechada, mas fazem questão de ser donos dos modelos e dos dados, são o público-alvo aqui.
Startkit
StartKit.AI · ProgramaçãoStartkit é um boilerplate para criar produtos de SaaS com IA e wrappers de IA. Pense nele como um boilerplate para startups de IA com as partes chatas já conectadas: autenticação, pagamentos com Stripe e Lemon Squeezy, limites de uso, e-mail transacional e um kit inicial de API de IA que conversa com OpenAI, Anthropic, Groq ou Llama. Você clona o repositório, define seu preço e começa pela parte do produto que as pessoas realmente pagam. Ele é feito em Next.js sobre React e Tailwind, então boa parte do código boilerplate já parece familiar.
Testim
Tricentis · ProgramaçãoO Testim é uma plataforma de automação de testes com IA para criar e executar testes de ponta a ponta em aplicações web, mobile e Salesforce. Ele se apoia no aprendizado de máquina para manter os testes estáveis quando uma interface muda, então as equipes gastam menos tempo consertando seletores quebrados. Nada mal para uma ferramenta de testes automatizados que você pode começar a usar hoje. Você cria testes gravando ações no navegador e depois adiciona JavaScript quando precisa de mais controle. É uma escolha sólida para equipes de QA ocupadas.
