ComputeArena

ComputeArena

Base Compute Pty. Ltd. · Programmation · Autres

ComputeArena est une plateforme communautaire de benchmark pour l'IA locale. Elle rassemble des mesures de débit d'IA issues de machines réelles, puis classe les modèles selon la vitesse à laquelle ils traitent le prompt (prefill) et génèrent des tokens (decode) sur des puces précises. Vous installez une CLI sous macOS ou Linux, vous lancez un modèle hors ligne et vous envoyez le rapport signé quand vous voulez le partager. Le résultat, c'est un classement bâti sur du matériel que les gens possèdent vraiment, pas sur le banc d'essai d'un seul laboratoire.

À propos de ComputeArena

Qu'est-ce que ComputeArena

ComputeArena répond à une question que les fiches techniques laissent en suspens : à quelle vitesse un modèle donné tourne-t-il sur le matériel que vous possédez ? Plutôt que de se fier aux présentations des fabricants, l'outil rassemble des mesures fournies par des volontaires qui lancent des modèles sur leurs propres ordinateurs portables, fixes et stations de travail. Chaque résultat renvoie à un rapport signé, produit sur du matériel réel de la communauté.

La plateforme trie les résultats par modèle, niveau de quantification et puce, avec des chiffres distincts pour le prefill, soit la vitesse à laquelle le modèle lit votre prompt, et le decode, soit la vitesse à laquelle il écrit la réponse. Cette séparation compte, car une puce à l'aise avec les prompts longs n'est pas toujours celle qui émet des tokens rapidement.

Deux points empêchent d'en tirer une réponse unique. D'abord, les résultats dépendent du runtime, de la quantification et de la longueur de contexte exacts, donc des configurations différentes ne se comparent pas directement. Ensuite, l'accent porte sur le débit et non sur la qualité des réponses, donc l'outil ne vous dira pas quel modèle rédige le mieux.

Pour commencer

  1. Lancez la commande d'installation sous macOS ou Linux. L'installateur récupère la dernière version stable et a besoin de curl, tar et Python 3. Sans sudo.
  2. Choisissez un runtime dans le menu interactif. ComputeArena prend en charge BaseRT et llama.cpp.
  3. Sélectionnez un modèle et un niveau de quantification, puis lancez le benchmark. Tout tourne hors ligne.
  4. Attendez la fin de l'exécution, puis consultez le rapport enregistré sur votre machine.
  5. Connectez-vous quand vous voulez envoyer les benchmarks que vous souhaitez rendre publics.

Informations sur le produit

Aperçu des tarifs, des plateformes compatibles et des performances de ComputeArena.

Offre gratuiteOui
Offres payantes$0
PlateformemacOS, Linux
DéveloppeurBase Compute Pty. Ltd.
CatégorieProgrammation · Autres
Date de lancementSep 2025
Dernière mise à jourSep 2025
Visites du siteN/A
Classement mondial du siteN/A
Disponibilité de l’APINon

Idéal pour

Les utilisateurs, tâches et cas d'usage où cet outil convient le mieux.

Utilisateurs

  • Passionnés d'IA locale
  • Acheteurs de matériel
  • Bricoleurs de modèles

Tâches

  • Mesurer les performances d'un LLM local
  • Choisir un niveau de quantification
  • Valider une montée en gamme matérielle

Cas d'usage

  • Décider si une machine peut héberger un modèle confortablement
  • Comparer des runtimes sur une même machine
  • Repérer les anomalies d'une configuration

Fonctionnalités clés

Séparation prefill et decode

ComputeArena donne deux chiffres pour chaque exécution : le prefill PP512 et le decode TG128. Le prefill couvre la vitesse à laquelle le modèle lit votre prompt, et le decode, la vitesse à laquelle il répond. Les garder distincts aide à voir quelle moitié de la charge une puce gère le mieux.

Benchmarks soumis par la communauté

Les résultats viennent de volontaires et non d'un seul laboratoire, donc chaque entrée renvoie à un rapport signé généré sur le matériel du contributeur, et le classement indique qui l'a lancé et quand. Vous obtenez ainsi un éventail de configurations réelles plutôt qu'un unique banc d'essai contrôlé.

Filtres par modèle, quantification et puce

Le classement vous permet de restreindre les résultats par modèle, runtime, quantification et puce. Avec des centaines de configurations recensées sur tout le site, les filtres sont le moyen le plus rapide de trouver une comparaison qui correspond à votre machine, et ils vous aident à confronter une entrée à la puce que vous envisagez d'acheter.

Exécutions hors ligne avec partage facultatif

La CLI lance le benchmark sans compte, et les rapports restent sur votre disque jusqu'à ce que vous décidiez de les envoyer. Vous pouvez tester autant que vous voulez et ne publier que les exécutions qui vous conviennent.

Choix du runtime

Vous choisissez entre BaseRT et llama.cpp au démarrage d'une exécution. Faites passer le même modèle par les deux. Le lancer deux fois montre de combien la pile logicielle, et pas seulement le silicium, change votre débit.

Couverture des puces Apple et des GPU dédiés

Les entrées couvrent les puces Apple Metal et les GPU dédiés via des backends comme Vulkan. Ce mélange permet de comparer une puce Apple intégrée à une carte graphique dédiée sur des charges similaires.

Profils de contribution publics

Les contributeurs ont des profils, donc vous pouvez suivre les envois d'une personne précise ou consulter l'historique derrière un résultat. Cela ajoute un peu de responsabilité à des chiffres qui, sinon, flotteraient en liberté.

Avantages et inconvénients

Avantages

  • Les chiffres viennent de matériel réel et de nombreux contributeurs, donc vous obtenez une plage réaliste plutôt que le résultat d'un seul laboratoire.
  • Séparer prefill et decode est plus utile qu'un score unique mélangé.
  • C'est l'argument. Aucun compte n'est nécessaire pour lancer des benchmarks, et les rapports restent privés jusqu'à leur envoi.
  • Filtrer par modèle, quantification et puce rend la comparaison directe.

Inconvénients

  • Les résultats ne sont pas strictement comparables à moins que runtime, quantification et longueur de contexte correspondent, donc il faut vérifier la configuration derrière chaque entrée.
  • L'outil ne mesure que le débit, ce qui signifie qu'il n'évalue pas du tout la qualité de sortie, donc il ne vous aidera pas à choisir le modèle le plus pertinent pour votre tâche.
  • Ordinateur uniquement pour l'instant. macOS et Linux sont pris en charge, sans solution Windows sur la page de démarrage rapide.

Questions fréquentes

C'est une plateforme communautaire de benchmark pour l'IA locale. Les gens lancent des modèles sur leurs propres machines et envoient des résultats de débit, classés par modèle, quantification et puce. Elle s'adresse à quiconque veut savoir à quelle vitesse un modèle tourne sur du matériel réel, qu'il s'agisse d'un ordinateur portable sur un bureau ou d'une station de travail dans un placard.

Contenus associés

Découvrez des outils, des compétences et des articles liés à ComputeArena.

Alternatives à ComputeArena

Forefront

Forefront

Forefront · Programmation

Forefront est une plateforme web pour construire avec de l'IA open source. Elle vous laisse affiner les principaux modèles de langage open source sur vos propres données, évaluer leurs performances et les exécuter via une API ou les exporter pour les héberger vous-même. Les développeurs qui veulent le confort d'une plateforme fermée mais tiennent à rester propriétaires de leurs modèles et de leurs données sont le public visé ici.

Gratuit / $0 - $99/moVoir les détails
Startkit

Startkit

StartKit.AI · Programmation

Startkit est un boilerplate pour créer des produits SaaS d'IA et des wrappers d'IA. Voyez-le comme un boilerplate de startup IA avec les parties ennuyeuses déjà branchées : authentification, paiements Stripe et Lemon Squeezy, limites d'usage, e-mail transactionnel et un kit de démarrage d'API IA qui parle à OpenAI, Anthropic, Groq ou Llama. Vous clonez le dépôt, fixez votre prix et attaquez la partie du produit pour laquelle les gens paient vraiment. Il repose sur Next.js au-dessus de React et Tailwind, donc une bonne partie du code boilerplate vous semble déjà familière.

Payant / $99 - $499 one-timeVoir les détails
Testim

Testim

Tricentis · Programmation

Testim est une plateforme d'automatisation des tests dopée à l'IA, qui sert à créer et exécuter des tests de bout en bout sur des applications web, mobiles et Salesforce. Elle s'appuie sur l'apprentissage automatique pour garder les tests stables quand une interface change, alors les équipes passent moins de temps à réparer des sélecteurs cassés. Pas mal pour un outil de tests automatisés que vous pouvez utiliser dès aujourd'hui. Vous créez des tests en enregistrant des actions dans un navigateur, puis vous ajoutez du JavaScript quand vous avez besoin de plus de contrôle. C'est un choix solide pour une équipe QA bien occupée.

Gratuit / Custom pricing on requestVoir les détails