« Meilleur modèle pour coder » ne veut plus dire grand-chose. Deux étapes comptent vraiment : écrire une fonction isolée, et corriger un bug dans une base de code existante. Les modèles qui gagnent sur l'une ne gagnent pas toujours sur l'autre.
Ce que mesurent vraiment les classements de code
Commençons par la difficulté qui trompe le plus de lecteurs. Les tableaux de scores de code mélangent des épreuves très différentes, et les présenter ensemble fausse la comparaison.
En haut de l'échelle, les tests du type HumanEval demandent d'écrire une fonction à partir d'un énoncé. Utiles, mais éloignés du travail réel. En bas, les tests du type SWE-bench simulent une vraie intervention : un bug décrit dans un ticket, une base de code complète, une correction à produire qui passe les tests existants.
C'est le second type qui prédit votre expérience quotidienne. Et c'est aussi celui où les scores sont les plus fragiles, car beaucoup sont publiés par les éditeurs eux-mêmes, sans vérification d'un tiers.
Deux mesures indépendantes servent de repère dans ce guide : SWE-bench Pro, un test de correction dans des bases réelles, et l'index Coding Agent d'Artificial Analysis, qui intègre le coût par tâche en plus de la qualité.
Les trois modèles qui dominent sur le code
Claude Fable 5, d'Anthropic, occupe la première place sur le code des gros projets. Sur SWE-bench Pro, il atteint 80 %, une des meilleures marques publiées, avec l'étiquette dite « soutenue » dans les tableaux indépendants. Sa faiblesse tient au tarif, parmi les plus élevés du marché, et à un accès plus restreint.
GPT-6 Astra, publié par OpenAI le 3 septembre 2026, s'illustre autrement. Sur l'index Coding Agent d'Artificial Analysis, il mène pour le rapport coût-résultat : environ la moitié du coût par tâche de Claude Fable 5, pour un score équivalent. Un argument qui pèse quand on fait tourner un agent des heures entières.
Claude Opus 4.8, enfin, reste une référence pour les corrections sur des bases existantes, avec 69,2 % sur SWE-bench Pro. Sa version ultérieure, Claude Opus 5.5, monte même en tête d'un classement de code récent, à 87,6 points. Anthropic occupe donc deux des premières places.
Les modèles open source qui rivalisent
Si le budget compte, l'open-weight change la donne. DeepSeek V4 Pro affiche 80,6 % sur SWE-bench Verified, la meilleure marque publiée pour un modèle à poids ouverts sur cette mesure. Pour un coût d'API plusieurs fois inférieur à celui des modèles fermés.
Qwen, d'Alibaba, vise le même terrain. La version Qwen3.6-27B, un modèle dense de taille modeste, atteint 77,2 % sur SWE-bench Verified, ce qui la place au niveau de modèles bien plus lourds. Sa licence Apache 2.0 autorise l'usage commercial sans contrainte majeure.
Pour une équipe qui veut héberger son propre assistant de code, sans faire sortir son code source, ces deux familles offrent une voie crédible. Le compromis porte sur le confort d'intégration, moins abouti que chez les éditeurs commerciaux.
Éditeur ou agent : deux approches opposées
Le choix d'un modèle ne suffit pas. Il faut aussi décider comment vous l'utilisez, et deux familles d'outils se font face.
D'un côté, les assistants intégrés à l'éditeur de code, comme Copilot ou Cursor. Ils vivent dans votre fenêtre de travail, suggèrent des lignes au fil de la frappe, répondent à une question sur le fichier ouvert. Leur force est la proximité, leur limite le périmètre : ils voient peu de choses au-delà du fichier.
De l'autre, les agents en ligne de commande, comme Claude Code ou Codex. Ils prennent un objectif, explorent le projet, modifient plusieurs fichiers, lancent les tests. Leur force est l'autonomie sur une tâche entière, leur limite le coût, car un agent qui tourne longtemps consomme beaucoup de jetons.
Le critère de choix tient à votre façon de travailler. Pour compléter du code au fil de l'eau, un assistant d'éditeur suffit. Pour déléguer une tâche de bout en bout, un agent fait gagner des heures. À une condition : vérifier son travail.
Comment choisir selon votre situation
Trois profils se dégagent nettement.
Pour une correction urgente dans une base ancienne et complexe, Claude Fable 5 ou Opus 4.8 sont les plus fiables, si le prix ne bloque pas. Pour un agent qui doit tourner longtemps sans exploser le budget, GPT-6 Astra offre le meilleur compromis. Pour un projet où le code doit rester chez vous, DeepSeek V4 Pro ou Qwen ouvrent la voie, sans dépendance à un fournisseur unique.
Un point souvent négligé : la qualité d'un modèle de code dépend beaucoup du contexte qu'on lui donne. Un modèle moyen avec l'historique du projet et les tests sous les yeux surpassera souvent un meilleur modèle lancé à l'aveugle. Soigner les consignes compte autant que choisir la bonne version.
Le test qui tranche
Aucun classement ne dira si un modèle convient à votre code, parce qu'il dépend de votre langage, de votre architecture, de la qualité de vos tests.
La méthode la plus fiable tient en une heure. Prenez un bug réel de votre projet, celui qui vous a coûté du temps la semaine dernière. Donnez-le à deux modèles différents, avec le même contexte. Regardez lequel produit une correction qui passe vos tests sans casser autre chose. C'est la seule mesure qui compte pour vous.
Les modèles de code progressent vite. Ce que les tableaux ne capturent pas, c'est la façon dont chacun s'accorde à votre manière de travailler. Ce critère-là, vous seul pouvez le juger, et il pèse plus que n'importe quel score de benchmark. Alors, lequel essayer en premier ? Celui que votre équipe peut tester dès cette semaine.






