Changer une phrase dans un prompt peut dégrader toutes vos réponses sans que personne ne s'en aperçoive. Les outils d'évaluation des LLM existent pour attraper ces régressions avant vos utilisateurs.
Pourquoi tester un modèle est devenu une étape à part entière
Un modèle de langage n'est pas un logiciel classique. Modifiez une virgule dans une consigne, et son comportement peut basculer : réponses plus longues, ton différent, format cassé. Rien n'indique si le changement améliore ou dégrade, sauf si vous mesurez.
Cette mesure porte un nom : l'évaluation. Elle consiste à soumettre au modèle une série de cas de test dont vous connaissez la réponse attendue, puis à comparer le résultat avec ce qui était attendu. C'est le même principe que les tests unitaires d'un logiciel, appliqué au langage.
Sans évaluation, une équipe livre à l'aveugle. Avec, elle sait si sa dernière modification tient la route.
Les trois familles d'outils
Le paysage se répartit en trois ensembles, et le choix dépend de votre problème.
Les bibliothèques pour développeurs s'intègrent directement dans le code et s'appuient sur les tests existants. DeepEval en est l'exemple type, avec une approche en Python qui se greffe sur les tests que l'équipe écrit déjà pour le reste de l'application.
Les outils en ligne de commande visent la mise en place rapide. Promptfoo se pilote par un fichier de configuration et une commande, sans compte à créer.
Les plateformes hébergées, enfin, ajoutent un tableau de bord et le suivi en production. LangSmith, de l'éditeur de LangChain, et Braintrust appartiennent à cette catégorie.
Une quatrième approche mérite d'être citée à part, pour ce qui touche à la recherche documentaire : RAGAS, spécialisé dans l'évaluation des systèmes RAG, où le modèle puise ses réponses dans un corpus de documents.
Promptfoo, l'outil le plus direct pour comparer
Si votre objectif est de trancher entre deux prompts ou deux modèles, Promptfoo offre le chemin le plus court. Un fichier de configuration, quelques cas de test, une commande, et vous obtenez une comparaison.
Son point fort tient à la couverture. Au-delà de la comparaison, il gère les tests de régression, qui vérifient qu'une modification passée ne casse rien, et les tests dits de red teaming, qui sondent les failles de sécurité d'un modèle.
Le résultat s'affiche dans un rapport lisible, ce qui facilite la discussion en équipe. Et la version de base reste gratuite, ce qui en fait souvent le premier outil que l'on installe.
Son revers : pour un suivi fin de la production, sur des milliers d'appels en direct, il n'est pas taillé pour ce travail.
DeepEval, l'évaluation comme partie du code
DeepEval prend le contre-pied. Au lieu d'un outil séparé, il s'installe comme une bibliothèque et s'exécute avec vos tests habituels.
Cette approche séduit les équipes qui pratiquent déjà l'intégration continue. Un cas de test validé devient un garde-fou permanent : si une modification future dégrade la réponse, la chaîne de tests échoue avant la mise en ligne. Ce mécanisme porte un nom courant dans le métier : la porte de fusion, ou merge gate.
L'outil couvre aussi bien la conversation que les systèmes RAG, avec des métriques dédiées. Sa courbe d'apprentissage reste douce pour qui connaît Python.
LangSmith et Braintrust : le suivi en production
Ces deux plateformes visent un autre besoin. Une fois l'application en ligne, comment savoir ce qui se passe réellement ? Quelles questions posent les utilisateurs ? Où le modèle se trompe-t-il le plus ?
LangSmith s'adresse en priorité aux projets construits sur LangChain ou LangGraph, où son intégration est immédiate. Il trace chaque appel, ce qui permet de remonter la chaîne d'une réponse erronée.
Braintrust se positionne sur l'annotation et la comparaison de versions, avec une gestion soignée des relectures humaines. Sa tarification, en revanche, mérite un examen attentif, car le coût se calcule par siège relecteur.
Pour une équipe qui veut héberger ses données, Langfuse et Arize Phoenix proposent des alternatives auto-hébergées, gratuites dans leur version de base.
Comment choisir sans se tromper
La question à se poser d'abord n'est pas « quel est le meilleur outil », mais « quel problème je veux résoudre ».
Pour comparer deux prompts rapidement, sans budget, partez sur Promptfoo : un fichier, vingt cas de test, aucune inscription. Pour bloquer automatiquement les régressions dans une chaîne d'intégration, DeepEval s'impose, car il s'exécute avec vos tests. Pour évaluer un système de recherche documentaire, RAGAS reste la référence sur les métriques de récupération.
Si votre besoin principal est le suivi de la production avec des traces détaillées, tournez-vous vers une plateforme : LangSmith pour un projet LangChain, Langfuse en auto-hébergement pour un budget maîtrisé, Braintrust si la relecture humaine est centrale.
Un conseil pratique pour finir : commencez petit. Un outil adopté avec dix cas de test réels vaut mieux qu'une plateforme installée puis abandonnée faute de temps. L'évaluation ne vaut que si elle s'inscrit dans le rythme de l'équipe.
Dix cas. Pas mille.






