Évaluer un LLM ou un assistant IA : qualité, latence, coût et régressions
Un benchmark public classe des modèles sur des tâches générales. Une évaluation produit mesure votre qualité, avec vos données, vos contraintes et vos erreurs coûteuses.
Blog PartITech
Analyses techniques, guides pratiques et retours d’expérience pour concevoir, moderniser et maintenir des applications durables.
Un benchmark public classe des modèles sur des tâches générales. Une évaluation produit mesure votre qualité, avec vos données, vos contraintes et vos erreurs coûteuses.
Un prompt n’est pas le seul endroit où des données personnelles peuvent apparaître. Documents indexés, logs, traces, mémoire, sorties, feedback et outils connectés forment une chaîne qu’il faut rendre visible avant de choisir les garanties.
Le bon choix ne dépend pas du nombre de fonctionnalités. Il dépend de ce qui différencie l’entreprise, de ce qui doit rester sous contrôle et de ce qu’un fournisseur peut assumer durablement.
Tous les protocoles agentiques ne résolvent pas le même problème. Les empiler sans besoin clair augmente la surface d’attaque et la complexité opérationnelle.
MCP standardise la connexion entre applications IA, données et outils. Il ne standardise ni la confiance, ni les droits métier, ni la gouvernance : ces responsabilités restent à concevoir.
Le texte brut ne suffit pas lorsqu’un montant dépend d’une colonne, qu’une signature doit être localisée ou qu’une citation doit revenir à une zone précise du document.
Un PRA n’est pas un document rangé dans un dossier. C’est une capacité testée à restaurer un service, ses données et ses dépendances dans un délai accepté par le métier.
Le meilleur modèle général n’est pas forcément le meilleur composant de votre application. En 2026, la sélection doit comparer des versions précises sur des tâches réelles, puis prévoir routage, canary, fallback et réévaluation.
Une application générative change lorsque le modèle, le prompt, le corpus, les outils ou les politiques évoluent. L’exploitation doit pouvoir attribuer chaque résultat à cette configuration.
Mutualiser ne signifie pas rendre tous les sites identiques. Une bonne plateforme partage ce qui doit l’être et rend explicites les marges de liberté locales.
Un bon dispositif de maintenance ne promet pas que rien ne tombera en panne. Il définit comment les incidents sont détectés, qualifiés, rétablis et empêchés de se répéter.
Un agent de code peut modifier plusieurs fichiers, lancer des tests et préparer une pull request. Sa vitesse rend les garde-fous d’architecture et de revue plus importants, pas moins.