Pour les passionnés de la qualité des logiciels

Comment tester un agent IA ? Stratégies, techniques et retours d’expérience

tester un agent IA

Votre agent IA raisonne, planifie et agit seul : comment savoir s’il prend les bonnes décisions?

Lors de la Soirée du Test Logiciel 2026 organisée le 15 septembre au siège de l’ETSI à Sophia-Antipolis, Julien Van Quackebeke, CEO chez All4Test et organisateur de l’événement, a expliqué pourquoi les agents IA obligent la QA à changer de méthode.

🎬 Pas de replay pour cette édition. 
9 conférences : les échanges avec les speakers ne se vivent qu’en salle.
Soyez prévenu en avant-première des prochaines éditions 

Le problème : des tests conçus pour des systèmes déterministes

Un agent IA, c’est un LLM de raisonnement, une mémoire, des outils et des garde-fous. Là où une application classique renvoie toujours le même résultat pour la même entrée, un agent peut donner plusieurs réponses acceptables. D’où quatre difficultés :

  • Le non-déterminisme → une même requête, des réponses différentes
  • L’oracle de test → comment établir le verdict sans résultat attendu unique ?
  • L’exécution en plusieurs étapes → une bonne réponse peut cacher un mauvais chemin
  • L’auto-amélioration → le comportement de l’agent évolue dans le temps

« Le défaut n’est pas dans ce que l’IA produit. Il est dans le fait de l’accepter », résume Jean-Paul Achard.

La réponse : tester le comportement, pas seulement le résultat

Sa stratégie : commencer par la boîte noire, puis ouvrir la boîte.

1️⃣ Le résultat de bout en bout : taux de réussite sur un « golden set » de tâches représentatives, avec critères d’acceptation et grille d’évaluation
2️⃣ La trajectoire : outil mal choisi, paramètres incorrects, hallucinations, étapes en trop
3️⃣ Les composants : planification, outils, mémoire

« Lorsqu’un agent échoue, vous déboguez le chemin, pas seulement la réponse », résume Julien Van Quackebeke.

Face au non-déterminisme, quatre techniques : un LLM ou un agent « as a judge », des tests basés sur les propriétés (JSON valide, ton, longueur), des exécutions répétées avec seuils de variance, et des notes graduées plutôt qu’un simple réussi/échoué. Sans oublier la supervision humaine, qui doit elle-même être testée, et la conformité (EU AI Act, ISO/IEC 42001).

Deux retours d’expérience chiffrés

  • Un agent de conception de tests avec RAG : 350 items de test, dont 300 générés par IA, et 4 ateliers utilisateurs. La génération de données par IA a permis une forte progression de l’agent.

  • Un agent d’exécution de tests fonctionnels : plus de 700 scénarios sur plus de 50 applications et plus de 100 campagnes d’évaluation en 18 mois, grâce à une infrastructure de test dédiée.

Les bénéfices concrets

✅ Une qualité mesurable malgré la variabilité → efficacité, efficience, robustesse et sécurité se mesurent même quand les réponses changent
✅ Des échecs compris, pas seulement constatés → l’analyse de trajectoire pointe l’étape fautive
✅ Des agents qui progressent de façon mesurable → campagnes d’évaluation et itérations courtes

Sa conclusion : un agent IA ne se valide pas avec des assertions déterministes, mais par une évaluation sémantique et comportementale.

Découvrez la conférence

Le support de Julien Van Quackebeke (34 slides) détaille les quatre piliers de la qualité des agents, la stratégie boîte noire et boîte de verre, les techniques face au non-déterminisme avec leurs seuils de notation, les obligations de l’EU AI Act, les deux retours d’expérience et une sélection de ressources (benchmarks, normes, sécurité).

Cette conférence n’a pas été filmée : les questions de la salle et les échanges avec Julien Van Quackebeke au buffet ne se vivent qu’en présentiel. Pour être dans la salle la prochaine fois, inscrivez-vous à la newsletter ci dessous et recevez les dates avant tout le monde.

Téléchargez le support de présentation (PPT) pour explorer les architectures, use cases et roadmap de cette innovation QA :

Participez en personne aux prochaines éditions !

Les retours d’expérience comme celle-ci font toute la richesse des Soirées du Test Logiciel. 

Mais pourquoi participer en personne ?

✅ Échanger directement avec des experts du domaine et enrichir votre réseau professionnel
✅ Découvrir des pratiques innovantes pour valoriser votre rôle au sein de votre organisation
✅ Accéder à des ressources exclusives (PPT, démos, discussions post-conférence)
✅ Profiter de conférences 100% gratuites et inspirantes
✅ Networker autour d’un buffet convivial avec les intervenants et autres participants

Ne manquez pas les prochaines éditions en rejoignant notre communauté !

Rejoignez la communauté du Test Logiciel

Suivez notre page LinkedIn si ce n’est pas déjà fait pour rester connecté à l’actualité de la qualité logicielle et ne manquer aucun événement 👉LinkedIn Soirée du Test Logiciel

📧Inscrivez-vous à notre newsletter en quelques secondes !
Ajoutez simplement votre adresse mail dans le footer tout en bas de cette page.

Ce que vous recevrez en avant-première :

  • Les annonces des prochains événements (avant tout le monde !) 📅
  • Les nouvelles conférences et contenus exclusifs 🎥
  • Les offres et promotions réservées à notre communauté 🎁

Rejoignez une communauté de plus de 650 professionnels passionnés par la qualité logicielle, le test et l’innovation QA / IA.

Facebook
X
LinkedIn

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Ce site utilise Akismet pour réduire les indésirables. Découvrez comment les données de vos commentaires sont traitées.

À propos de l'organisateur
Logo STL transparent
SOIRÉE DU TEST LOGICIEL

La Soirée du Test Logiciel est un événement dédié à la qualité logicielle et au test. Cet événement est organisé à Sophia-Antipolis, Bordeaux et Lille.