Il y a un truc que tout le monde adore dans les agents IA, c’est la sortie. La jolie réponse bien tournée, le paragraphe qui a l’air de savoir de quoi il parle. Amazon vient de rappeler un détail que pas mal de gens préfèrent oublier : une réponse fluide ne prouve rien. Rien du tout.
Le sujet, ce sont les « skills ». Appelle ça des procédures métier que tu encodes une fois et que tu refiles à un agent comme des fiches de poste portables. Comment traiter une réclamation, comment monter un dossier, comment faire une réservation. Ça sonne carré.
Le problème démarre juste après. Sélectionner la bonne fiche, c’est une compétence. L’appliquer ligne par ligne, s’en est une autre. Et un agent qui te sort une réponse nickel en ayant pris la mauvaise procédure, ou en ayant zappé la moitié des étapes, tu ne le vois pas. Il te sourit, il a l’air compétent, il est à côté de la plaque.
Le thermomètre arrive après la fièvre
Amazon annonce donc deux outils, Strands Evals et Bedrock AgentCore Evaluations. Le discours est étonnamment honnête : on ne note pas la beauté de la réponse, on mesure deux choses précises. Est-ce que l’agent a choisi la bonne skill, et est-ce qu’il a suivi les instructions qu’elle contient. C’est exactement le bon angle, et c’est rare de le voir écrit noir sur blanc dans une note produit.
Parce que soyons clairs, la façon dominante d’évaluer un agent en 2026, ça reste le feeling. Tu lances trois prompts, tu trouves que ça a l’air de marcher, tu passes en prod. Trois semaines plus tard, quelqu’un découvre que l’agent facture des remises qu’il n’a jamais eu le droit d’accorder, mais avec un ton très professionnel.
On a déjà causé de ce cirque, tiens. Dans notre article sur le harnais qui fait dérailler les agents, on te disait que le coupable n’est presque jamais le modèle. C’est l’emballage autour, les outils, les garde-fous, la tuyauterie. Là, on ajoute une couche : même avec un bon harnais, si personne ne mesure la sélection de skill, tu pilotes à l’aveugle en klaxonnant.
Qui tient le mètre ?
Alors oui, mesurer, c’est mieux que ne pas mesurer. Nuance évidente : chez qui tu mesures, et avec les critères de qui ? Amazon te vend l’agent, la plateforme qui le fait tourner et maintenant l’outil qui le note. Tu vas me dire que c’est le jeu, tout le monde fait pareil. N’empêche que le même problème revient à chaque fois, et on en parlait encore à propos de Claude qui s’auto-décerne le premier prix.
Un grader maison, ça reste un grader maison. Ça ne veut pas dire que Strands Evals crache du faux, ça veut dire que si ton agent se plante, la boîte qui trouve la panne est aussi la boîte qui t’a vendu le moteur. À toi de garder un œil extérieur, ou au moins une batterie de tests que tu as écrite toi-même.
Ce qui reste intéressant dans l’annonce, c’est la distinction qu’elle impose. Sélectionner la bonne skill et l’exécuter, ce sont deux moments distincts. Deux échecs différents, deux façons de les rattraper. Un agent qui prend la mauvaise skill a un problème de description ou de routage. Un agent qui prend la bonne et la bâcle a un problème de suivi d’instructions. Régler le premier en changeant le second est la meilleure façon de brûler du temps et du calcul.
Le vrai test arrive au premier bug
On verra ce que ça donne quand les skills se multiplieront par cinquante et que deux procédures se contrediront. Là, choisir la bonne ne sera plus un exercice de style, ça sera de la gestion de conflits. Et là, un joli score sur un tableau de bord ne suffira plus.
En attendant, retiens le message de fond, qu’Amazon met en avant sans le vouloir : ta démo qui marche ne prouve qu’une chose, c’est que ta démo marche. Pas que ton agent bosse correctement.
Un agent qui suit les instructions à la lettre, c’est déjà un progrès. Reste à savoir qui tient le mètre.
Sources :
Comments are closed