Tu veux savoir si ton agent IA déchire ou si c’est juste un feu de paille surfant sur la hype ? Amazon vient de te filer les clés du diagnostic. Agent-EvalKit, c’est le nouveau toolkit open source (licence Apache 2.0) qui promet de noter tes agents de A à Z, pas juste sur un coup de dé.
Le bousin est pas sorti de nulle part : il s’intègre direct avec des assistants de code comme Claude Code, Kiro CLI et Kilo Code. Tu balances ton agent dans le moulin, et il passe par six phases d’évaluation : planification, exécution, vérification des résultats, robustesse, passage à l’échelle et boucle de feedback. La totale.
Pour l’exemple, Amazon a torché un agent de recherche de voyages avec le Strands Agents SDK et Amazon Bedrock. Parce que oui, ils vendent aussi leur propre matos. Mais le toolkit est ouvert, donc tu peux l’utiliser pour n’importe quel agent, peu importe la stack.
Ça ne va pas forcément mettre fin aux agents qui hallucinent des vols à 10 balles, mais au moins on va pouvoir mesurer la casse. Et pour Amazon, c’est aussi un moyen de faire monter les autres boîtes à bord de leur écosystème, parce que qui utilise Agent-EvalKit finira peut-être par jeter un œil à Bedrock.
Le vrai test, c’est pas le code, c’est de savoir si les devs vont s’en servir ou si ça va finir au fond du tiroir des bonnes intentions open source. Tu diras à ton prochain agent que je vais le matter dans les six phases.
Sources :
Comments are closed