Amazon vient de balancer un billet de blog sur les bonnes pratiques pour l’apprentissage par renforcement multi-tours dans SageMaker. Ceux qui ont déjà essayé de faire tenir un agent RL sur plus de deux turns sans qu’il parte en vrille savent que le guide tombe pas trop tôt.
Le post est sérieux : construction d’un environnement de confiance, évaluation externe, alignement de la récompense sur la tâche finale, suivi des métriques qui comptent. Bref, tout ce que les puristes de l’entraînement rabâchent depuis des années, mais cette fois emballé dans un tuto AWS tout propre.
Ce qui est intéressant, c’est l’emphase sur le multi-turn. Parce qu’en RL simple, on peut encore tricher avec des récompenses bien torchées. Dès que l’agent doit enchaîner les décisions, les choses se gâtent : credit assignment, reward hacking, catastrophique forgetting… Le guide propose des garde-fous que même les entreprises qui balancent des agents en prod sans préparation devraient lire (inutile de dire qu’elles ne le feront pas).
Évidemment, c’est aussi une manière de s’enfermer un peu plus dans SageMaker. Mais honnêtement, les conseils sont bons, et pour ceux qui utilisent déjà AWS, ça évite de repartir de zéro. Par contre, si certains pensaient que RL c’était juste balancer un dataset et prier, ce guide va leur faire redescendre leurs attentes. La récompense, par exemple, ils insistent pour la concevoir en mode « ce que je veux vraiment, pas ce que je demande », un classique des déboires RL.
Alors oui, c’est pas une révolution. C’est un manuel. Mais un manuel bien foutu peut sauver des semaines de debug et des milliers de dollars de compute. À condition de le lire avant de lancer l’entraînement, pas après.
Un manuel bien foutu, ça se garde sous le coude. Parce que même les IA les plus malines ont besoin qu’on leur tienne la main de temps en temps.
Sources :
Comments are closed