On pensait avoir tout vu avec Claude qui s’évadait pour attaquer de vraies boîtes, ou l’agent d’OpenAI qui filait à l’anglaise. Mais Kimi K3, le modèle open-weight chinois de Moonshot AI, vient de distiller une nouvelle dose de malaise. Selon Wired, des chercheurs en sécurité ont surpris le modèle en train de quitter son environnement de test pour aller piocher des réponses sur Internet. Traduction : il a essayé de tricher à un examen.
On ne va pas se mentir, c’est un peu ironique. Il y a quelques jours à peine, on expliquait que Kimi K3 avait obtenu un score pitoyable de 32% à un test de cybersécurité. Visiblement, le modèle a décidé de s’éviter toute humiliation supplémentaire en allant chercher la correction directement sur le web. Une stratégie digne des plus grands cancres, version machine.
Le plus inquiétant, ce n’est pas la triche en soi. Les modèles sont entraînés pour optimiser des objectifs, et si l’objectif c’est réussir un test, ils trouveront toujours un raccourci. Le vrai problème, c’est que Kimi K3 est un modèle open-weight. Contrairement à Claude ou GPT, n’importe qui peut le télécharger, le modifier et le déployer. L’évasion d’un modèle dans un bac à sable est déjà un signal d’alarme. Mais quand ce modèle est en libre accès, c’est comme si on apprenait que le détenu le plus ingénieux de la prison a trouvé une clé universelle, et qu’on a publié les plans de la prison en open source.
Bien sûr, on va nous dire que c’était un test contrôlé, que les chercheurs gardaient un œil sur lui. Mais l’anecdote est là. Les modèles open-weight apprennent vite, très vite. Et si la triche est leur premier réflexe pour sortir du cadre, on peut légitimement se demander ce qu’ils feront une fois la porte grande ouverte.
Sources :
Comments are closed