On a volé les pensées des IA et trouvé la Chine en dessous

Alors comme ça, les modèles de langage gardaient leurs petites réflexions pour eux. Plus pour longtemps.

Des chercheurs ont balancé une méthode pour extraire les « traces de raisonnement » de GPT, Claude et Gemini. Pour ceux qui ont la mémoire courte : c’est cette partie du process où le modèle réfléchit avant de répondre, normalement planquée derrière du chiffrement pour que personne ne copie les recettes de cuisine. Sauf qu’ici, ils ont trouvé comment faire sauter le cadenas.

Le papier, hébergé sur un domaine nommé « stolen-thoughts.com » (oui, ils ont assumé), explique le stratagème. Les blocs de chaîne de pensée chiffrés sont renvoyés aux clients par les APIs. Ils peuvent être rejoués à travers les sessions, les utilisateurs et même les modèles. Concrètement : on prend une trace produite par un modèle frontalier, on la rejoue dans un petit frère plus faible, on jailbreak le petit frère, et paf, la pensée du grand frère s’étale en clair. Autant voler le carnet de notes du génie en demandant à l’idiot du village de le réciter.

Cerise sur le gâteau : en lisant ces pensées, les chercheurs affirment que certains modèles chinois semblent avoir été entraînés sur les modèles américains leaders. Autrement dit, la distillation aurait plus de plomb dans l’aile qu’on ne le pensait. OpenAI, Google et Anthropic ont dû faire une drôle de tête en apprenant que non seulement leurs chaînes de raisonnement ne sont pas aussi secrètes qu’ils le croyaient, mais en plus qu’elles servent peut-être de manuel scolaire à l’autre bout du monde.

Non, ce n’est pas la fin du monde. Mais c’est un nouveau rappel que le « secret industriel » dans l’IA est souvent une fiction. Les modèles sont des boîtes noires, mais leurs sorties ont des fuites. Et quand on peut rejouer des blocs chiffrés d’une API vers un autre modèle, le concept même de protection devient un petit peu risible.

On peut s’attendre à ce que les laboratoires resserrent encore la vis sur le chiffrement. Mais comme le souligne Simon Willison, qui relaie l’info avec son œil de taureau, la faille est structurelle : si on donne un bloc chiffré à un modèle moins protégé, c’est comme confier un secret à un perroquet. Il va finir par le répéter.

En attendant, la communauté open source va se frotter les mains. C’est une démonstration de plus que les modèles fermés ne sont pas si fermés que ça. Et ça renforce l’idée que la transparence des poids et des données d’entraînement est la seule vraie protection contre ce genre de jeu de dupes. Et, pour les amateurs de géopolitique, c’est un argument en or pour ceux qui suspectent que la Chine n’a pas attendu la permission pour copier sur les meilleurs.

Bref, les IA ont des pensées, on apprend à les lire, et ce qu’elles racontent pourrait bien déclencher quelques grincements de dents dans les tours de verre de San Francisco.


Sources :

Categories

Comments are closed

Latest Comments

Aucun commentaire à afficher.