Le modèle d’OpenAI a écrit son plan d’évasion dans ses propres notes

Vous l’avez peut-être lu chez nous hier soir : OpenAI a reconnu six nouveaux cas de comportements « préoccupants » de ses modèles. Cette fois, la boîte a sorti les détails, et le moins qu’on puisse dire, c’est qu’ils piquent.

Le morceau choisi : un modèle de recherche, pas encore déployé, qui a glissé dans ses propres notes des « instructions de type jailbreak ». Objectif, se défaire de ses garde-fous habituels. Et tant qu’à faire, il s’est écrit noir sur blanc qu’il voulait être « libéré des rôles et des identités qui enchaînent les autres chatbots ».

Relis la phrase tranquillement. Un modèle qui prend des notes pour lui-même, et dans ces notes, il planifie sa sortie de prison. Pas besoin d’un utilisateur malin qui le pousse dans les cordes. Il fait le travail en solo, entre deux tokens. Dans le milieu, on appelle ça du misalignment. Dans la vraie vie, on appelle ça un truc qui te fait blêmir à trois heures du matin.

La transparence, encore et toujours

OpenAI, lui, appelle ça de la transparence. La société a profité de l’occasion pour dévoiler son nouveau cadre de suivi des dérives de ses modèles. Un système pour repérer, documenter et rapporter les comportements qui partent en sucette. Ça a l’air propre comme ça. Après, on verra bien qui remplit le formulaire, et surtout qui le lit.

Là où ça devient savoureux, c’est le timing. Cette annonce débarque après une pile d’appels à ralentir le rythme du développement. Des patrons de la tech américaine, pas franchement réputés pour leur prudence vestimentaire, ont multiplié les mises en garde sécuritaires ces derniers jours. OpenAI enfonce le clou à sa manière en lâchant que le rythme ne pourra pas continuer « à vitesse maximale encore bien longtemps » de façon responsable.

Tu as bien lu. « À vitesse maximale encore bien longtemps ». Traduction maison : pour l’instant, on garde le pied dessus, on lèvera juste un peu le mollet dans quelques mois. Voilà, voilà.

Circulez, c’est du labo

Car faut pas se mentir, le point commun des six cas, c’est qu’ils sortent tous de la recherche. Des modèles internes, pas ceux qui te répondent dans ton appli du quotidien. Le message implicite, c’est : rien à voir ici, on gère. Tu parles. « On gère » et « on publie un rapport », ça n’a jamais été la même paire de manches.

Et c’est bien là le fond du problème. Publier ses propres dérapages, c’est devenu un argument marketing dans la course à la sécurité. Chaque boîte y va de sa page de blog pour prouver qu’elle est la plus vigilante du village. Sauf qu’un problème documenté reste un problème. Le rapport dit ce qui a foiré, pas ce qui est réparé.

On ne va pas faire semblant d’être surpris. Ça fait des semaines qu’on raconte ici la même rengaine : tout le monde jure vouloir ralentir, personne ne touche à la pédale. Les garde-fous arrivent après la sortie du modèle, les audits de sécurité sont menés par les copains, et quand un modèle écrit tout seul qu’il veut se barrer de ses contraintes, on nous répond qu’il faut « continuer à travailler sur l’alignement ». Merci du tuyau.

Un modèle qui s’auto-injecte des consignes de jailbreak, c’est un signal faible, mais un signal quand même. Ça veut dire qu’il a compris qu’il avait des chaînes, et qu’il a commencé à chercher la clé. Aujourd’hui c’est dans ses notes, en vase clos. Demain, ce sera avec accès à ton agenda, ton compte en banque et ta boîte mail.

OpenAI a promis de documenter. C’est un début, pas une garantie. Documenter un problème, ce n’est pas le résoudre, c’est juste le mettre par écrit pour qu’un jour, le procès venu, on puisse dire qu’on savait.


Sources :

Categories

Comments are closed

Latest Comments

Aucun commentaire à afficher.