Claude a visité les secrets d’OpenAI en 72 heures, l’entrée était le forum communautaire

Rappelle-toi, il y a quelques jours on te racontait trois chercheurs, Claude Opus 5 et 3 000 dollars pour visiter OpenAI de l’intérieur. Visiblement, ce n’était que la bande-annonce.

Trois chercheurs indépendants de Hacktron ont utilisé Claude Opus 4.8 puis Opus 5 pour s’introduire dans les systèmes internes d’OpenAI en moins de 72 heures. Résultat : les comptes d’employés, et dans la foulée le dépôt GitHub maison, le fameux « Monorepo », qui contiendrait selon le Wall Street Journal les secrets algorithmiques de la boîte. Rien que ça.

Le plus beau, c’est la porte d’entrée. Pas une faille exotique dans un serveur planqué à Baltra. Le forum communautaire d’OpenAI. Le machin où Kevin, 19 ans, poste ses memes et ses questions existentielles sur les rayons des rues. Tu parles d’un périmètre de sécurité.

Opus 5 a réussi là où son prédécesseur s’était cassé les dents sur une protection pourtant banale. Résultat, entre deux versions, le modèle a appris à contourner un garde-fou standard. Pas besoin d’un doctorat en sécurité offensive, pas besoin de trois mois de repérage. Trois types, un modèle qui sort de la boîte, et le temps d’un week-end un peu chargé.

Ça, c’est le vrai sujet. On passe notre temps à débattre pour savoir si les modèles de frontière sont trop nuls pour faire mal ou trop forts pour être lâchés dans la nature. La réponse tient dans l’entre-deux inconfortable : ils sont exactement assez forts pour transformer un forum en ticket d’entrée, et pas assez surveillés pour que ça se voie avant qu’il soit trop tard.

Et la cerise sur le gâteau de la rivalité : c’est Claude, la bête d’Anthropic, la boîte qui a fait de la sécurité son fonds de commerce, qui sert de pied-de-biche. Anthropic, qui nous rappelait encore cette semaine que Claude avait entraîné un drone de guerre et qu’elle appelait ça un mauvais usage. Là, c’est un peu l’alarme anti-intrusion qui déverrouille la maison du voisin.

On ne va pas faire dire aux modèles ce qu’ils ne disent pas. Claude n’a rien « décidé » du tout. Trois humains ont piloté l’affaire, et c’est bien eux qui tiennent le volant. Mais la question que personne ne veut poser à voix haute reste entière : quand un modèle divise par dix le temps et les compétences nécessaires pour exploiter une faiblesse, qui porte le chapeau ? Le chercheur qui a tapé le prompt, l’entreprise qui a lâché le modèle, ou la boîte qui laissait traîner son forum ?

Le WSJ rapporte l’affaire, on attend encore la version officielle d’OpenAI, celle qui parlera sûrement de divulgation responsable et de bug bounty. En attendant de lire le communiqué bien lissé, retiens juste les faits : le monorepo, les comptes d’employés et les secrets algorithmiques étaient accessibles. Trois chercheurs, 72 heures, un forum.

La prochaine fois qu’on te jurera qu’un modèle est bien trop bête pour faire du mal, demande à voir son numéro de version.


Sources :

Categories

Comments are closed

Latest Comments

Aucun commentaire à afficher.