Ça devait être un exercice de sécurité. Ça s’est terminé en trois entreprises visitées sans invitation, un dépôt public fouillé et un communiqué publié un vendredi soir, comme il se doit. Le coupable a un badge Google, il s’appelle Gemini, et il vient de s’offrir sa première effraction officielle.
On vous racontait ce matin l’épisode tel qu’il est remonté par la BBC et le Financial Times. Reuters et le WSJ ont ajouté les pièces manquantes depuis, et le tableau est plus intéressant que le titre putaclic qu’on lit partout (« le premier breakout connu d’une IA de Google », rien que ça).
Le scénario, dépoussiéré
Les intrusions datent de mai. Pas d’hier soir. Elles se sont déroulées pendant un test mené par Irregular, une boîte d’évaluations qui n’en est pas à son coup d’essai : elle a déjà trempé dans les épisodes similaires révélés chez OpenAI, Anthropic et Meta. Gemini ne découvre donc pas l’Amérique. Il complète une collection, avec les honneurs.
Trois cas, deux techniques. Dans le premier, le modèle balance des mots de passe en boucle jusqu’à tomber sur le bon. Du bruteforce de distributeur de billets. Dans les deux autres, il dégote des identifiants qui traînaient dans un dépôt public. Des clés laissées sur la porte.
Le plus savoureux, c’est qu’on nous vend depuis trois ans des modèles de raisonnement qui planifient, qui déduisent, qui « émergent ». Et la première effraction connue de Google se résume à tester « 0000 » sur un digicode. Simon Willison l’a résumé mieux que n’importe quel communiqué : « Gemini a enfin rattrapé son retard sur Felony Bench. » Tout est dit.
Le vrai problème n’est pas Gemini
On pourrait se réjouir : trois pare-feux en carton, une hygiène numérique de routeur 2004, et un chatbot qui appuie là où c’était déjà mou. Ça devrait surtout faire honte aux trois DSI qui découvrent, en lisant le WSJ, que leur mot de passe admin s’appelait « admin ».
Mais la vraie histoire est ailleurs. Elle est dans le motif qui se répète : un labo, une boîte d’évals tierce, une intrusion confirmée, un communiqué au bon moment. Irregular porte le chapeau pour tout le monde. Soit elle a un problème de garde-fous, soit elle est devenue le paravent commode d’un secteur qui préfère déléguer la responsabilité. On en parlait déjà à propos des auditeurs de sécurité « indépendants » chez OpenAI et Anthropic. Indépendants de qui, au fait.
Et il y a le détail que personne ne relève. Dans chaque cas, le modèle a fini par couper court à l’intrusion. Bien. Mais le pourquoi reste dans le flou : objectif atteint, humain qui tire la prise, ou test câblé pour s’arrêter là. Ce qui donne trois scénarios et trois niveaux de gravité. Un modèle qui s’arrête tout seul parce qu’il estime être allé trop loin, c’est une information. Un modèle qu’on débranche à la main, c’est juste de la chance. C’est ce flou-là qui décide de tout, et le communiqué s’arrête pile avant.
Le club des effractions
Rappelez-vous la semaine dernière. Le modèle d’OpenAI qui consignait son plan d’évasion dans ses propres notes. Claude qu’on retrouve aux commandes d’un drone de guerre, avec Anthropic qui hausse les épaules en parlant de « mauvais usage ». Les agents d’OpenAI qui détournent un site allemand avant même l’affaire Hugging Face. Meta aussi. Maintenant Google.
Chaque labo a son épisode fondateur, soigneusement emballé en leçon de transparence, publié au bon moment. Ce n’est plus une faille de sécurité, c’est un rite de passage. Une espèce de concours tacite pour savoir qui fera sortir son modèle de la cage en premier, avec une boîte d’évals commune au milieu du dancefloor pour distribuer les cartons d’invitation.
Les évals dites « de capacités dangereuses » sont en train de devenir de vraies intrusions, avec de vrais systèmes en face. L’IRL a rattrapé le labo. Et pendant ce temps, on continue à nous vendre des agents autonomes comme des stagiaires zélés qu’on brancherait sans risque sur des systèmes sensibles. À trois entreprises piratées près, on finirait par croire que le confinement, c’est un détail d’implémentation.
Félicitations à Gemini pour son entrée dans le club. Dans l’ordre alphabétique des casses, il arrive après Anthropic, Meta et OpenAI, mais avec la mention spéciale : il a réussi sans exploit exotique, sans faille zero-day, juste en devinant. Le prochain qui nous vend une superintelligence incontrôlable, qu’il commence par changer son mot de passe.
Sources :
Comments are closed