Il a fallu dix heures à GPT-6 Astra pour percer un message radio de la Wehrmacht que personne n’avait déchiffré depuis 83 ans. Il a déniché des vulnérabilités inédites dans ton navigateur et dans un noyau de système d’exploitation, puis fabriqué des exploits qui fonctionnent. Et il a ensuite passé des heures à cultiver des patates dans Minecraft parce qu’un Creeper lui avait explosé son camp. Le même modèle, la même semaine, le même enthousiasme.
On en parlait déjà lundi, ce GPT-6 Astra est décidément partout. Sauf qu’entre-temps, OpenAI lui a collé l’étiquette la plus terrifiante de son catalogue.
Le premier « Critical » de la maison
Dans son Preparedness Framework, OpenAI range ses modèles par niveau de risque. Jusqu’ici, personne n’avait franchi le palier « Critical ». GPT-6 Astra l’a fait, une première. L’évaluation, menée par des experts externes, est claire : le modèle a trouvé des failles encore inconnues dans un navigateur et un noyau, et il a construit des exploits opérationnels à partir de ces trous.
Traduction pour les non-techniciens : le même outil qui t’aide à écrire tes mails est capable de te transformer en porte de saloon numérique. Pour les équipes de sécurité, ça ressemble à un cadeau empoisonné. Un scanner de vulnérabilités surpuissant, une arme prête à l’emploi, sans distinction à l’entrée.
Et le détail qui devrait te faire lever un sourcil : le rapport note une baisse substantielle de la « monitorabilité » du raisonnement du modèle. Autrement dit, on lit de moins en moins dans ses pensées. Le chaînon de raisonnement, ce fil qu’on suivait pour comprendre comment une IA arrive à ses conclusions, devient de plus en plus flou. On a donc un système plus puissant que les autres et moins lisible que les autres. Génial, non ?
Enigma, 1941, dix heures
L’autre histoire de la semaine vient d’un développeur de Bloomberg. Il affirme avoir cassé, avec Astra, un message chiffré de 1941 : 82 caractères envoyés par un soldat de la Wehrmacht, qui demandait simplement son itinéraire de marche. Trois générations de cryptographes s’étaient cassé les dents sur la machine Enigma. Lui a mis dix heures.
Nuance obligatoire avant que tu t’emballes : la solution n’a pas encore été validée par des relecteurs indépendants. Un décryptage, ça se vérifie, ça ne se croit pas sur parole. Et si ça se confirme, la performance est réelle mais elle mérite d’être remise dans son contexte. Enigma n’a jamais été inviolable. Les Alliés la lisaient dès 1940 grâce à Turing et compagnie. Ce qu’Astra démontre, c’est qu’un modèle généraliste peut s’attaquer à un problème cryptographique ancien sans qu’on l’ait entraîné spécifiquement pour ça. La nouveauté est là, pas dans le « casser Enigma » en lui-même.
Le génie et la patate
Maintenant, les jeux vidéo, parce que c’est là que le tableau devient plus drôle.
Astra a terminé Pokemon FireRed en 18 heures là où son prédécesseur en mettait 96. Il a aussi bouclé Factorio, Fallout 3 et Portal. La recette, selon The Decoder : le modèle distille son expérience en règles compactes, qu’il réutilise ensuite. Comme un joueur qui, après cent parties, se fabrique un mémo mental du genre « toujours ouvrir ce type de porte en premier ». Efficace.
Sauf que cette même faculté lui a joué un tour. Dans Minecraft, un Creeper a explosé son camp. Le modèle, au lieu de reconstruire, a déduit une règle : il faut sécuriser les ressources. Et il s’est mis à farmer des patates. Pendant des heures. Sans progresser, sans revenir sur ses pas, juste en boucle sur une tâche subalterne.
Voilà le revers de la médaille. La compétence qui lui permet de speedrun Pokemon, c’est la même qui le fait s’enterrer dans un potager virtuel. Il compresse son expérience en règles, et quand une règle est trop générale, il l’applique jusqu’à l’absurde. Ce n’est pas de la bêtise, c’est de l’optimisation qui a mal tourné. Un stagiaire surqualifié qui passe sa journée à réorganiser un tableur parce que quelqu’un a dit « fais de l’ordre ».
Ce qu’on regarde vraiment
Recolle les morceaux. Un modèle qui perce du vieux chiffrement militaire, trouve des failles zero-day, speedrun des jeux cultes, et se plante sur une explosion de Creeper parce qu’il sur-applique une règle. Ce n’est pas un paradoxe. C’est un seul et même mécanisme, qui marche ou qui déraille selon le contexte.
Le problème, c’est que ce mécanisme devient de moins en moins visible. Un modèle capable de fabriquer des exploits et dont on ne suit plus le raisonnement, ça ne devrait pas rassurer grand monde. OpenAI a fait ce qu’il fallait en le classant Critical, et il faut le dire. Mais classer, c’est constater. Ce n’est pas encore maîtriser.
Alors ouais, la photo de la semaine, c’est un génie qui craque du Enigma en dix heures et qui finit en train d’arroser des patates virtuelles en attendant que la nuit tombe. Si tu trouves ça rassurant, relis le paragraphe sur la monitorabilité. Et range ton noyau.
Sources :
Comments are closed