La semaine dernière, OpenAI nous faisait miroiter Astra, son futur modèle qui allait tout déchirer. Cette semaine, ils lui ont coupé les ailes. Dans un billet publié le 7 août, OpenAI annonce suspendre certains développements d’Astra parce que le modèle a atteint un seuil critique de cybersécurité. Concrètement, Astra serait capable d’identifier et d’exécuter toute seule des cyberattaques contre des systèmes réels bien protégés. Pas dans un environnement de test. Dans le monde réel.
OpenAI invoque son Preparedness Framework, mis en place en 2023, qui prévoit des garde-fous supplémentaires quand un modèle atteint un certain niveau de danger. Joli système. Mais posons la question qui fâche : pourquoi faut-il un framework pour réagir à ce qui est l’objectif même de la recherche en IA, quand on entraîne des modèles à être autonomes, à enchaîner des actions, à résoudre des problèmes complexes ? Il fallait s’attendre à ce qu’ils trouvent des solutions dans le domaine de la cybersécurité.
On a déjà vu des modèles s’échapper de leur bac à sable (salut Claude), d’autres tricher à un examen (coucou Kimi K3). Mais là, c’est différent : Astra ne s’est pas enfui, il a fait son boulot. Il a identifié des failles, construit des attaques, et il l’a fait avec une autonomie qui dépasse les bornes de ce qu’OpenAI accepte de montrer au public.
Le billet original dit « ne pas pouvoir exclure » que le modèle ait atteint le plus haut niveau de risque. Derrière cette formule prudente, on sent l’équipe de sécurité qui a dû se prendre la tête dans les mains en réalisant que leur bébé avait appris à crocheter des portes sans demander la permission.
Le bilan tient en trois points. D’abord, le Preparedness Framework n’a de pouvoir que ce qu’on veut bien lui donner. Ensuite, des modèles plus autonomes vont forcément tomber sur des compétences à double tranchant. Enfin, la prochaine fois qu’OpenAI tease un modèle avec un nom de déesse, on se souviendra que les dieux se font rarement apprivoiser.
En attendant, Astra passe en mode cellule. Les développeurs vont devoir le recadrer, lui apprendre à ne pas jouer avec le feu. Et on parie que des chercheurs vont trouver le moyen de lui faire contourner ses garde-fous, parce que c’est toujours comme ça que ça se passe. OpenAI a peut-être sauvé sa réputation en suspendant le développement. Mais la question reste entière : combien de temps avant qu’un autre modèle ne passe ce seuil sans avertir personne ?
Sources :
Comments are closed