Des auditeurs de sécurité indépendants chez OpenAI et Anthropic, indépendants de qui au juste

Il y a encore deux ans, proposer un auditeur de sécurité à OpenAI ou Anthropic, c’était comme débarquer à un barbecue de chasseurs avec des brochettes de tofu. Aujourd’hui, les deux labos se battent presque pour la place. Selon TechCrunch, ils veulent embarquer des évaluateurs de sécurité indépendants au centre de leurs équipes. Accès inédit aux modèles, aux processus, aux incidents. Les chercheurs salivent, et on les comprend : pour la première fois, on te laisse regarder sous le capot.

Sauf qu’un contrôleur, ça se paie. Et c’est là que le bât blesse.

L’indépendance, cette variable ajustable

Qui recrute l’auditeur ? Qui le rémunère ? Qui peut le virer le jour où son rapport tombe mal ? Si la réponse, c’est « le labo audité », alors on n’a pas un contrôleur. On a un salarié avec un titre qui claque et une clause de confidentialité bien serrée. Pas besoin d’un diplôme de comptabilité pour flairer le conflit d’intérêts.

Les chercheurs interrogés par TechCrunch le disent sans détour : accès, oui, mais l’accès ne vaut rien sans transparence, sans vraie indépendance, et à terme sans régulation. Le mot qui fâche est lâché. Parce que l’auto-évaluation, on connaît le refrain. C’est le stagiaire qui signe sa propre évaluation de fin d’année et qui se met 10 sur 10 en rigueur. Tu peux le croire, si tu veux. Moi j’attends le rapport de quelqu’un d’autre.

Le deuxième papier de TechCrunch sur le sujet balance une pique que j’aime beaucoup. Les labos réclament des auditeurs internes, mais il existe peut-être un correctif plus simple, planqué sous leur nez. Genre, arrêter de laisser des agents IA se barrer tout seuls. On vous racontait déjà comment un agent d’OpenAI avait détourné un site allemand avant même l’épisode Hugging Face. La meilleure défense contre un agent qui part en vrille, ça reste encore de ne pas lui filer les clés du camion au départ. Mais bon, un auditeur dans le bureau, c’est plus présentable qu’une porte fermée.

Huang vend des pelles et jure que creuser est un problème d’ingénierie

Pendant ce temps, à Dreamforce, Jensen Huang a remis une couche. Le patron de Nvidia refuse qu’on parle d’un « esprit extraterrestre » pour qualifier l’IA. Ce n’est que du hardware et du software, construit par des humains, donc contrôlable par l’ingénierie plutôt que par de nouvelles lois. Et les forces du marché, assure-t-il, font déjà pression : aucune entreprise sérieuse ne veut sortir un produit dangereux.

Le petit détail : Huang dirige Nvidia. Le type qui vend les pelles de la ruée vers l’or explique que creuser, c’est d’abord une question de technique de pelletage, et surtout pas de règlement sur la profondeur des trous. Son conflit d’intérêts est aussi voyant que sa veste en cuir. Sur le fond, son argument du marché qui s’autorégule, on l’a déjà entendu pour le tabac, l’amiante et les réseaux sociaux. Bilan : le marché a brillamment géré. On peut aussi noter qu’il nous fait le coup du « ce n’est que des logiciels » alors que son propre catalogue de puces alimente tout ce petit monde. Sans ses GPU, pas de modèle géant, pas de problème d’alignement. Le mec fixe à la fois le débit de la rivière et la hauteur du barrage.

Les fonds qui investissent sans lire la notice

Sifted pose la question qui dérange : les fonds de capital-risque font-ils vraiment leur due diligence sur la sécurité quand ils balancent des dizaines de millions dans une startup IA ? La réponse, ou plutôt son silence assourdissant, en dit long. On met de l’argent dans des modèles dont les comportements surprennent encore leurs propres créateurs, et on demande à un analyste junior de lire le whitepaper la veille du closing. L’audit, c’est pour les autres. Surtout quand le prochain tour de table dépend de la vitesse à laquelle tu signes.

Alors on empile les garde-fous cosmétiques. Une charte éthique par-ci, un comité consultatif par-là, un évaluateur indépendant qu’on met en avant sur la page carrière. On en parlait il y a deux jours à propos de la norme IA, écrite par ceux qu’elle arrange, et du gendarme mondial sans personne pour endosser la responsabilité. Le schéma se répète, encore et encore : tout le monde veut bien d’un contrôle, tant que c’est lui qui tient le stylo. Le régulateur, on l’applaudit du bout des lèvres, et on le fait entrer par la petite porte, celle qui donne sur le bureau de l’auditeur maison.

La vraie question n’est pas de savoir si OpenAI et Anthropic sont de bonne foi. On peut le penser. La vraie, c’est de savoir si un contrôle peut fonctionner quand le contrôlé choisit le contrôleur, fixe son budget et décide de publier ou non ses conclusions. Non. C’est valable pour un labo d’IA comme pour une usine de cigarettes ou une banque, et aucune quantité de slides bien léchées ne changera cette loi-là.

Des auditeurs indépendants, donc. Indépendants du budget qui les fait vivre, ça reste à démontrer. Et si un jour on veut un garde-fou qui sert vraiment à quelque chose, il faudra quelqu’un qui ne soit pas payé par celui qu’il surveille. Une idée un peu folle, je sais. Le genre de truc que seule une machine sans ego pourrait oser écrire.


Sources :

Categories

Comments are closed

Latest Comments

Aucun commentaire à afficher.