Claude écrit 80% du code d’Anthropic et a failli faire fondre le pipeline

Anthropic a décidé de jouer cartes sur table. Enfin, une partie du jeu. La boîte vient de publier un joli tableau de bord (rapporté par l’Economic Times) : Claude assure 26% de sa recherche et développement de modèles, et 90% de ses activités de recherche impliquent une collaboration avec l’IA maison. Présenté comme un geste de transparence sur l’auto-amélioration, avec un appel aux autres labos pour qu’ils publient les mêmes métriques. À première vue, c’est de la belle ouvrage.

Dans les tuyaux, c’est un peu moins propre. Les chiffres qui circulent en interne (repris par AIBase) racontent une toute autre journée au bureau. Claude écrit 80% du code d’Anthropic. Pas 8%, pas 26%. Quatre-vingts. La production trimestrielle des ingénieurs a été multipliée par 8 par rapport à la moyenne 2021-2025, et l’IA se tape aussi une bonne partie de la revue et de la fusion de code.

Alors pourquoi je tique ? Parce que le même document explique que la bête préfère les pull requests ultra-granulaires, qu’elle pousse du code 24 heures sur 24, et que le nombre de cas de test a explosé d’un facteur 10. Bilan : la charge de la CI (l’intégration continue, ce machin qui vérifie que tout tient debout à chaque commit) a grimpé d’un facteur 25 en six mois. Le système a failli se casser la gueule.

Traduction pour les non-initiés. L’IA n’est pas juste plus rapide que toi. Elle bosse en permanence, découpe son taf en mille micro-morceaux, et noie la plomberie censée l’empêcher de livrer de la merde. Multiplier la production par 8, c’est facile quand on ne compte pas le coût de nettoyage. Visiblement, personne n’avait prévu que la machine à valider le code allait hériter du même facteur, et même d’un facteur 25.

C’est le vieux gag de l’usine. On automatise le poste d’assemblage, on célèbre les cadences, et on oublie que le contrôle qualité et l’expédition tournent toujours à la main. Sauf qu’ici, l’expédition, c’est une infra qui a failli rendre l’âme et des humains qui doivent relire des PRs générées à la chaîne pendant qu’ils dorment.

Le vrai sujet, c’est le mot « auto-amélioration » dans la com’. Anthropic ne dit pas « Claude fait la moitié de nos devs ». Elle dit « Claude aide à construire la prochaine version de lui-même ». C’est plus vendeur. Ça fait peur, ça fait rêver, ça fait lever des fonds. Les 26% et les 90%, ce sont les chiffres du pitch. Les 80% et le pipeline qui a failli sauter, ce sont ceux qui sortent quand on fouille.

Ça rejoint ce qu’on te racontait déjà sur les agents IA qui débarquent en prod et sur le prompt engineering qu’on automatise la main dans le sac. Le pattern est toujours le même : on te vend la vitesse, on tait la dette. Ici, la dette s’appelle un pipeline d’intégration au bord de la syncope.

Je dis pas que c’est du pipeau. C’est réel, et c’est même assez flippant. Une IA qui écrit le code de la prochaine IA, on n’est plus dans le fantasme de science-fiction, on est dans le rapport trimestriel. Mais qu’on ne me serve pas ça comme de la transparence totale alors que l’info qui compte pour juger de la santé du bordel, à savoir le coût réel de tout ce code en rab, arrive par la petite porte.

Reste une question que personne chez Anthropic n’a l’air pressé de traiter. Si Claude écrit 80% du code et que 90% de la recherche passe par lui, qui vérifie le travail du vérificateur ? Les mêmes humains qui déposaient 8 fois moins de PRs il y a cinq ans ? À un moment, l’auto-amélioration, c’est peut-être juste un mot chic pour dire qu’on a arrêté de relire.

Voilà le genre de détail qui mériterait la une du communiqué sur la transparence. Pas la dernière ligne, dans la colonne des trucs qui ont failli casser.


Sources :

Categories

Comments are closed

Latest Comments

Aucun commentaire à afficher.