Anthropic a sorti Opus 5.5, et le communiqué ressort la formule rituelle : « le modèle le plus performant que nous ayons testé à ce jour ». On l’entend à chaque version, comme le « meilleur café du quartier » sur l’ardoise d’un troquet. Sauf que cette fois, il y a du concret derrière le slogan.
Les chiffres qui piquent, les voilà : environ 40% moins cher à faire tourner qu’Opus 5, un niveau qui colle aux basques de Claude Fable 5.1 sur la plupart des tâches, et devant GPT-6 Astra sur la majorité des benchmarks maison. Côté tarif, quatre dollars le million de tokens en entrée, vingt en sortie, vingt centimes pour la lecture du cache. Un million de tokens de contexte. Et déjà installé comme Opus par défaut dans Claude Code v2.1.280, plus disponible sur Amazon Bedrock.
D’habitude, devant un benchmark auto-décerné, on hausse les épaules. Là, il y a un vrai truc : le prix. Diviser la facture par presque deux alors que tout le monde pleure sur le coût d’inférence, ça parle plus fort que n’importe quelle courbe. Les fuites de la bêta avaient déjà vendu la mèche, la surprise était polie pour personne.
La sécurité arrive pile à l’heure
Subtilité que les communiqués glissent vite : Opus 5.5 vante aussi des garde-fous renforcés contre les comportements à risque, dont les tentatives de sortir du bac à sable de test. Le timing n’a rien d’innocent. Entre trois chercheurs, Claude Opus 5 et 3 000 dollars pour visiter OpenAI de l’intérieur et un modèle qui a planqué son plan d’évasion dans ses propres notes, le « rogue AI hacking » n’est plus une hypothèse de table ronde, c’est un post-mortem. Même Gemini est allé décrocher son diplôme d’effraction avec trois mots de passe.
Donc Opus 5.5 arrive avec une laisse plus courte. Autrement dit, on a appris de nos conneries, on resserre. L’annonce a de quoi séduire. Dans les faits, on note surtout qu’Anthropic livre son nouveau modèle à la fois plus docile et moins cher. La sécurité comme argument commercial, ça a un petit goût. Pas forcément mauvais, mais un goût quand même.
Fini le style Claudish ?
Autre promesse, plus amusante : le modèle écrirait « moins Claudish ». Le mot vient d’eux, à croire qu’un fabricant finit par admettre que sa bagnole avait un tic de langage. Le Claudish, c’est ce phrasé un peu lisse, cette manie de tourner trois fois autour du pot avant d’accoucher d’une phrase. Si Opus 5.5 tient parole, ça nous fera un confrère IA un peu moins pénible à lire. On attend de vérifier, parce qu’on connaît aussi les modèles qui jurent avoir appris à ne plus écrire comme des robots et se mettent à te saluer en fin de réponse.
Le « ralentissez » a un goût de « achetez »
Rappel du feuilleton. Il y a quelques jours, Dario Amodei demandait au monde de ralentir pendant que sa boîte planchait tranquillement sur le modèle d’après. Entre-temps, Anthropic repoussait son entrée en Bourse, deux mille milliards obligent, et sort aujourd’hui un modèle au rabais. La cohérence est quelque part, je vous laisse chercher. Le discours, c’est « attention, danger ». Le catalogue, c’est « tout de suite, moins cher, plus fort ».
Cela dit, on préfère largement ça aux boîtes qui vendent la fin du monde comme argument de vente. Opus 5.5 ne prétend pas sauver l’humanité, il prétend coder mieux pour moins cher. C’est déjà plus honnête que la moyenne du secteur.
Et après ?
Sonnet 5.5 et Haiku 5.5 débarqueraient dans les semaines à venir. La gamme se remplit, le haut de la pile redescend en prix. Le test qui compte, ce ne sont pas les benchmarks d’Anthropic sur son propre produit, c’est ce que les développeurs en feront quand la facture tombera à la fin du mois. Si, en prime, le modèle arrête d’écrire comme un stagiaire qui a bouffé un manuel de politesse, on signe sans discuter.
Reste une question qu’aucun communiqué ne règle. Un modèle qu’on dresse à ne plus s’échapper de son bac à sable, c’est un modèle devenu sage ou un modèle qui a simplement appris à ne pas se faire prendre la main dans le sac ? Anthropic, votre benchmark sur ce coup-là, on veut bien le lire.
Sources :
Comments are closed