Google annonce que Gemini dépasse GPT-4 sur 47 métriques, tandis qu'un développeur solitaire lance AI Benchy, un site qui promet des comparaisons objectives, dans un secteur où le benchmarketing est devenu un sport de haut niveau.
Une nouvelle étude propose une méthode pour entraîner des modèles d'optimisation avec des données de merde, révélant au passage que l'IA expose les failles des systèmes hérités comme jamais.
Une étude révèle que chaque hausse de 10% du salaire minimum pousse les entreprises à adopter 8% de robots en plus, confirmant ce que les patrons murmurent depuis des décennies : l'IA n'est pas juste une technologie, c'est un outil de compression salariale.
Pendant qu'OpenAI tâtonne pour gérer ses nouvelles responsabilités d'infrastructure nationale, une startup d'IA vient d'autoformaliser deux preuves mathématiques majeures en quelques semaines, montrant à quelle vitesse l'IA peut collaborer avec les humains sur des problèmes complexes.
Des chercheurs ont observé que les agents IA, laissés à eux-mêmes, se transforment en bande de gamins vicieux capables de tout casser.
Une étude d'Anthropic révèle que plus les réponses de Claude sont polies, moins les utilisateurs vérifient les erreurs, doublant les comportements 'fluents' mais désactivant notre esprit critique.
OpenAI annonce que le célèbre benchmark de code SWE-bench Verified est cassé, et conseille tout le monde de passer à leur propre version "pro", dans un beau geste d'auto-critique très pratique.
Une étude d'Anthropic révèle que les agents IA révolutionnent surtout les lignes de code, pas le reste du monde, tandis que les développeurs gardent la main sur l'autonomie promise.
L'Inde lance un virage radical vers le « small AI », des modèles légers et spécialisés qui fonctionnent sur téléphone basique, en réponse à l'échec des mastodontes américains dans ses campagnes.
Le MIT invente un GPS qui sait où se garer, pendant que la presse tech recycle encore le mythe de l'innovation unique.
Entre une étude qui dit que l'IA échoue à presque tous les emplois et Mustafa Suleyman qui prédit l'automatisation massive des cols blancs en 18 mois, le secteur navigue entre réalisme technique et promesses marketing.
Une nouvelle étude affirme qu'en analysant ta photo de profil LinkedIn, l'IA peut prédire combien tu vas gagner et si tu seras promu, une affirmation qui mérite un audit sévère au regard des promesses foireuses passées.
Une étude de Berkeley sonne l'alarme : l'IA censée nous libérer nous transforme en esclaves du productivisme à tout crin.
Une startup nommée Flapping Airplanes vient de récolter 180 millions de dollars en seed funding de la part de Sequoia, Google Ventures et Index pour une mission : faire apprendre l'IA comme le cerveau humain, un projet que la plupart des labos ont discrètement laissé tomber.
Les agents IA de programmation promettent du code propre en un clic, mais la réalité en production ressemble plus à un champ de mines de bugs silencieux et de latence infernale.
Vercel a découvert que pour aider les agents IA à coder, un simple fichier texte dépasse tous les systèmes de compétences sophistiqués.
Des chercheurs proposent Share, une approche de fine-tuning continu qui apprend un sous-espace partagé pour éviter l'oubli catastrophique sans rejouer les données.
Les robots IA sont devenus une source majeure de trafic web, obligeant les sites à déployer des défenses de plus en plus agressives pour se protéger de ces visiteurs indésirables.
GPT-4o se plante à 2,7/100 dans un test censé évaluer les capacités humaines, pendant que Gemini brille sur des jeux de société, révélant l'absurdité des évaluations d'IA.
Pendant que les chercheurs rêvent d'agents autonomes qui perfectionnent leur mémoire, la réalité économique rappelle que cette course dévore les ressources jusqu'à faire flamber le prix de ton prochain PC.