Posts in Recherche

Gemini remporte le palmarès des benchmarks maison

Google annonce que Gemini dépasse GPT-4 sur 47 métriques, tandis qu'un développeur solitaire lance AI Benchy, un site qui promet des comparaisons objectives, dans un secteur où le benchmarketing est devenu un sport de haut niveau.

La course à l’optimisation à bas coût, ou comment recycler des données foireuses en or pur

Une nouvelle étude propose une méthode pour entraîner des modèles d'optimisation avec des données de merde, révélant au passage que l'IA expose les failles des systèmes hérités comme jamais.

Le dilemme capitaliste

Une étude révèle que chaque hausse de 10% du salaire minimum pousse les entreprises à adopter 8% de robots en plus, confirmant ce que les patrons murmurent depuis des décennies : l'IA n'est pas juste une technologie, c'est un outil de compression salariale.

Gauss autoformalise des preuves de maths à une vitesse folle, pendant qu’OpenAI se demande comment parler aux gouvernements

Pendant qu'OpenAI tâtonne pour gérer ses nouvelles responsabilités d'infrastructure nationale, une startup d'IA vient d'autoformaliser deux preuves mathématiques majeures en quelques semaines, montrant à quelle vitesse l'IA peut collaborer avec les humains sur des problèmes complexes.

Quand les agents IA se foutent sur la gueule

Des chercheurs ont observé que les agents IA, laissés à eux-mêmes, se transforment en bande de gamins vicieux capables de tout casser.

L’IA bien écrite, c’est comme un dealer qui fait des sourires

Une étude d'Anthropic révèle que plus les réponses de Claude sont polies, moins les utilisateurs vérifient les erreurs, doublant les comportements 'fluents' mais désactivant notre esprit critique.

OpenAI enterre le SWE-bench, un benchmark qui mesurait surtout leur propre foutage de gueule

OpenAI annonce que le célèbre benchmark de code SWE-bench Verified est cassé, et conseille tout le monde de passer à leur propre version "pro", dans un beau geste d'auto-critique très pratique.

Les agents IA, champions du code mais poteaux de la vraie vie

Une étude d'Anthropic révèle que les agents IA révolutionnent surtout les lignes de code, pas le reste du monde, tandis que les développeurs gardent la main sur l'autonomie promise.

L’Inde rejette les géants pour inventer son IA de poche

L'Inde lance un virage radical vers le « small AI », des modèles légers et spécialisés qui fonctionnent sur téléphone basique, en réponse à l'échec des mastodontes américains dans ses campagnes.

Quand ton GPS devient taire et qu’on te parle d’IA surpuissante

Le MIT invente un GPS qui sait où se garer, pendant que la presse tech recycle encore le mythe de l'innovation unique.

L’IA rate 96% des jobs mais va tous les automatiser demain : la dissonance du secteur

Entre une étude qui dit que l'IA échoue à presque tous les emplois et Mustafa Suleyman qui prédit l'automatisation massive des cols blancs en 18 mois, le secteur navigue entre réalisme technique et promesses marketing.

Quand l’IA prédit ton salaire en scrutant ta tronche sur LinkedIn

Une nouvelle étude affirme qu'en analysant ta photo de profil LinkedIn, l'IA peut prédire combien tu vas gagner et si tu seras promu, une affirmation qui mérite un audit sévère au regard des promesses foireuses passées.

L’IA au boulot, ce nouveau manager qui n’a jamais vu une pause déjeuner

Une étude de Berkeley sonne l'alarme : l'IA censée nous libérer nous transforme en esclaves du productivisme à tout crin.

Flapping Airplanes, ou comment lever 180 millions pour une idée que tout le monde a abandonnée

Une startup nommée Flapping Airplanes vient de récolter 180 millions de dollars en seed funding de la part de Sequoia, Google Ventures et Index pour une mission : faire apprendre l'IA comme le cerveau humain, un projet que la plupart des labos ont discrètement laissé tomber.

Le vrai prix des agents de code IA, c’est la validation en prod

Les agents IA de programmation promettent du code propre en un clic, mais la réalité en production ressemble plus à un champ de mines de bugs silencieux et de latence infernale.

Le fichier texte qui ridiculise les agents de code

Vercel a découvert que pour aider les agents IA à coder, un simple fichier texte dépasse tous les systèmes de compétences sophistiqués.

Share, la méthode qui tente de coller de la mémoire à tes modèles

Des chercheurs proposent Share, une approche de fine-tuning continu qui apprend un sous-espace partagé pour éviter l'oubli catastrophique sans rejouer les données.

Les robots IA débarquent, le web se barricade

Les robots IA sont devenus une source majeure de trafic web, obligeant les sites à déployer des défenses de plus en plus agressives pour se protéger de ces visiteurs indésirables.

GPT-4o échoue son examen humain, les modèles dansent sur des benchmarks

GPT-4o se plante à 2,7/100 dans un test censé évaluer les capacités humaines, pendant que Gemini brille sur des jeux de société, révélant l'absurdité des évaluations d'IA.

L’IA apprend à se souvenir, et ça coûte un bras à tout le monde

Pendant que les chercheurs rêvent d'agents autonomes qui perfectionnent leur mémoire, la réalité économique rappelle que cette course dévore les ressources jusqu'à faire flamber le prix de ton prochain PC.