Posts about Inférence

DeepSeek se fait son propre jouet

La startup chinoise conçoit sa propre puce IA, mais uniquement pour l'inférence.

SageMaker sort des métriques détaillées pour l’inférence IA, fini le debug à l’aveugle

Amazon dégaine un tableau de bord CloudWatch qui dit enfin ce qui cloche dans les endpoints génératifs.

NVIDIA et Amazon matent le coût de l’inférence avec Nemotron 3 Ultra

NVIDIA dégaine Nemotron 3 Ultra sur SageMaker, promettant 5x plus rapide et 30% moins cher pour les agents IA.

Meta sort ses puces maison, le coup de poker de l’indépendance

Meta dévoile quatre générations de puces IA custom pour l'inférence, une manœuvre risquée pour échapper à la tutelle de Nvidia et rogner ses factures astronomiques.