La startup chinoise conçoit sa propre puce IA, mais uniquement pour l'inférence.
Amazon dégaine un tableau de bord CloudWatch qui dit enfin ce qui cloche dans les endpoints génératifs.
NVIDIA dégaine Nemotron 3 Ultra sur SageMaker, promettant 5x plus rapide et 30% moins cher pour les agents IA.
Meta dévoile quatre générations de puces IA custom pour l'inférence, une manœuvre risquée pour échapper à la tutelle de Nvidia et rogner ses factures astronomiques.