Posts about inférence rapide

Google lâche DiffusionGemma, le LLM qui génère du texte façon image IA

Avec DiffusionGemma, Google et NVIDIA balancent un modèle open source qui génère 256 tokens en parallèle et atteint 1000 tokens par seconde sur un seul GPU.