On déploie un LLM sur SageMaker, on croise les doigts, on prie pour que le throughput tienne la route. Et puis ça rame. Ou pire : ça coûte un bras sans qu’on sache pourquoi. Jusqu’ici, le monitoring de l’inférence, c’était un peu du bricolage entre métriques basiques et logs noyés.
Amazon vient de lâcher un truc qui pourrait changer la donne : des métriques détaillées et un tableau de bord Insights directement dans CloudWatch pour les endpoints SageMaker. Pas de promesse à la con, du concret.
Le communiqué parle de deux architectures : les Single-model endpoints (SME) et les Inference component (IC) endpoints. Derrière ces acrony mes barbares, une réalité : enfin des métriques qui permettent de debugger un modèle génératif sans passer par trois couches d’abstraction.
On peut monitorer la latence par composant, le nombre de tokens générés, la mémoire consommée par les blocs d’attention, le taux d’échec des appels… Bref, de la data qui sert à quelque chose. Fini le « le modèle répond lentement » sans savoir si c’est le GPU qui souffre ou le réseau qui triche.
Le tableau de bord Insights offre une vue consolidée qui dit en un coup d’œil si son endpoint est en train de brûler du cash pour rien. Utile quand on fait tourner un LLM à 50 dollars de l’heure et qu’on se demande pourquoi le client râle.
Évidemment, c’est pas la baguette magique. Toujours besoin de savoir lire une métrique. Toujours besoin de configurer correctement ses endpoints. Mais au moins, AWS arrête de laisser l’utilisateur dans le noir complet. Pour une fois, un lancement qui sent le vécu, pas le bullshit marketing.
Alors oui, c’est du monitoring, pas de l’optimisation automatique. Mais pour éviter une facture SageMaker qui fait pleurer, il vaut mieux mater ces dashboards.
Sources :
Comments are closed