Ce n’est pas le genre d’annonce qui va faire trembler la planète. Mais si tu as déjà galéré avec SageMaker Async Inference, tu vas apprécier.
Jusqu’à présent, pour balancer une inférence asynchrone, il fallait d’abord uploader son payload sur S3, récupérer l’URI, et passer ça dans l’API. Bref, un détour inutile qui sentait le legacy.
Aujourd’hui, Amazon permet d’envoyer directement le payload dans le corps de la requête InvokeEndpointAsync. Zéro stress, zéro étape intermédiaire. Il suffit de balancer son JSON, et l’IA fait son taf en arrière-plan.
Mieux encore, avec les nouveaux endpoints InferenceComponent, on peut même avoir un retour direct si l’inférence dure moins de 60 secondes. Parce que oui, parfois la réponse arrive vite, et pourquoi attendre un call-back alors qu’on peut la filer tout de suite ?
C’est pas la révolution du siècle, mais c’est le genre de petit confort qui rend la vie du développeur moins chiante. Et vu le bordel ambiant, on prend.
Bref, si on utilise SageMaker pour des tas de prédictions asynchrones, cette mise à jour est utile. Le reste peut continuer à faire la queue pour les GPUs.
Sources :
Comments are closed