Les différentes mesures du temps
Le temps recouvre ici plusieurs réalités : le premier déploiement, la latence des réponses, la reprise après une période d’inactivité et la maintenance continue. Mesurez-les séparément.
ou
Option 1
Votre équipe doit avant tout rendre un modèle existant accessible via un endpoint d’inférence.
Testez d’abord Baseten.
Un processus centré sur le service de modèles peut réduire la quantité de code applicatif que votre équipe doit gérer. Chronométrez l’ensemble du parcours, de la préparation du modèle jusqu’à une requête validée, en incluant la correction des dépendances et les révisions du déploiement ; le premier déploiement à lui seul ne suffit pas à mesurer le temps nécessaire.
ou
Option 2
Votre charge de travail combine l’inférence avec des fonctions Python personnalisées ou des tâches exécutées sur GPU.
Testez d’abord Modal.
Une approche centrée sur Python peut faciliter le regroupement du traitement et de l’exécution. Tenez compte de la création de l’environnement, du chargement du modèle et du temps nécessaire pour que la fonction puisse traiter des requêtes répétées en production de manière fiable.
ou
Option 3
Les requêtes arrivent par rafales ou un objectif de temps de réponse strict est important.
Testez les deux plateformes avec une trace de trafic enregistrée.
Distinguez la latence des requêtes à chaud des délais après une période d’inactivité et du comportement en cas de requêtes simultanées. Relevez la mise en file d’attente, les échecs et la reprise, ainsi que le temps de réponse médian : une requête isolée rapide ne démontre pas les performances en production.