| Zentrale Kostenfrage |
Was kostet es, die erforderliche Kapazität für die Modellbereitstellung bei der angestrebten Latenz verfügbar zu halten?
|
Welche Ressourcen verbrauchen alle GPU-Funktionen, Dienste und Hintergrundaufgaben zusammen unter realer Last?
|
| Leerlaufzeiten |
Prüfen Sie, ob die gewählte Bereitstellungskonfiguration zwischen Anfragen Kapazität vorhält und wie sich das auf die Kosten auswirkt.
|
Prüfen Sie, wie die gewählte Funktions- oder Dienstkonfiguration mit Leerlaufzeiten und nachfolgenden Anfragen umgeht.
|
| Lastspitzen |
Messen Sie, ob die Bereitstellungskonfiguration Spitzenlasten ohne übermäßig vorgehaltene Kapazität bewältigt.
|
Messen Sie, wie sich Entscheidungen zu parallelen Funktionsaufrufen und zur Kapazität auf Lastspitzen, Warteschlangen und Ressourcennutzung auswirken.
|
| Modellvorbereitung |
Berücksichtigen Sie die Paketierung, die Validierung von Abhängigkeiten und die Änderungen, die erforderlich sind, um ein Modell bereitstellbar zu machen.
|
Berücksichtigen Sie Funktionscode, Umgebungseinrichtung, die Validierung von Abhängigkeiten und alle Arbeiten zum Laden des Modells.
|
| Unterstützende Aufgaben |
Erfassen Sie Datenvorbereitung, Evaluierung und andere Arbeiten außerhalb des Inferenz-Endpunkts separat.
|
Berücksichtigen Sie unterstützende GPU- und CPU-Aufgaben, wenn sie auf derselben Plattform ausgeführt werden.
|
| Betriebsaufwand |
Erfassen Sie den Zeitaufwand für Aktualisierungen der Bereitstellung, Überwachung, Fehlerbehebung und die Betreuung des Endpunkts.
|
Erfassen Sie den Zeitaufwand für die Pflege von Funktionen, Diensten, Abhängigkeiten und dem Verhalten auf Anwendungsebene.
|
| Einheit für einen fairen Vergleich |
Gesamtausgaben und Personalaufwand pro abgeschlossener, gültiger Inferenz beim geforderten Servicelevel.
|
Gesamtausgaben und Personalaufwand pro abgeschlossener, gültiger Inferenz beim gleichen Servicelevel.
|