baseten

Inferenz-Tutorial

Ein Leitfaden für Entwickler zur Verwendung von baseten-Inferenz

Wenn Sie lernen möchten, wie Sie baseten-Inferenz verwenden, beginnen Sie mit einem Modell, auf das Sie zugreifen können, und einer kleinen Testeingabe. Dieser Leitfaden begleitet Sie von der Vorbereitung der Anfrage bis zur Prüfung der Antwort, ohne ein bestimmtes Eingabeformat für das Modell vorauszusetzen.

Abstrakte Darstellung eines Modellinferenz-Workflows

Nummerierte Schritte

Folgen Sie dieser Abfolge mit einem Modell und einer repräsentativen Eingabe, bevor Sie die Inferenz in eine größere Anwendung einbinden.

  1. 1

    Modell auswählen

    Bestimmen Sie das Modell, das Sie aufrufen möchten, und lesen Sie die aktuellen Anweisungen zu seinen Ein- und Ausgaben. Text-, Bild- und Embedding-Modelle können unterschiedliche Anfragefelder erwarten.

  2. 2

    Kleinen Test senden

    Verwenden Sie die für dieses Modell angegebene Zugriffsmethode, übermitteln Sie minimale gültige Nutzdaten und halten Sie Zugangsdaten aus Quelldateien und für Browser zugänglichem Code heraus.

  3. 3

    Ergebnis prüfen

    Prüfen Sie, ob die Anfrage erfolgreich war, und sehen Sie sich anschließend die zurückgegebenen Daten an, bevor Sie Code schreiben, der eine bestimmte Antwortstruktur voraussetzt.

Nummerierte Schritte

Prüfen Sie diese Anforderungen vor Ihrer ersten Baseten-Inferenzanfrage; die modellspezifische Dokumentation hat Vorrang vor einem allgemeinen Beispiel.

Erforderlich Optional
  • Ermitteln Sie ein zugängliches Modell und seine aktuellen Anweisungen für die Inferenz. — Notieren Sie die Modellkennung oder den Endpunkt genau so, wie für das ausgewählte Modell angegeben.

  • Bereiten Sie die vom aufgerufenen Dienst verlangte Authentifizierungsmethode vor. — Speichern Sie Zugangsdaten außerhalb von eingechecktem Code und clientseitigen Anwendungen.

  • Erstellen Sie eine Eingabe, die dem dokumentierten Schema des Modells entspricht. — Verwenden Sie ein kleines, repräsentatives Beispiel statt eines vollständigen Batches.

  • Wählen Sie ein Tool, das eine Anfrage senden und die vollständige Antwort anzeigen kann. — Ein API-Client oder ein kurzes serverseitiges Skript kann Ihnen helfen, den Status und die zurückgegebenen Felder zu prüfen.

  • Bereiten Sie eine zweite Eingabe für den Vergleich vor, sobald die erste Anfrage funktioniert.optional — Ein kontrastierendes Beispiel kann Annahmen in Ihrem Code zur Verarbeitung der Antwort aufdecken.

nummerierte Schritte

Die erste erfolgreiche Anfrage sollte belegen, dass Modell, Eingabe und Antwortverarbeitung zusammenpassen – nicht nur, dass eine Verbindung besteht.

1

Prüfen Sie die Anforderungen an die Anfrage

Öffnen Sie die Anweisungen für das von Ihnen ausgewählte Modell. Achten Sie darauf, wo die Eingabe hingehört, welche Felder erforderlich sind und welche Art von Ausgabe erwartet wird. Übernehmen Sie nicht einfach die Nutzdaten eines anderen Modells, nur weil es ebenfalls auf Baseten läuft: Derselbe Übertragungsweg bedeutet nicht, dass die Modelle dieselben Eingaben erwarten. Halten Sie das getestete Modell und die getesteten Nutzdaten kurz lokal fest, damit spätere Änderungen leichter nachzuvollziehen sind.

2

Führen Sie einen kontrollierten Aufruf durch

Senden Sie eine minimale, gültige Eingabe über die für dieses Modell unterstützte Schnittstelle. Halten Sie den ersten Inferenztest mit Baseten bewusst klein: eine kurze Textprobe für eine Textaufgabe oder eine passend vorbereitete Datei für ein Modell, das andere Medien akzeptiert. Erfassen Sie den Anfragestatus und etwaige Fehlermeldungen, ohne Geheimnisse zu protokollieren. Falls der Aufruf fehlschlägt, ändern Sie jeweils nur eine Variable, statt die gesamte Integration neu zu schreiben.

3

Prüfen Sie die Ausgabe, bevor Sie sie verwenden

Untersuchen Sie die gesamte zurückgegebene Struktur, nicht nur das Feld, das Sie erwartet haben. Prüfen Sie, ob die Ausgabe zu Ihrer Eingabe passt und ob Ihre Anwendung leere oder unerwartete Ergebnisse sicher verarbeiten kann. Erst danach sollten Sie die Antwort Ihren eigenen Typen oder Ihrer Benutzeroberfläche zuordnen. Wiederholen Sie den Test mit einer zweiten Eingabe, um fest codierte Annahmen aufzudecken.

Häufige Fehler und Lösungen

Ein allgemeiner Leitfaden kann nicht jedes Modell diagnostizieren, aber diese Prüfungen helfen, die häufigsten Ursachen für Inferenzfehler einzugrenzen.

1

Der Zugriff wird verweigert

Eine Anfrage kann nicht erfolgreich sein, wenn die Zugangsdaten, die Modellreferenz oder die Zugriffsberechtigungen falsch sind. Gehen Sie nicht davon aus, dass ein Fehler bedeutet, das Modell selbst sei nicht verfügbar.

Was Sie stattdessen tun sollten

Gleichen Sie die konfigurierte Zugriffsmethode und Modellreferenz mit den aktuellen Anweisungen ab. Ersetzen Sie ein offengelegtes Geheimnis, statt es erneut zu verwenden.

2

Die Eingabe ist ungültig

Baseten kann ein Modell nicht dazu bringen, Felder oder Medien zu interpretieren, die nicht dem dokumentierten Schema dieses Modells entsprechen. Auch eine gültige Netzwerkanfrage kann eine unbrauchbare Nutzlast enthalten.

Was Sie stattdessen tun sollten

Reduzieren Sie die Nutzlast auf ein dokumentiertes Beispiel, prüfen Sie Feldnamen und Datentypen und fügen Sie dann Ihre eigene Eingabe Stück für Stück wieder hinzu.

3

Die Antwort weicht von Ihrer Annahme ab

Verschiedene Modelle können unterschiedliche Strukturen zurückgeben, und ein erfolgreicher Aufruf garantiert nicht, dass das von Ihrem Code erwartete Feld vorhanden ist.

Was Sie stattdessen tun sollten

Untersuchen Sie die vollständige Antwort, prüfen Sie erforderliche Felder, bevor Sie sie auslesen, und behandeln Sie fehlende oder unerwartete Werte ausdrücklich.

4

Ein langsamer oder fehlgeschlagener Aufruf ist schwer zu erklären

Dieses Tutorial kann weder eine Latenzgarantie geben noch allein auf Clientseite die Ursache jedes Timeouts ermitteln.

Was Sie stattdessen tun sollten

Erfassen Sie die Dauer von Anfragen und nicht sensible Fehlerdetails, testen Sie eine kleinere Eingabe und ziehen Sie die aktuellen Betriebshinweise des Modells zu Rate.

Tipps für Fortgeschrittene

Sobald ein einzelner Inferenzaufruf an Baseten funktioniert, übertragen Sie dieselbe verifizierte Schnittstelle auf die Umgebung, in der Sie sie verwenden werden.

Anwendungsentwickler

Schaffen Sie eine stabile Schnittstelle für Modellaufrufe

Bündeln Sie die modellspezifische Erstellung von Anfragen in einem serverseitigen Modul. Validieren Sie eingehende Anwendungsdaten, bevor Sie sie in die Nutzdaten für das Modell umwandeln, und geben Sie bei einem Inferenzfehler einen vorhersehbaren Fehler auf Anwendungsebene zurück. So können Sie ein Modell oder die Zuordnung seiner Anfragedaten ändern, ohne Annahmen über die gesamte Codebasis zu verteilen.

  • Bewahren Sie Zugangsdaten in einer geschützten serverseitigen Konfiguration auf.
  • Validieren Sie sowohl ausgehende Eingaben als auch eingehende Ausgaben.
  • Testen Sie neben erfolgreichen Antworten auch die Fehlerbehandlung.

Modellevaluatoren

Vergleichen Sie Ausgaben anhand einheitlicher Eingaben

Erstellen Sie eine kleine Sammlung repräsentativer Testfälle, darunter auch eine schwierige oder grenzwertige Eingabe. Halten Sie fest, welches Modell und welche Anfragekonfiguration das jeweilige Ergebnis erzeugt haben. Bewerten Sie das Inferenzverhalten von Baseten anhand Ihrer Aufgabenkriterien, statt einen erfolgreichen Antwortstatus als Qualitätsmaß zu betrachten.

  • Verwenden Sie wiederholbare Testfälle.
  • Trennen Sie die Bewertungskriterien von Prüfungen der Datenübertragung.
  • Prüfen Sie unerwartete Ausgaben, bevor Sie Entscheidungen automatisieren.

Betriebsteams

Machen Sie Fehler nachvollziehbar, ohne Daten offenzulegen

Legen Sie fest, welche nicht sensiblen Anfragedetails für die Fehlersuche nützlich sind, und vermeiden Sie es, Zugangsdaten oder private Eingaben in regulären Protokollen zu speichern. Erfassen Sie Fehlerkategorien und Antwortzeiten im Kontext Ihrer eigenen Anwendung. Prüfen Sie die Integration erneut, wenn Sie das Modell, die Nutzdaten oder die anwendungsseitigen Timeout-Einstellungen ändern.

  • Unterscheiden Sie Zugriffsfehler von Fehlern durch ungültige Eingaben.
  • Protokollieren Sie keine Geheimnisse oder sensiblen Nutzdaten.
  • Nach Konfigurationsänderungen erneut testen.

Tipps für Fortgeschrittene

Gehe nach dem Prinzip der verifizierten Anfrage vor: Wähle ein Modell, befolge seine aktuellen Anweisungen, teste eine kleine Eingabe und prüfe das Ergebnis, bevor du es in eine Anwendung integrierst. Das Ziel kann eigene Zugriffsanforderungen und modellspezifische Hinweise haben.

Mach den nächsten Schritt mit Modellinferenz

  • Beginne mit einer modellspezifischen Anfragespezifikation.
  • Teste die Verarbeitung der Ausgabe, bevor du skalierst.
  • Schütze Zugangsdaten und sensible Eingaben.
Modellinferenz entdecken

FAQ zum Tutorial

Wähle ein Modell, auf das du Zugriff hast, und lies seine aktuellen Inferenzanweisungen. Bereite eine minimale Eingabe vor, die seinem Schema entspricht, sende eine Anfrage über die unterstützte Schnittstelle und prüfe die vollständige Antwort, bevor du Anwendungslogik anbindest.

Prüfe die Modellreferenz, die erforderliche Zugriffsmethode und das dokumentierte Eingabeformat. Halte Zugangsdaten aus clientseitigem Code heraus und verwende ein Anfragetool, mit dem du sowohl Fehler als auch erfolgreiche Ausgaben prüfen kannst.

Unterscheide zunächst zwischen einem Zugriffsproblem, einer ungültigen Nutzlast und einem Problem bei der Verarbeitung der Antwort. Vergleiche die Modellreferenz und die Eingabefelder mit den aktuellen Anweisungen und versuche es dann erneut mit der kleinsten dokumentierten Eingabe, die du verwenden kannst.

Prüfe zuerst die Antwort auf eine erfolgreiche Testanfrage und ermittle, welche Felder deine Anwendung tatsächlich benötigt. Validiere diese Felder, bevor du sie verwendest, behandle fehlende oder unerwartete Werte und halte die modellspezifische Verarbeitung an einer Stelle, damit sie aktualisiert werden kann.

Prompt ausprobieren
Prompt ausprobieren