baseten

Tutorial de inferencia

Guía para desarrolladores sobre cómo usar la inferencia de baseten

Si estás aprendiendo a usar la inferencia de baseten, empieza con un modelo al que tengas acceso y una entrada de prueba pequeña. Esta guía sigue la solicitud desde la preparación hasta la comprobación de la respuesta, sin dar por supuesto un formato de entrada específico del modelo.

Imagen abstracta que representa un flujo de trabajo de inferencia de modelos

pasos numerados

Sigue esta secuencia con un modelo y una entrada representativa antes de conectar la inferencia a una aplicación más grande.

  1. 1

    Elige el modelo

    Identifica el modelo que quieres utilizar y lee sus instrucciones actuales de entrada y salida. Un modelo de texto, uno de imágenes y uno de embeddings pueden requerir campos de solicitud diferentes.

  2. 2

    Envía una prueba pequeña

    Usa el método de acceso indicado para ese modelo, proporciona los datos mínimos válidos y evita incluir credenciales en archivos de código fuente y en código accesible desde el navegador.

  3. 3

    Inspecciona el resultado

    Comprueba si la solicitud se completó correctamente y examina los datos devueltos antes de escribir código que presuponga una estructura de respuesta determinada.

pasos numerados

Comprueba estos requisitos antes de tu primera solicitud de inferencia a Baseten; la documentación específica del modelo tiene prioridad sobre un ejemplo genérico.

Obligatorio Opcional
  • Identifica un modelo al que puedas acceder y sus instrucciones de inferencia actuales. — Anota el identificador del modelo o el endpoint exactamente como aparece para el modelo elegido.

  • Prepara el método de autenticación que requiere el servicio al que vas a llamar. — Guarda cualquier secreto fuera del código incluido en el repositorio y de las aplicaciones del lado del cliente.

  • Crea una entrada que siga el esquema documentado del modelo. — Usa un ejemplo pequeño y representativo en lugar de un lote completo.

  • Elige una herramienta que pueda enviar una solicitud y mostrar la respuesta completa. — Un cliente de API o un script breve del lado del servidor puede ayudarte a inspeccionar el estado y los campos devueltos.

  • Prepara una segunda entrada para compararla una vez que funcione la primera solicitud.opcional — Un ejemplo contrastante puede revelar suposiciones en tu código de procesamiento de respuestas.

pasos numerados

La primera solicitud correcta debe demostrar que el modelo, la entrada y el código que procesa la respuesta son compatibles, no solo que existe una conexión.

1

Confirma los requisitos de la solicitud

Abre las instrucciones del modelo específico que seleccionaste. Fíjate dónde va la entrada, qué campos son obligatorios y qué tipo de salida se espera. No copies los datos de una solicitud de otro modelo solo porque también se ejecuta en Baseten: usar el mismo método de comunicación no implica que los modelos acepten las mismas entradas. Guarda un breve registro local del modelo y los datos de la solicitud que probaste para facilitar el seguimiento de los cambios posteriores.

2

Haz una llamada controlada

Envía una entrada mínima y válida a través de la interfaz admitida para ese modelo. Mantén deliberadamente pequeña la primera prueba de inferencia de Baseten: una muestra de texto breve para una tarea de texto, o un archivo preparado adecuadamente para un modelo que acepte otros medios. Registra el estado de la solicitud y cualquier mensaje de error sin registrar secretos. Si la llamada falla, cambia una variable a la vez en lugar de rehacer toda la integración.

3

Lee la salida antes de usarla

Inspecciona toda la estructura devuelta, no solo el campo que esperabas recibir. Comprueba que la salida corresponda a tu entrada y que tu aplicación pueda gestionar de forma segura los resultados vacíos o inesperados. Solo después de esta comprobación debes convertir la respuesta a tus propios tipos o a tu interfaz de usuario. Repite la prueba con una segunda entrada para detectar suposiciones codificadas de forma rígida.

Errores comunes y soluciones

Una guía general no puede diagnosticar todos los modelos, pero estas comprobaciones ayudan a identificar las causas más comunes de los fallos de inferencia.

1

Se rechaza el acceso

Una solicitud no puede completarse si las credenciales, la referencia del modelo o los permisos de acceso son incorrectos. No des por hecho que un error significa que el modelo no está disponible.

Qué hacer en su lugar

Comprueba que el método de acceso configurado y la referencia del modelo coincidan con las instrucciones actuales. Sustituye cualquier secreto expuesto en lugar de reutilizarlo.

2

La entrada no es válida

Baseten no puede hacer que un modelo interprete campos o medios que no coincidan con el esquema documentado para ese modelo. Una solicitud de red válida puede contener datos que el modelo no pueda usar.

Qué hacer en su lugar

Reduce los datos enviados a un ejemplo documentado, confirma los nombres de los campos y los tipos de datos y, después, vuelve a añadir tu entrada parte por parte.

3

La respuesta difiere de lo que esperabas

Distintos modelos pueden devolver estructuras diferentes, y una llamada completada correctamente no garantiza que esté presente el campo que espera tu código.

Qué hacer en su lugar

Inspecciona la respuesta completa, valida los campos obligatorios antes de leerlos y gestiona explícitamente los valores ausentes o inesperados.

4

Es difícil explicar una llamada lenta o fallida

Este tutorial no puede garantizar un tiempo de respuesta ni identificar la causa de todos los tiempos de espera agotados únicamente desde el lado del cliente.

Qué hacer en su lugar

Registra el tiempo de las solicitudes y los detalles de los errores que no sean sensibles, prueba una entrada más pequeña y consulta las recomendaciones operativas actuales del modelo.

consejos avanzados

Una vez que funcione una llamada de inferencia de Baseten, adapta el mismo contrato verificado al entorno en el que lo usarás.

Desarrolladores de aplicaciones

Establece un límite estable en torno a las llamadas al modelo

Mantén la construcción de solicitudes específicas del modelo en un único módulo del servidor. Valida los datos entrantes de la aplicación antes de convertirlos en la carga útil del modelo y devuelve un error predecible a nivel de aplicación cuando falle la inferencia. Esto permite cambiar un modelo o la asignación de sus solicitudes sin dispersar supuestos por todo el código.

  • Mantén las credenciales en una configuración protegida del servidor.
  • Valida tanto la entrada saliente como la salida entrante.
  • Prueba la gestión de errores, además de las respuestas correctas.

Evaluadores de modelos

Compara los resultados usando entradas consistentes

Prepara un pequeño conjunto de casos representativos, incluida una entrada complicada o en el límite. Registra qué modelo y qué configuración de solicitud produjeron cada resultado. Al evaluar el comportamiento de la inferencia de Baseten, compara los resultados con los criterios de tu tarea en lugar de considerar que un estado de respuesta correcto equivale a una puntuación de calidad.

  • Usa casos de prueba reproducibles.
  • Mantén los criterios de evaluación separados de las comprobaciones de transporte.
  • Revisa los resultados inesperados antes de automatizar las decisiones.

Equipos de operaciones

Haz que los fallos sean observables sin exponer datos

Decide qué detalles no sensibles de las solicitudes son útiles para depurar y evita almacenar credenciales o entradas privadas en los registros habituales. Haz un seguimiento de las categorías de fallos y los tiempos de respuesta en el contexto de tu propia aplicación. Vuelve a comprobar la integración cuando cambies el modelo, la carga útil o la configuración de tiempo de espera de la aplicación.

  • Distingue los errores de acceso de los errores de entrada no válida.
  • Evita registrar secretos o cargas útiles sensibles.
  • Vuelve a probar después de cambiar la configuración.

consejos avanzados

Usa el enfoque de solicitud verificada: elige un modelo, sigue sus instrucciones actuales, prueba una entrada pequeña e inspecciona el resultado antes de integrarlo en una aplicación. El destino puede tener sus propios requisitos de acceso e indicaciones específicas del modelo.

Da el siguiente paso con la inferencia de modelos

  • Empieza con un contrato de solicitud específico del modelo.
  • Prueba cómo se procesan los resultados antes de ampliar la escala.
  • Protege las credenciales y las entradas sensibles.
Explora la inferencia de modelos

preguntas frecuentes del tutorial

Elige un modelo al que tengas acceso y lee sus instrucciones actuales de inferencia. Prepara una entrada mínima que se ajuste a su esquema, envía una solicitud mediante la interfaz admitida e inspecciona la respuesta completa antes de conectar la lógica de la aplicación.

Confirma la referencia del modelo, el método de acceso requerido y el formato de entrada documentado. No incluyas credenciales en el código del cliente y usa una herramienta de solicitudes que te permita inspeccionar tanto los errores como los resultados correctos.

Empieza por distinguir si se trata de un problema de acceso, de una carga de datos no válida o del procesamiento de la respuesta. Compara la referencia del modelo y los campos de entrada con las instrucciones actuales y, después, vuelve a intentarlo con la entrada documentada más pequeña que puedas usar.

Primero, inspecciona la respuesta de una solicitud de prueba que funcione e identifica los campos que tu aplicación realmente necesita. Valida esos campos antes de usarlos, gestiona los valores ausentes o inesperados y mantén el código que analiza las respuestas de cada modelo en un solo lugar para poder actualizarlo.

Prueba un prompt
Prueba un prompt