Respan es una plataforma de observabilidad de IA diseñada para enrutar, observar y evaluar cada llamada a modelos de lenguaje grande (LLM). Actúa como una pasarela central que permite dirigir el tráfico de LLM a través de un único punto de entrada, facilitando la gestión de miles de modelos con funcionalidades integradas de fallbacks automáticos, caché de respuestas y límites de gasto.
Características clave:
- **Enrutamiento de tráfico LLM:** Conecta un SDK existente a un único endpoint para acceder a más de 1000 modelos, conmutando entre proveedores con facilidad y garantizando alta disponibilidad mediante fallbacks automáticos.
- **Evaluación de modelos:** Puntuación de cada salida de LLM contra criterios definidos, utilizando jueces de IA, verificaciones de código o revisión humana. Permite probar y comparar versiones antes de la implementación en producción.
- **Monitorización del rendimiento:** Rastrea solicitudes, errores, costos, latencia y tokens en un solo panel, con alertas personalizadas para notificaciones inmediatas si alguna métrica supera un umbral.
- **Trazabilidad de operaciones:** Visualiza cada llamada LLM, ejecución de herramientas, recuperación de datos y turnos de agente como un 'span' en un único rastro, capturando entradas, salidas, latencia y costos para una depuración precisa.
Respan está diseñado para fundadores, ingenieros y equipos de producto que buscan escalar sus aplicaciones de IA de manera fiable y eficiente, proporcionando las herramientas necesarias para depurar y optimizar el rendimiento de LLM en producción.
