1. Beneficios
Con Prompt Cache habilitado, obtiene:- Menor costo Los prompts repetidos ya no requieren inferencia completa. Solo se cobran tarifas mínimas por tokens de caché.
- Menor latencia Los resultados en caché se devuelven al instante sin ejecutar el modelo.
- Mayor rendimiento En escenarios de alto QPS, Prompt Cache reduce la carga de cómputo y mejora la capacidad general del sistema.
- Transparente para su aplicación no se requiere lógica adicional ni cambios en el sistema.
2. Modelos compatibles
Actualmente, varios modelos open-source serverless admiten facturación de caché de prompts, entre ellos: Para obtener detalles de precios sobre la función de caché de prompts de los modelos compatibles, consulte: https://novita.ai/pricing (consulte la sección “Cache”).3. Casos de uso
Prompt Cache es muy eficaz en cargas de trabajo con prompts repetidos con frecuencia, incluidos, entre otros:- Generación basada en plantillas
- Resúmenes con formato fijo
- Reescritura basada en plantillas
- Prompts reutilizados entre tareas
- Clasificación de texto y extracción de campos
- Clasificación del tipo de contenido
- Extracción de etiquetas o información clave
- Moderación de contenido
- Revisión de comentarios, anuncios o títulos
- Muchos prompts de moderación se repiten entre usuarios y a lo largo del tiempo
- Prompts de sistema repetidos en aplicaciones de chat
- Definiciones de personalidad del chatbot
- Reglas globales de conversación
- Información de contexto reutilizada en múltiples turnos
- Prompts de estilo workflow / asistente
- Asistentes de generación SQL
- Asistentes de reparación de código
- Asistentes de resumen con formatos de salida fijos
4. Ejemplos de respuesta
Cuando se acierta en la caché, no se realiza inferencia, lo que resulta en un costo significativamente menor y respuestas más rápidas.