1. Avantages
Avec le cache de prompts activé, vous bénéficiez de :- Coûts réduits Les prompts répétés ne nécessitent plus une inférence complète. Seuls des frais minimaux de tokens de cache sont facturés.
- Latence réduite Les résultats mis en cache sont renvoyés instantanément, sans exécuter le modèle.
- Débit plus élevé Dans les scénarios à QPS élevé, le cache de prompts réduit la charge de calcul et améliore la capacité globale du système.
- Transparent pour votre application aucune logique supplémentaire ni modification du système n’est requise.
2. Modèles pris en charge
Plusieurs modèles open source serverless prennent actuellement en charge la facturation du cache de prompts, notamment : Pour plus de détails sur la tarification concernant la fonctionnalité de cache de prompts des modèles pris en charge, veuillez consulter : https://novita.ai/pricing (voir la section « Cache »).3. Cas d’utilisation
Le cache de prompts est très efficace pour les charges de travail avec des prompts fréquemment répétés, notamment, sans s’y limiter :- Génération basée sur des modèles
- Résumés à format fixe
- Réécriture guidée par des modèles
- Prompts réutilisés entre différentes tâches
- Classification de texte et extraction de champs
- Classification du type de contenu
- Extraction de tags ou d’informations clés
- Modération de contenu
- Examen de commentaires, publicités ou titres
- De nombreux prompts de modération se répètent selon les utilisateurs et au fil du temps
- Prompts système répétés dans les applications de chat
- Définitions de persona de chatbot
- Règles globales de conversation
- Informations contextuelles réutilisées sur plusieurs tours
- Prompts de type workflow / assistant
- Assistants de génération SQL
- Assistants de correction de code
- Assistants de résumé avec formats de sortie fixes
4. Exemples de réponses
Lorsque le cache est atteint, aucune inférence n’est effectuée, ce qui entraîne des coûts nettement plus faibles et des réponses plus rapides.