Vue d’ensemble
DeepSeek-OCR est conçu pour les scénarios de reconnaissance de documents et de conversion d’images en texte, repoussant les limites de la compression visuelle et textuelle. Le modèle peut rendre de longs textes sous forme d’images fortement compressées, atteignant une précision OCR de 97 % avec un taux de compression sans perte de 10x et une précision d’environ 60 % avec une compression de 20x.Ce modèle prend actuellement en charge uniquement les tâches de reconnaissance indépendantes en un seul tour. Il ne prend pas en charge les conversations multi-tours. Une seule image peut être téléversée par requête, et il est fortement recommandé d’utiliser les prompts prédéfinis pour des performances optimales.
Prompts prédéfinis recommandés
Exemple d’utilisation
Cet exemple utilise le prompt prédéfini<|grounding|>OCR this image. pour effectuer la reconnaissance de texte dans une image.
