概要
DeepSeek-OCR は、ドキュメント認識および画像からテキストへの変換シナリオ向けに設計されており、視覚情報とテキスト情報の圧縮の限界を押し広げます。このモデルは長いテキストを高度に圧縮された画像としてレンダリングでき、10 倍の可逆圧縮率で 97% の OCR 精度、20 倍圧縮で約 60% の精度を達成します。このモデルは現在、単一ターンの独立した認識タスクのみをサポートしています。マルチターン会話には対応していません。リクエストごとにアップロードできる画像は 1 枚のみであり、最適なパフォーマンスを得るためにプリセットプロンプトの使用を強く推奨します。
推奨プリセットプロンプト
使用例
この例では、<|grounding|>OCR this image. プリセットプロンプトを使用して画像テキスト認識を実行します。
