> ## Documentation Index
> Fetch the complete documentation index at: https://novita.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Uso do DeepSeek-OCR

## Visão geral

O DeepSeek-OCR foi projetado para cenários de reconhecimento de documentos e conversão de imagem em texto, expandindo os limites da compressão visual e textual. O modelo pode renderizar textos longos em imagens altamente comprimidas, alcançando uma precisão de OCR de 97% com uma taxa de compressão sem perdas de 10x e cerca de 60% de precisão com compressão de 20x.

<Note>
  Atualmente, este modelo oferece suporte apenas a tarefas de reconhecimento independentes e de turno único. Ele não oferece suporte a conversas de múltiplos turnos. Apenas uma imagem pode ser enviada por solicitação, e é altamente recomendável usar prompts predefinidos para obter o melhor desempenho.
</Note>

## Prompts predefinidos recomendados

```bash theme={"system"}
# Convert the document contents to markdown format
<|grounding|>Convert the document to markdown.

# Perform text recognition on this image
<|grounding|>OCR this image.

# Extract all text without layout consideration
Free OCR.

# Parse any figures or tables in the document
Parse the figure.

# Provide a detailed description of the image content
Describe this image in detail.

# Locate the position of <|ref|>xxxx<|/ref|> in the image
Locate <|ref|>xxxx<|/ref|> in the image.
```

## Exemplo de uso

Este exemplo usa o prompt predefinido `<|grounding|>OCR this image.` para realizar o reconhecimento de texto em imagem.

```python theme={"system"}
from openai import OpenAI

client = OpenAI(
    base_url="https://api.novita.ai/openai",
    api_key="<Your API Key>",
)

response = client.chat.completions.create(
    model="deepseek/deepseek-ocr",
    messages=[
      {
        "role": "user",
        "content": [
          {
            "type": "image_url",
            "image_url": {
              "url": "https://example.com/image.png"
            }
          },
          {
            "type": "text",
            "text": "<|grounding|>OCR this image."
          }
        ]
      }
    ],
    stream=False,
    max_tokens=4096
)

content = response.choices[0].message.content

print(content)
```

Imagem de entrada de exemplo:

<Frame>
  <img src="https://mintcdn.com/novitaai/WiqzsYZd3W7VMsVe/guides/images/ocr_input.jpg?fit=max&auto=format&n=WiqzsYZd3W7VMsVe&q=85&s=c9163932898598c1c9f346549fdd6076" alt="Imagem de exemplo de OCR" width="762" height="406" data-path="guides/images/ocr_input.jpg" />
</Frame>

Saída de exemplo:

```
<|/ref|><|det|>[[37, 48, 279, 140]]<|/det|>
<|ref|>Deploy open-source and specialized models<|/ref|><|det|>[[42, 48, 857, 133]]<|/det|>
<|ref|>smarterandfasterwithsimpleApls.Accessthe<|/ref|><|det|>[[44, 185, 902, 246]]<|/det|>
<|ref|>latest chat, code, image, audio, video models and<|/ref|><|det|>[[41, 291, 945, 370]]<|/det|>
<|ref|>more,ready for production with built-in<|/ref|><|det|>[[40, 407, 756, 488]]<|/det|>
<|ref|>scalability.<|/ref|><|det|>[[39, 515, 232, 606]]<|/det|>
<|ref|>Explore<|/ref|><|det|>[[87, 813, 266, 879]]<|/det|>
<|ref|>Models<|/ref|><|det|>[[289, 816, 432, 878]]<|/det|>
```
