Skip to main content

Capacidades dos modelos

Modelos de Linguagem de Grande Porte (LLMs) são tipos de modelo de IA criados usando técnicas de deep learning e processamento de linguagem natural. Após serem treinados com enormes quantidades de dados de texto, eles conseguem entender, gerar e processar linguagem humana. LLMs têm as seguintes capacidades principais:
  • Geração de texto LLMs podem gerar conteúdo logicamente coerente com base no contexto e ajustar o estilo da saída conforme necessário.
  • Compreensão de linguagem LLMs conseguem entender com precisão o significado do texto de entrada e dar suporte a conversas com consciência de contexto.
  • Tradução de texto LLMs são capazes de compreensão e geração entre idiomas, possibilitando a tradução entre diferentes línguas.
  • Perguntas e respostas baseadas em conhecimento Com uma ampla base de conhecimento, LLMs podem responder perguntas em domínios como cultura, ciência e história.
  • Compreensão e geração de código LLMs podem entender e gerar código (Python, Java, C++ e assim por diante), detectar erros de código e oferecer sugestões.
  • Classificação e sumarização de texto LLMs conseguem entender frases complexas, categorizar e extrair informações, além de resumir pontos-chave.

Seleção de modelo

Na Página do serviço LLM, você pode navegar pela lista de modelos compatíveis, conhecer informações básicas dos modelos e consultar preços. Clique em um modelo específico para abrir sua página de detalhes e acessar uma demonstração online. Depois de testar diferentes modelos com sua tarefa, você pode comparar e escolher o mais adequado.

Integração de API

A Novita AI fornece APIs rápidas e confiáveis para modelos open-source, combinando a facilidade e a confiabilidade de APIs LLM de primeira linha com a flexibilidade e a eficiência de custo dos LLMs open source.
  • ChatCompletion: Compatível com modos streaming e non-streaming.
  • Completion: Também compatível com modos streaming e non-streaming.
Se você já usa a API ChatCompletion ou Completion da OpenAI, basta definir sua URL base como: api.novita.ai/openai , obter e configurar sua chave de API, atualizar o nome do modelo conforme necessário e começar a usar os serviços LLM.
Para saber como criar, armazenar e usar uma chave de API, consulte API Keys.

Exemplos de código

Python

Curl

Parâmetros principais

Parâmetros base

model: O LLM de destino. Veja a lista completa na Página do serviço LLM.

Messages

Somente ChatCompletion
messages: Entradas e saídas ao interagir com o LLM. Cada mensagem pertence a um personagem. As mensagens podem ajudar você a obter saídas melhores; você pode testar diferentes métodos para alcançar melhores resultados.
  • content: conteúdo da mensagem.
  • role: Define o falante:
    • system: Define o papel da IA, informando ao modelo seu papel ou comportamento.
    • user: A entrada do usuário.
    • assistant: A resposta da IA. Os usuários podem fornecer exemplos de saída antecipadamente, informando ao modelo como responder à solicitação atual.
  • name (opcional): separa autores de mensagens com o mesmo papel.

Prompt

Somente ChatCompletion
prompt: Texto de instrução para gerar uma completion, escrito pelo usuário para o LLM a fim de informar claramente ao modelo qual é a tarefa.

Controle de saída

Diferentes combinações de parâmetros podem ajudar o modelo a gerar conteúdo mais satisfatório. Diversidade do texto
‘temperature’ e ‘top_p’ podem controlar a diversidade do texto gerado; recomendamos definir apenas um deles. Quanto maior for o valor definido, mais diverso será o texto. Quanto menor for o valor definido, mais preciso será o texto.
  • temperature: Controla a aleatoriedade. Maior = mais criativo.
  • top_p: Amostragem de núcleo. Controla a probabilidade cumulativa.
  • top_k: Limita a contagem de tokens candidatos.
Penalidades de repetição
  • presence_penalty: Controla tokens repetidos nos textos. Se um token já tiver aparecido no texto, uma penalidade será aplicada, o que resulta em mais tokens diferentes no texto.
  • frequency_penalty: Controla a frequência de tokens nos textos. Toda vez que o mesmo token existir no texto, uma penalidade será aplicada, resultando em menos ocorrências do mesmo token no futuro do texto.
  • repetition_penalty: Penaliza ou incentiva repetição.

Limites de saída

  • max_tokens: Máximo de tokens em uma resposta. O conteúdo após esse valor no texto será truncado.
  • stream: Se deve usar streaming. Para saídas longas, recomendamos usar o modo streaming para evitar erro de timeout:
    • true: Transmitido por streaming, com resultados parciais conforme são gerados.
    • false: Resultado completo após o processamento.
  • stop: Strings que encerrarão a geração quando encontradas.
Última modificação em 10 de agosto de 2026