PT ▾
Obter chave de API

Heretic LLMHeretic LLM: Documentação da API

Heretic LLM: Documentação da API

Comece a usar a API Heretic LLM em minutos. Use os SDKs oficiais OpenAI para enviar texto e receber respostas sem censura do modelo 'uncensored' sem gerenciar infraestrutura de GPU.

URL Base e Autenticação

Para começar a usar a API Heretic LLM, aponte seu cliente compatível com OpenAI para nossa URL base: https://api.hereticllm.com/v1. A API usa autenticação padrão com token Bearer. Você pode gerar uma chave de API se cadastrando apenas com e-mail e senha na página Obter Chave de API. A chave é exibida imediatamente após o cadastro e pode ser regenerada a qualquer momento, o que invalida a chave anterior.

Defina a variável de ambiente OPENAI_API_KEY ou passe a chave diretamente na configuração do seu cliente. Certifique-se de atualizar a URL base para o endpoint da Heretic. Esta configuração permite usar os SDKs oficiais OpenAI sem alterações de código, simplesmente substituindo a URL base e a chave.

Primeira Requisição

Faça sua primeira requisição ao endpoint de conclusões de chat. O identificador do modelo é uncensored. Este modelo de pesos abertos é ajustado para responder sem recusas de conteúdo para uso adulto legal, sendo ideal para codificação sem censura, escrita criativa ou pesquisa. A janela de contexto suporta até 100.000 tokens para prompt e conclusão combinados.

Abaixo está um exemplo básico de cURL para testar o endpoint. Substitua YOUR_API_KEY pela sua chave real.

A resposta será um objeto no formato padrão OpenAI contendo o texto gerado.

curl https://api.hereticllm.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Integração com SDK Python

Integre a API em seus aplicativos Python usando o pacote oficial openai. A biblioteca lida com serialização JSON e streaming automaticamente. Inicialize o cliente com sua chave de API e a URL base correta. Em seguida, chame chat.completions.create com o ID do modelo uncensored.

Esta abordagem funciona perfeitamente para fluxos de trabalho síncronos e assíncronos. O modelo responde a prompts padrão, chamada de funções e parâmetros de streaming, assim como outros endpoints compatíveis com OpenAI. Você pode passar prompts de sistema para orientar o comportamento do modelo ou usar mensagens de usuário para interação direta.

from openai import OpenAI

client = OpenAI(base_url="https://api.hereticllm.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Integração com SDK Node.js

Para projetos JavaScript e TypeScript, use o pacote npm openai. Configure o cliente com a URL base da Heretic e sua chave de API. A API suporta estruturas de requisição padrão, incluindo definições de ferramentas e chamada de funções.

Certifique-se de processar a resposta corretamente, especialmente ao usar padrões async/await. O modelo retorna respostas de texto que podem ser processadas diretamente na lógica do seu aplicativo. Esta integração é ideal para construir interfaces de chat, agentes automatizados ou pipelines de processamento de dados que requerem capacidades de LLM sem censura.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.hereticllm.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Respostas em Streaming

Ative respostas em tempo real habilitando o streaming na sua requisição de API. Defina o parâmetro stream como true. A API retornará um stream de Server-Sent Events (SSE) contendo pedaços de texto conforme são gerados. Isso reduz a latência percebida e proporciona uma experiência de usuário mais suave para aplicativos de chat.

Cada pedaço no fluxo contém uma parte da resposta. Processe esses pedaços de forma incremental para atualizar sua interface do usuário em tempo real. O recurso de streaming é totalmente compatível com os SDKs da OpenAI, então você pode usar os iteradores padrão de stream ou listeners de eventos para processar os dados de forma eficiente.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Limites de Requisição, Erros e Contexto

A API impõe um limite de 300 requisições por minuto por chave e um tamanho de corpo de requisição de 8 MB. Se você exceder o limite de requisições, receberá um erro 429. Erros de autenticação retornam status 401, indicando uma chave de API inválida ou ausente. Se seu crédito pré-pago for esgotado, a API retornará um erro 402, exigindo uma recarga.

O crédito nunca expira e você pode recarregar a partir de $10 usando criptomoedas (USDT ou USDC), com créditos bônus para depósitos maiores. O modelo suporta uma janela de contexto de 100.000 tokens. Certifique-se de que seus prompts e completions se encaixem nesse limite. Para mais detalhes sobre preços e limites, visite a página de Preços.

Especificações técnicas

Todos os limites e recursos reais da API em um só lugar — confira antes de recarregar.

ItemValor
Formatocompatível com OpenAI: qualquer SDK da OpenAI funciona trocando a base URL e a chave
Base URLhttps://api.hereticllm.com/v1
EndpointsPOST /v1/chat/completions · GET /v1/models
AutenticaçãoAuthorization: Bearer YOUR_KEY
ID do modelouncensored
Chamada de funçõessim — tools, tool_choice; resposta com tool_calls, inclusive em streaming; resultados como role: tool
Modo JSONresponse_format: {"type": "json_object"}
Parâmetrostemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Saída máximaaté o restante da janela de 100.000 tokens; max_tokens opcional (sem limite separado)
Janela de contexto100.000 tokens (entrada + saída)
Streamingsim — server-sent events; o último bloco traz o uso de tokens
Tamanhoaté 8 MB por requisição
Concorrência8 requisições ao mesmo tempo por chave
CabeçalhosX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Limite de taxa300 requisições por minuto por chave
Cobrançacrédito pré-pago pelo uso real; erros e recusas são grátis
Teste grátis$0,50 por 7 dias, sem cartão · Chave de teste: 2 requisições paralelas, 60 por minuto; limites totais (8 e 300) após a primeira recarga
Preço$0,25 por 1M tokens de entrada · $1,00 por 1M de saída
Validadecrédito pago não expira, sem assinatura
Bônus+5% a partir de $50, +10% a partir de $100
RecargaUSDT (TRC20) ou USDC (Base), qualquer valor inteiro de $10 a $500
LoginGoogle ou e-mail e senha
Chavesuma chave ativa por conta; uma nova substitui a anterior
Conteúdoconteúdo adulto permitido; conteúdo sexual com menores é recusado

Códigos de erro

Erros chegam em JSON com um type fixo; requisições com falha ou recusadas não são cobradas.

CódigoTipoSignificado
400bad_requestJSON inválido, mensagens vazias, parâmetro errado ou contexto longo demais
401missing_key · invalid_key · key_revokedchave ausente, errada ou substituída
402no_creditsem crédito — recarregue e continue na hora
403content_blockedconteúdo sexual com menores — recusado, sem cobrança
404not_foundendpoint desconhecido
413request_too_largecorpo acima de 8 MB
429rate_limited · concurrencyacima de 300/min ou 8 em paralelo — aguarde e tente de novo
503upstream_busymodelo ocupado — tente em alguns segundos

Perguntas e respostas

O modelo sem censura é gratuito?

O modelo não é gratuito, mas utiliza um sistema de crédito pré-pago com pagamento por uso. Novas contas recebem $0,50 de crédito de teste válido por 7 dias. Créditos pagos nunca expiram e você pode recarregar a partir de $10.

Qual é o tamanho da janela de contexto?

O modelo suporta uma janela de contexto de 100.000 tokens, que inclui tanto o prompt de entrada quanto a conclusão gerada. Isso permite interações de contexto longo e tarefas de processamento de grandes volumes de dados.

A API suporta chamada de funções?

Sim, a API suporta chamada de ferramentas e funções. Você pode definir ferramentas na sua requisição e o modelo responderá com dados estruturados que podem ser executados pelo seu aplicativo. Isso é compatível com os padrões padrão dos SDKs OpenAI.

Sua chave está a um formulário de distância

Crie uma conta, copie a chave, altere a URL base. Essa é toda a configuração necessária.

Obter Chave de APILer a documentação