Heretic LLMHeretic LLM: Documentação da API
Heretic LLM: Documentação da API
Comece a usar a API Heretic LLM em minutos. Use os SDKs oficiais OpenAI para enviar texto e receber respostas sem censura do modelo 'uncensored' sem gerenciar infraestrutura de GPU.
URL Base e Autenticação
Para começar a usar a API Heretic LLM, aponte seu cliente compatível com OpenAI para nossa URL base: https://api.hereticllm.com/v1. A API usa autenticação padrão com token Bearer. Você pode gerar uma chave de API se cadastrando apenas com e-mail e senha na página Obter Chave de API. A chave é exibida imediatamente após o cadastro e pode ser regenerada a qualquer momento, o que invalida a chave anterior.
Defina a variável de ambiente OPENAI_API_KEY ou passe a chave diretamente na configuração do seu cliente. Certifique-se de atualizar a URL base para o endpoint da Heretic. Esta configuração permite usar os SDKs oficiais OpenAI sem alterações de código, simplesmente substituindo a URL base e a chave.
Primeira Requisição
Faça sua primeira requisição ao endpoint de conclusões de chat. O identificador do modelo é uncensored. Este modelo de pesos abertos é ajustado para responder sem recusas de conteúdo para uso adulto legal, sendo ideal para codificação sem censura, escrita criativa ou pesquisa. A janela de contexto suporta até 100.000 tokens para prompt e conclusão combinados.
Abaixo está um exemplo básico de cURL para testar o endpoint. Substitua YOUR_API_KEY pela sua chave real.
A resposta será um objeto no formato padrão OpenAI contendo o texto gerado.
curl https://api.hereticllm.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Integração com SDK Python
Integre a API em seus aplicativos Python usando o pacote oficial openai. A biblioteca lida com serialização JSON e streaming automaticamente. Inicialize o cliente com sua chave de API e a URL base correta. Em seguida, chame chat.completions.create com o ID do modelo uncensored.
Esta abordagem funciona perfeitamente para fluxos de trabalho síncronos e assíncronos. O modelo responde a prompts padrão, chamada de funções e parâmetros de streaming, assim como outros endpoints compatíveis com OpenAI. Você pode passar prompts de sistema para orientar o comportamento do modelo ou usar mensagens de usuário para interação direta.
from openai import OpenAI
client = OpenAI(base_url="https://api.hereticllm.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Integração com SDK Node.js
Para projetos JavaScript e TypeScript, use o pacote npm openai. Configure o cliente com a URL base da Heretic e sua chave de API. A API suporta estruturas de requisição padrão, incluindo definições de ferramentas e chamada de funções.
Certifique-se de processar a resposta corretamente, especialmente ao usar padrões async/await. O modelo retorna respostas de texto que podem ser processadas diretamente na lógica do seu aplicativo. Esta integração é ideal para construir interfaces de chat, agentes automatizados ou pipelines de processamento de dados que requerem capacidades de LLM sem censura.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.hereticllm.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Respostas em Streaming
Ative respostas em tempo real habilitando o streaming na sua requisição de API. Defina o parâmetro stream como true. A API retornará um stream de Server-Sent Events (SSE) contendo pedaços de texto conforme são gerados. Isso reduz a latência percebida e proporciona uma experiência de usuário mais suave para aplicativos de chat.
Cada pedaço no fluxo contém uma parte da resposta. Processe esses pedaços de forma incremental para atualizar sua interface do usuário em tempo real. O recurso de streaming é totalmente compatível com os SDKs da OpenAI, então você pode usar os iteradores padrão de stream ou listeners de eventos para processar os dados de forma eficiente.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Limites de Requisição, Erros e Contexto
A API impõe um limite de 300 requisições por minuto por chave e um tamanho de corpo de requisição de 8 MB. Se você exceder o limite de requisições, receberá um erro 429. Erros de autenticação retornam status 401, indicando uma chave de API inválida ou ausente. Se seu crédito pré-pago for esgotado, a API retornará um erro 402, exigindo uma recarga.
O crédito nunca expira e você pode recarregar a partir de $10 usando criptomoedas (USDT ou USDC), com créditos bônus para depósitos maiores. O modelo suporta uma janela de contexto de 100.000 tokens. Certifique-se de que seus prompts e completions se encaixem nesse limite. Para mais detalhes sobre preços e limites, visite a página de Preços.
Especificações técnicas
Todos os limites e recursos reais da API em um só lugar — confira antes de recarregar.
| Item | Valor |
|---|---|
| Formato | compatível com OpenAI: qualquer SDK da OpenAI funciona trocando a base URL e a chave |
| Base URL | https://api.hereticllm.com/v1 |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Autenticação | Authorization: Bearer YOUR_KEY |
| ID do modelo | uncensored |
| Chamada de funções | sim — tools, tool_choice; resposta com tool_calls, inclusive em streaming; resultados como role: tool |
| Modo JSON | response_format: {"type": "json_object"} |
| Parâmetros | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Saída máxima | até o restante da janela de 100.000 tokens; max_tokens opcional (sem limite separado) |
| Janela de contexto | 100.000 tokens (entrada + saída) |
| Streaming | sim — server-sent events; o último bloco traz o uso de tokens |
| Tamanho | até 8 MB por requisição |
| Concorrência | 8 requisições ao mesmo tempo por chave |
| Cabeçalhos | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Limite de taxa | 300 requisições por minuto por chave |
| Cobrança | crédito pré-pago pelo uso real; erros e recusas são grátis |
| Teste grátis | $0,50 por 7 dias, sem cartão · Chave de teste: 2 requisições paralelas, 60 por minuto; limites totais (8 e 300) após a primeira recarga |
| Preço | $0,25 por 1M tokens de entrada · $1,00 por 1M de saída |
| Validade | crédito pago não expira, sem assinatura |
| Bônus | +5% a partir de $50, +10% a partir de $100 |
| Recarga | USDT (TRC20) ou USDC (Base), qualquer valor inteiro de $10 a $500 |
| Login | Google ou e-mail e senha |
| Chaves | uma chave ativa por conta; uma nova substitui a anterior |
| Conteúdo | conteúdo adulto permitido; conteúdo sexual com menores é recusado |
Códigos de erro
Erros chegam em JSON com um type fixo; requisições com falha ou recusadas não são cobradas.
| Código | Tipo | Significado |
|---|---|---|
400 | bad_request | JSON inválido, mensagens vazias, parâmetro errado ou contexto longo demais |
401 | missing_key · invalid_key · key_revoked | chave ausente, errada ou substituída |
402 | no_credit | sem crédito — recarregue e continue na hora |
403 | content_blocked | conteúdo sexual com menores — recusado, sem cobrança |
404 | not_found | endpoint desconhecido |
413 | request_too_large | corpo acima de 8 MB |
429 | rate_limited · concurrency | acima de 300/min ou 8 em paralelo — aguarde e tente de novo |
503 | upstream_busy | modelo ocupado — tente em alguns segundos |
Perguntas e respostas
O modelo sem censura é gratuito?
O modelo não é gratuito, mas utiliza um sistema de crédito pré-pago com pagamento por uso. Novas contas recebem $0,50 de crédito de teste válido por 7 dias. Créditos pagos nunca expiram e você pode recarregar a partir de $10.
Qual é o tamanho da janela de contexto?
O modelo suporta uma janela de contexto de 100.000 tokens, que inclui tanto o prompt de entrada quanto a conclusão gerada. Isso permite interações de contexto longo e tarefas de processamento de grandes volumes de dados.
A API suporta chamada de funções?
Sim, a API suporta chamada de ferramentas e funções. Você pode definir ferramentas na sua requisição e o modelo responderá com dados estruturados que podem ser executados pelo seu aplicativo. Isso é compatível com os padrões padrão dos SDKs OpenAI.
Sua chave está a um formulário de distância
Crie uma conta, copie a chave, altere a URL base. Essa é toda a configuração necessária.