ES ▾
Obtener clave de API

Heretic LLMHeretic LLM: Documentación de API

Heretic LLM: Documentación de API

Comienza con la API de Heretic LLM en minutos. Usa los SDKs oficiales de OpenAI para enviar texto y recibir respuestas sin censura del modelo 'uncensored' sin gestionar infraestructura GPU.

URL base y autenticación

Para comenzar a usar la API de Heretic LLM, apunta tu cliente compatible con OpenAI a nuestra URL base: https://api.hereticllm.com/v1. La API usa autenticación estándar con token Bearer. Puedes generar una clave de API registrándote solo con correo y contraseña en la página Obtener clave de API. La clave se muestra inmediatamente después del registro y se puede regenerar en cualquier momento, lo que invalida la clave anterior.

Establece la variable de entorno OPENAI_API_KEY o pasa la clave directamente en la configuración de tu cliente. Asegúrate de actualizar la URL base al endpoint de Heretic. Esta configuración te permite usar los SDKs oficiales de OpenAI sin cambios de código, simplemente cambiando la URL base y la clave.

Primera petición

Realiza tu primera petición al endpoint de completados de chat. El identificador del modelo es uncensored. Este modelo de pesos abiertos está ajustado para responder sin rechazos de contenido para uso adulto legal, lo que lo hace ideal para codificación sin censura, escritura creativa o investigación. La ventana de contexto admite hasta 100.000 tokens para prompt y generación combinados.

A continuación hay un ejemplo básico de cURL para probar el endpoint. Reemplaza YOUR_API_KEY con tu clave real.

La respuesta será un objeto estándar en formato OpenAI que contiene el texto generado.

curl https://api.hereticllm.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Integración con SDK Python

Integra la API en tus aplicaciones Python usando el paquete oficial openai. La biblioteca maneja la serialización JSON y el streaming automáticamente. Inicializa el cliente con tu clave de API y la URL base correcta. Luego, llama a chat.completions.create con el ID del modelo uncensored.

Este enfoque funciona perfectamente para flujos de trabajo sincrónicos y asincrónicos. El modelo responde a prompts estándar, llamadas a funciones y parámetros de streaming igual que otros endpoints compatibles con OpenAI. Puedes pasar prompts de sistema para guiar el comportamiento del modelo o usar mensajes de usuario para interacción directa.

from openai import OpenAI

client = OpenAI(base_url="https://api.hereticllm.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Integración con SDK Node.js

Para proyectos en JavaScript y TypeScript, usa el paquete npm openai. Configura el cliente con la URL base de Heretic y tu clave de API. La API admite estructuras de petición estándar, incluidas definiciones de herramientas y llamadas a funciones.

Asegúrate de manejar la respuesta correctamente, especialmente al usar patrones async/await. El modelo devuelve respuestas de texto que se pueden procesar directamente en la lógica de tu aplicación. Esta integración es ideal para construir interfaces de chat, agentes automatizados o tuberías de procesamiento de datos que requieran capacidades de LLM sin censura.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.hereticllm.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Respuestas en streaming

Habilita respuestas en tiempo real activando el streaming en tu petición a la API. Establece el parámetro stream en true. La API devolverá un flujo de Eventos Enviados por Servidor (SSE) que contiene fragmentos de texto a medida que se generan. Esto reduce la latencia percibida y proporciona una experiencia de usuario más fluida para aplicaciones de chat.

Cada fragmento en el flujo contiene una parte de la respuesta. Maneja estos fragmentos de forma incremental para actualizar tu interfaz de usuario en tiempo real. La función de streaming es totalmente compatible con los SDKs de OpenAI, por lo que puedes usar los iteradores estándar stream o los listeners de eventos para procesar los datos de manera eficiente.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Límites, errores y contexto

La API impone un límite de 300 peticiones por minuto por clave y un tamaño de cuerpo de petición de 8 MB. Si excedes el límite de peticiones, recibirás un error 429. Los errores de autenticación devuelven un estado 401, indicando una clave de API inválida o faltante. Si tu crédito prepago se agota, la API devuelve un error 402, requiriendo una recarga.

El crédito no caduca y puedes recargar desde $10 usando criptomonedas (USDT o USDC), con créditos bonus para depósitos más grandes. El modelo admite una ventana de contexto de 100.000 tokens. Asegúrate de que tus prompts y generaciones se ajusten a este límite. Para más detalles sobre precios y límites, visita la página de Precios.

Especificaciones técnicas

Todos los límites y funciones reales de la API en un solo lugar: revísalos antes de recargar.

ElementoValor
Formatocompatible con OpenAI: cualquier SDK de OpenAI funciona cambiando la base URL y la clave
Base URLhttps://api.hereticllm.com/v1
EndpointsPOST /v1/chat/completions · GET /v1/models
AutenticaciónAuthorization: Bearer YOUR_KEY
ID del modelouncensored
Llamadas a funcionessí: tools, tool_choice; la respuesta trae tool_calls, también en streaming; resultados como role: tool
Modo JSONresponse_format: {"type": "json_object"}
Parámetrostemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Salida máximahasta el resto de la ventana de 100.000 tokens; max_tokens opcional (sin límite aparte)
Ventana de contexto100.000 tokens (entrada + salida)
Streamingsí: server-sent events; el último fragmento incluye el uso de tokens
Tamaño de peticiónhasta 8 MB
Concurrencia8 peticiones a la vez por clave
CabecerasX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Límite de peticiones300 por minuto por clave
Facturacióncrédito prepago por uso real; errores y rechazos no se cobran
Prueba gratis$0,50 durante 7 días, sin tarjeta · Clave de prueba: 2 solicitudes paralelas, 60 por minuto; límites completos (8 y 300) tras la primera recarga
Precio$0,25 por 1M tokens de entrada · $1,00 por 1M de salida
Caducidadel crédito pagado no caduca, sin suscripción
Bono+5 % desde $50, +10 % desde $100
RecargaUSDT (TRC20) o USDC (Base), cualquier importe entero de $10 a $500
AccesoGoogle o correo y contraseña
Clavesuna clave activa por cuenta; una nueva reemplaza a la anterior
Contenidocontenido adulto permitido; se rechaza el contenido sexual con menores

Códigos de error

Los errores llegan como JSON con un type fijo; las peticiones fallidas o rechazadas no se cobran.

CódigoTipoSignificado
400bad_requestJSON inválido, mensajes vacíos, parámetro incorrecto o contexto demasiado largo
401missing_key · invalid_key · key_revokedfalta la clave, es incorrecta o fue reemplazada
402no_creditsin crédito: recarga y sigue al instante
403content_blockedcontenido sexual con menores: rechazado, no se cobra
404not_foundendpoint desconocido
413request_too_largecuerpo mayor de 8 MB
429rate_limited · concurrencymás de 300/min o 8 en paralelo: espera y reintenta
503upstream_busymodelo ocupado: reintenta en unos segundos

Preguntas y respuestas

¿Es gratis el modelo sin censura?

El modelo no es gratis, pero usa un sistema de crédito prepago de pago por uso. Las cuentas nuevas reciben $0.50 de crédito de prueba válido por 7 días. Los créditos pagados no caducan y puedes recargar desde $10.

¿Cuál es el tamaño de la ventana de contexto?

El modelo admite una ventana de contexto de 100.000 tokens, que incluye tanto el prompt de entrada como la generación. Esto permite interacciones de contexto largo y tareas de procesamiento de datos grandes.

¿La API admite llamadas a herramientas?

Sí, la API admite llamadas a herramientas y funciones. Puedes definir herramientas en tu petición y el modelo responderá con datos estructurados que tu aplicación puede ejecutar. Esto es compatible con los patrones estándar de los SDKs de OpenAI.

Tu clave está a un formulario de distancia

Crea una cuenta, copia la clave, cambia la URL base. Eso es toda la configuración.

Obtener clave de APILeer la documentación