Heretic LLMHeretic LLM: Documentación de API
Heretic LLM: Documentación de API
Comienza con la API de Heretic LLM en minutos. Usa los SDKs oficiales de OpenAI para enviar texto y recibir respuestas sin censura del modelo 'uncensored' sin gestionar infraestructura GPU.
URL base y autenticación
Para comenzar a usar la API de Heretic LLM, apunta tu cliente compatible con OpenAI a nuestra URL base: https://api.hereticllm.com/v1. La API usa autenticación estándar con token Bearer. Puedes generar una clave de API registrándote solo con correo y contraseña en la página Obtener clave de API. La clave se muestra inmediatamente después del registro y se puede regenerar en cualquier momento, lo que invalida la clave anterior.
Establece la variable de entorno OPENAI_API_KEY o pasa la clave directamente en la configuración de tu cliente. Asegúrate de actualizar la URL base al endpoint de Heretic. Esta configuración te permite usar los SDKs oficiales de OpenAI sin cambios de código, simplemente cambiando la URL base y la clave.
Primera petición
Realiza tu primera petición al endpoint de completados de chat. El identificador del modelo es uncensored. Este modelo de pesos abiertos está ajustado para responder sin rechazos de contenido para uso adulto legal, lo que lo hace ideal para codificación sin censura, escritura creativa o investigación. La ventana de contexto admite hasta 100.000 tokens para prompt y generación combinados.
A continuación hay un ejemplo básico de cURL para probar el endpoint. Reemplaza YOUR_API_KEY con tu clave real.
La respuesta será un objeto estándar en formato OpenAI que contiene el texto generado.
curl https://api.hereticllm.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Integración con SDK Python
Integra la API en tus aplicaciones Python usando el paquete oficial openai. La biblioteca maneja la serialización JSON y el streaming automáticamente. Inicializa el cliente con tu clave de API y la URL base correcta. Luego, llama a chat.completions.create con el ID del modelo uncensored.
Este enfoque funciona perfectamente para flujos de trabajo sincrónicos y asincrónicos. El modelo responde a prompts estándar, llamadas a funciones y parámetros de streaming igual que otros endpoints compatibles con OpenAI. Puedes pasar prompts de sistema para guiar el comportamiento del modelo o usar mensajes de usuario para interacción directa.
from openai import OpenAI
client = OpenAI(base_url="https://api.hereticllm.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Integración con SDK Node.js
Para proyectos en JavaScript y TypeScript, usa el paquete npm openai. Configura el cliente con la URL base de Heretic y tu clave de API. La API admite estructuras de petición estándar, incluidas definiciones de herramientas y llamadas a funciones.
Asegúrate de manejar la respuesta correctamente, especialmente al usar patrones async/await. El modelo devuelve respuestas de texto que se pueden procesar directamente en la lógica de tu aplicación. Esta integración es ideal para construir interfaces de chat, agentes automatizados o tuberías de procesamiento de datos que requieran capacidades de LLM sin censura.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.hereticllm.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Respuestas en streaming
Habilita respuestas en tiempo real activando el streaming en tu petición a la API. Establece el parámetro stream en true. La API devolverá un flujo de Eventos Enviados por Servidor (SSE) que contiene fragmentos de texto a medida que se generan. Esto reduce la latencia percibida y proporciona una experiencia de usuario más fluida para aplicaciones de chat.
Cada fragmento en el flujo contiene una parte de la respuesta. Maneja estos fragmentos de forma incremental para actualizar tu interfaz de usuario en tiempo real. La función de streaming es totalmente compatible con los SDKs de OpenAI, por lo que puedes usar los iteradores estándar stream o los listeners de eventos para procesar los datos de manera eficiente.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Límites, errores y contexto
La API impone un límite de 300 peticiones por minuto por clave y un tamaño de cuerpo de petición de 8 MB. Si excedes el límite de peticiones, recibirás un error 429. Los errores de autenticación devuelven un estado 401, indicando una clave de API inválida o faltante. Si tu crédito prepago se agota, la API devuelve un error 402, requiriendo una recarga.
El crédito no caduca y puedes recargar desde $10 usando criptomonedas (USDT o USDC), con créditos bonus para depósitos más grandes. El modelo admite una ventana de contexto de 100.000 tokens. Asegúrate de que tus prompts y generaciones se ajusten a este límite. Para más detalles sobre precios y límites, visita la página de Precios.
Especificaciones técnicas
Todos los límites y funciones reales de la API en un solo lugar: revísalos antes de recargar.
| Elemento | Valor |
|---|---|
| Formato | compatible con OpenAI: cualquier SDK de OpenAI funciona cambiando la base URL y la clave |
| Base URL | https://api.hereticllm.com/v1 |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Autenticación | Authorization: Bearer YOUR_KEY |
| ID del modelo | uncensored |
| Llamadas a funciones | sí: tools, tool_choice; la respuesta trae tool_calls, también en streaming; resultados como role: tool |
| Modo JSON | response_format: {"type": "json_object"} |
| Parámetros | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Salida máxima | hasta el resto de la ventana de 100.000 tokens; max_tokens opcional (sin límite aparte) |
| Ventana de contexto | 100.000 tokens (entrada + salida) |
| Streaming | sí: server-sent events; el último fragmento incluye el uso de tokens |
| Tamaño de petición | hasta 8 MB |
| Concurrencia | 8 peticiones a la vez por clave |
| Cabeceras | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Límite de peticiones | 300 por minuto por clave |
| Facturación | crédito prepago por uso real; errores y rechazos no se cobran |
| Prueba gratis | $0,50 durante 7 días, sin tarjeta · Clave de prueba: 2 solicitudes paralelas, 60 por minuto; límites completos (8 y 300) tras la primera recarga |
| Precio | $0,25 por 1M tokens de entrada · $1,00 por 1M de salida |
| Caducidad | el crédito pagado no caduca, sin suscripción |
| Bono | +5 % desde $50, +10 % desde $100 |
| Recarga | USDT (TRC20) o USDC (Base), cualquier importe entero de $10 a $500 |
| Acceso | Google o correo y contraseña |
| Claves | una clave activa por cuenta; una nueva reemplaza a la anterior |
| Contenido | contenido adulto permitido; se rechaza el contenido sexual con menores |
Códigos de error
Los errores llegan como JSON con un type fijo; las peticiones fallidas o rechazadas no se cobran.
| Código | Tipo | Significado |
|---|---|---|
400 | bad_request | JSON inválido, mensajes vacíos, parámetro incorrecto o contexto demasiado largo |
401 | missing_key · invalid_key · key_revoked | falta la clave, es incorrecta o fue reemplazada |
402 | no_credit | sin crédito: recarga y sigue al instante |
403 | content_blocked | contenido sexual con menores: rechazado, no se cobra |
404 | not_found | endpoint desconocido |
413 | request_too_large | cuerpo mayor de 8 MB |
429 | rate_limited · concurrency | más de 300/min o 8 en paralelo: espera y reintenta |
503 | upstream_busy | modelo ocupado: reintenta en unos segundos |
Preguntas y respuestas
¿Es gratis el modelo sin censura?
El modelo no es gratis, pero usa un sistema de crédito prepago de pago por uso. Las cuentas nuevas reciben $0.50 de crédito de prueba válido por 7 días. Los créditos pagados no caducan y puedes recargar desde $10.
¿Cuál es el tamaño de la ventana de contexto?
El modelo admite una ventana de contexto de 100.000 tokens, que incluye tanto el prompt de entrada como la generación. Esto permite interacciones de contexto largo y tareas de procesamiento de datos grandes.
¿La API admite llamadas a herramientas?
Sí, la API admite llamadas a herramientas y funciones. Puedes definir herramientas en tu petición y el modelo responderá con datos estructurados que tu aplicación puede ejecutar. Esto es compatible con los patrones estándar de los SDKs de OpenAI.
Tu clave está a un formulario de distancia
Crea una cuenta, copia la clave, cambia la URL base. Eso es toda la configuración.