Heretic LLMHeretic LLM: Documentazione API
Heretic LLM: Documentazione API
Inizia con l'API Heretic LLM in pochi minuti. Usa gli SDK OpenAI standard per inviare testo e ricevere risposte senza censura dal modello 'uncensored' senza gestire l'infrastruttura GPU.
URL base e Autenticazione
Per iniziare a usare l'API Heretic LLM, punta il tuo client compatibile con OpenAI al nostro URL base: https://api.hereticllm.com/v1. L'API utilizza l'autenticazione standard con token Bearer. Puoi generare una chiave API iscrivendoti con solo email e password nella pagina Ottieni chiave API. La chiave viene visualizzata immediatamente dopo l'iscrizione e può essere rigenerata in qualsiasi momento, invalidando quella precedente.
Imposta la variabile di ambiente OPENAI_API_KEY o passa la chiave direttamente nella configurazione del tuo client. Assicurati che il tuo URL base sia aggiornato all'endpoint Heretic. Questa configurazione ti permette di utilizzare gli SDK ufficiali OpenAI senza modifiche al codice, semplicemente cambiando l'URL base e la chiave.
Prima Richiesta
Esegui la tua prima richiesta all'endpoint delle chat completions. L'identificatore del modello è uncensored. Questo modello a pesi aperti è ottimizzato per rispondere senza rifiuti di contenuto per uso adulto legale, rendendolo ideale per codifica senza censura, scrittura creativa o ricerca. La finestra di contesto supporta fino a 100.000 token per prompt e completamento combinati.
Di seguito è riportato un esempio cURL di base per testare l'endpoint. Sostituisci YOUR_API_KEY con la tua chiave effettiva.
La risposta sarà un oggetto standard nel formato OpenAI contenente il testo generato.
curl https://api.hereticllm.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Integrazione SDK Python
Integra l'API nelle tue applicazioni Python utilizzando il pacchetto ufficiale openai. La libreria gestisce automaticamente la serializzazione JSON e lo streaming. Inizializza il client con la tua chiave API e l'URL base corretto. Poi, chiama chat.completions.create con l'ID del modello uncensored.
Questo approccio funziona perfettamente sia per flussi di lavoro sincroni che asincroni. Il modello risponde a prompt standard, chiamate di funzioni e parametri di streaming proprio come altri endpoint compatibili con OpenAI. Puoi passare prompt di sistema per guidare il comportamento del modello o usare messaggi utente per l'interazione diretta.
from openai import OpenAI
client = OpenAI(base_url="https://api.hereticllm.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Integrazione SDK Node.js
Per progetti JavaScript e TypeScript, usa il pacchetto npm openai. Configura il client con l'URL base Heretic e la tua chiave API. L'API supporta strutture di richiesta standard, incluse le definizioni di strumenti e la chiamata di funzioni.
Assicurati di gestire correttamente la risposta, specialmente quando si utilizzano pattern async/await. Il modello restituisce risposte testuali che possono essere elaborate direttamente nella logica della tua applicazione. Questa integrazione è ideale per costruire interfacce chat, agenti automatizzati o pipeline di elaborazione dati che richiedono capacità LLM senza censura.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.hereticllm.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Risposte in Streaming
Abilita le risposte in tempo reale attivando lo streaming nella tua richiesta API. Imposta il parametro stream su true. L'API restituirà uno stream di Server-Sent Events (SSE) contenente chunk di testo man mano che vengono generati. Questo riduce la latenza percepita e fornisce un'esperienza utente più fluida per le applicazioni chat.
Ogni chunk nello stream contiene una parte della risposta. Gestisci questi chunk in modo incrementale per aggiornare la tua UI in tempo reale. La funzionalità di streaming è pienamente compatibile con gli SDK OpenAI, quindi puoi utilizzare gli iteratori stream standard o i gestori di eventi per elaborare i dati in modo efficiente.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Limiti di Richiesta, Errori e Contesto
L'API impone un limite di 300 richieste al minuto per chiave e una dimensione del corpo della richiesta di 8 MB. Se superi il limite di richieste, riceverai un errore 429. Gli errori di autenticazione restituiscono uno status 401, indicando una chiave API non valida o mancante. Se il tuo credito prepagato è esaurito, l'API restituisce un errore 402, richiedendo una ricarica.
Il credito non scade mai e puoi ricaricare a partire da $10 utilizzando criptovalute (USDT o USDC), con crediti bonus per depositi più grandi. Il modello supporta una finestra di contesto di 100.000 token. Assicurati che i tuoi prompt e completamenti rientrino in questo limite. Per maggiori dettagli su prezzi e limiti, visita la pagina Prezzi.
Specifiche tecniche
Tutti i limiti e le funzioni reali dell'API in un unico posto: controllali prima di ricaricare.
| Voce | Valore |
|---|---|
| Formato | compatibile OpenAI: qualsiasi SDK OpenAI funziona cambiando base URL e chiave |
| Base URL | https://api.hereticllm.com/v1 |
| Endpoint | POST /v1/chat/completions · GET /v1/models |
| Autenticazione | Authorization: Bearer YOUR_KEY |
| ID modello | uncensored |
| Function calling | sì — tools, tool_choice; risposte con tool_calls anche in streaming; risultati come role: tool |
| Modalità JSON | response_format: {"type": "json_object"} |
| Parametri | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Output massimo | fino al resto della finestra di 100.000 token; max_tokens opzionale (nessun limite separato) |
| Finestra di contesto | 100.000 token (input + output) |
| Streaming | sì — server-sent events; l'ultimo blocco riporta l'uso dei token |
| Dimensione | fino a 8 MB per richiesta |
| Concorrenza | 8 richieste contemporanee per chiave |
| Header | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Limite di frequenza | 300 richieste al minuto per chiave |
| Fatturazione | credito prepagato in base all'uso reale; errori e rifiuti gratuiti |
| Prova gratuita | $0,50 per 7 giorni, senza carta · Chiave di prova: 2 richieste parallele, 60 al minuto; limiti completi (8 e 300) dopo la prima ricarica |
| Prezzo | $0,25 per 1M token in input · $1,00 per 1M in output |
| Scadenza | il credito pagato non scade, nessun abbonamento |
| Bonus | +5% da $50, +10% da $100 |
| Ricarica | USDT (TRC20) o USDC (Base), qualsiasi importo intero da $10 a $500 |
| Accesso | Google oppure e-mail e password |
| Chiavi | una chiave attiva per account; una nuova sostituisce la precedente |
| Contenuti | contenuti per adulti consentiti; rifiutati i contenuti sessuali con minori |
Codici di errore
Gli errori arrivano in JSON con un type fisso; le richieste fallite o rifiutate non si pagano.
| Codice | Tipo | Significato |
|---|---|---|
400 | bad_request | JSON non valido, messaggi vuoti, parametro errato o contesto troppo lungo |
401 | missing_key · invalid_key · key_revoked | chiave mancante, errata o sostituita |
402 | no_credit | credito esaurito — ricarica e riparti subito |
403 | content_blocked | contenuti sessuali con minori — rifiutato, non addebitato |
404 | not_found | endpoint sconosciuto |
413 | request_too_large | corpo oltre 8 MB |
429 | rate_limited · concurrency | oltre 300/min o 8 in parallelo — attendi e riprova |
503 | upstream_busy | modello occupato — riprova tra pochi secondi |
Domande e risposte
Il modello senza censura è gratuito?
Il modello non è gratuito ma utilizza un sistema di credito prepagato a consumo. I nuovi account ricevono $0,50 di credito di prova valido per 7 giorni. I crediti pagati non scadono e puoi ricaricare a partire da $10.
Qual è la dimensione della finestra di contesto?
Il modello supporta una finestra di contesto di 100.000 token, che include sia il prompt di input che il completamento generato. Questo permette interazioni a lungo contesto e attività di elaborazione dati di grandi dimensioni.
L'API supporta la chiamata di funzioni?
Sì, l'API supporta la chiamata di strumenti e funzioni. Puoi definire gli strumenti nella tua richiesta e il modello risponderà con dati strutturati che possono essere eseguiti dalla tua applicazione. Questo è compatibile con i pattern standard degli SDK OpenAI.
La tua chiave è a un modulo di distanza
Crea un account, copia la chiave, cambia l'URL base. È tutta qui la configurazione.