IT ▾
Ottieni la chiave API

Heretic LLMHeretic LLM: Documentazione API

Heretic LLM: Documentazione API

Inizia con l'API Heretic LLM in pochi minuti. Usa gli SDK OpenAI standard per inviare testo e ricevere risposte senza censura dal modello 'uncensored' senza gestire l'infrastruttura GPU.

URL base e Autenticazione

Per iniziare a usare l'API Heretic LLM, punta il tuo client compatibile con OpenAI al nostro URL base: https://api.hereticllm.com/v1. L'API utilizza l'autenticazione standard con token Bearer. Puoi generare una chiave API iscrivendoti con solo email e password nella pagina Ottieni chiave API. La chiave viene visualizzata immediatamente dopo l'iscrizione e può essere rigenerata in qualsiasi momento, invalidando quella precedente.

Imposta la variabile di ambiente OPENAI_API_KEY o passa la chiave direttamente nella configurazione del tuo client. Assicurati che il tuo URL base sia aggiornato all'endpoint Heretic. Questa configurazione ti permette di utilizzare gli SDK ufficiali OpenAI senza modifiche al codice, semplicemente cambiando l'URL base e la chiave.

Prima Richiesta

Esegui la tua prima richiesta all'endpoint delle chat completions. L'identificatore del modello è uncensored. Questo modello a pesi aperti è ottimizzato per rispondere senza rifiuti di contenuto per uso adulto legale, rendendolo ideale per codifica senza censura, scrittura creativa o ricerca. La finestra di contesto supporta fino a 100.000 token per prompt e completamento combinati.

Di seguito è riportato un esempio cURL di base per testare l'endpoint. Sostituisci YOUR_API_KEY con la tua chiave effettiva.

La risposta sarà un oggetto standard nel formato OpenAI contenente il testo generato.

curl https://api.hereticllm.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Integrazione SDK Python

Integra l'API nelle tue applicazioni Python utilizzando il pacchetto ufficiale openai. La libreria gestisce automaticamente la serializzazione JSON e lo streaming. Inizializza il client con la tua chiave API e l'URL base corretto. Poi, chiama chat.completions.create con l'ID del modello uncensored.

Questo approccio funziona perfettamente sia per flussi di lavoro sincroni che asincroni. Il modello risponde a prompt standard, chiamate di funzioni e parametri di streaming proprio come altri endpoint compatibili con OpenAI. Puoi passare prompt di sistema per guidare il comportamento del modello o usare messaggi utente per l'interazione diretta.

from openai import OpenAI

client = OpenAI(base_url="https://api.hereticllm.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Integrazione SDK Node.js

Per progetti JavaScript e TypeScript, usa il pacchetto npm openai. Configura il client con l'URL base Heretic e la tua chiave API. L'API supporta strutture di richiesta standard, incluse le definizioni di strumenti e la chiamata di funzioni.

Assicurati di gestire correttamente la risposta, specialmente quando si utilizzano pattern async/await. Il modello restituisce risposte testuali che possono essere elaborate direttamente nella logica della tua applicazione. Questa integrazione è ideale per costruire interfacce chat, agenti automatizzati o pipeline di elaborazione dati che richiedono capacità LLM senza censura.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.hereticllm.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Risposte in Streaming

Abilita le risposte in tempo reale attivando lo streaming nella tua richiesta API. Imposta il parametro stream su true. L'API restituirà uno stream di Server-Sent Events (SSE) contenente chunk di testo man mano che vengono generati. Questo riduce la latenza percepita e fornisce un'esperienza utente più fluida per le applicazioni chat.

Ogni chunk nello stream contiene una parte della risposta. Gestisci questi chunk in modo incrementale per aggiornare la tua UI in tempo reale. La funzionalità di streaming è pienamente compatibile con gli SDK OpenAI, quindi puoi utilizzare gli iteratori stream standard o i gestori di eventi per elaborare i dati in modo efficiente.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Limiti di Richiesta, Errori e Contesto

L'API impone un limite di 300 richieste al minuto per chiave e una dimensione del corpo della richiesta di 8 MB. Se superi il limite di richieste, riceverai un errore 429. Gli errori di autenticazione restituiscono uno status 401, indicando una chiave API non valida o mancante. Se il tuo credito prepagato è esaurito, l'API restituisce un errore 402, richiedendo una ricarica.

Il credito non scade mai e puoi ricaricare a partire da $10 utilizzando criptovalute (USDT o USDC), con crediti bonus per depositi più grandi. Il modello supporta una finestra di contesto di 100.000 token. Assicurati che i tuoi prompt e completamenti rientrino in questo limite. Per maggiori dettagli su prezzi e limiti, visita la pagina Prezzi.

Specifiche tecniche

Tutti i limiti e le funzioni reali dell'API in un unico posto: controllali prima di ricaricare.

VoceValore
Formatocompatibile OpenAI: qualsiasi SDK OpenAI funziona cambiando base URL e chiave
Base URLhttps://api.hereticllm.com/v1
EndpointPOST /v1/chat/completions · GET /v1/models
AutenticazioneAuthorization: Bearer YOUR_KEY
ID modellouncensored
Function callingsì — tools, tool_choice; risposte con tool_calls anche in streaming; risultati come role: tool
Modalità JSONresponse_format: {"type": "json_object"}
Parametritemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Output massimofino al resto della finestra di 100.000 token; max_tokens opzionale (nessun limite separato)
Finestra di contesto100.000 token (input + output)
Streamingsì — server-sent events; l'ultimo blocco riporta l'uso dei token
Dimensionefino a 8 MB per richiesta
Concorrenza8 richieste contemporanee per chiave
HeaderX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Limite di frequenza300 richieste al minuto per chiave
Fatturazionecredito prepagato in base all'uso reale; errori e rifiuti gratuiti
Prova gratuita$0,50 per 7 giorni, senza carta · Chiave di prova: 2 richieste parallele, 60 al minuto; limiti completi (8 e 300) dopo la prima ricarica
Prezzo$0,25 per 1M token in input · $1,00 per 1M in output
Scadenzail credito pagato non scade, nessun abbonamento
Bonus+5% da $50, +10% da $100
RicaricaUSDT (TRC20) o USDC (Base), qualsiasi importo intero da $10 a $500
AccessoGoogle oppure e-mail e password
Chiaviuna chiave attiva per account; una nuova sostituisce la precedente
Contenuticontenuti per adulti consentiti; rifiutati i contenuti sessuali con minori

Codici di errore

Gli errori arrivano in JSON con un type fisso; le richieste fallite o rifiutate non si pagano.

CodiceTipoSignificato
400bad_requestJSON non valido, messaggi vuoti, parametro errato o contesto troppo lungo
401missing_key · invalid_key · key_revokedchiave mancante, errata o sostituita
402no_creditcredito esaurito — ricarica e riparti subito
403content_blockedcontenuti sessuali con minori — rifiutato, non addebitato
404not_foundendpoint sconosciuto
413request_too_largecorpo oltre 8 MB
429rate_limited · concurrencyoltre 300/min o 8 in parallelo — attendi e riprova
503upstream_busymodello occupato — riprova tra pochi secondi

Domande e risposte

Il modello senza censura è gratuito?

Il modello non è gratuito ma utilizza un sistema di credito prepagato a consumo. I nuovi account ricevono $0,50 di credito di prova valido per 7 giorni. I crediti pagati non scadono e puoi ricaricare a partire da $10.

Qual è la dimensione della finestra di contesto?

Il modello supporta una finestra di contesto di 100.000 token, che include sia il prompt di input che il completamento generato. Questo permette interazioni a lungo contesto e attività di elaborazione dati di grandi dimensioni.

L'API supporta la chiamata di funzioni?

Sì, l'API supporta la chiamata di strumenti e funzioni. Puoi definire gli strumenti nella tua richiesta e il modello risponderà con dati strutturati che possono essere eseguiti dalla tua applicazione. Questo è compatibile con i pattern standard degli SDK OpenAI.

La tua chiave è a un modulo di distanza

Crea un account, copia la chiave, cambia l'URL base. È tutta qui la configurazione.

Ottieni chiave APILeggi la documentazione