Heretic LLMHeretic LLM : Documentation API
Heretic LLM : Documentation API
Commencez avec l'API Heretic LLM en quelques minutes. Utilisez les SDK OpenAI standard pour envoyer du texte et recevoir des réponses sans censure du modèle 'uncensored' sans gérer l'infrastructure GPU.
URL de base et authentification
Pour commencer à utiliser l'API Heretic LLM, pointez votre client compatible OpenAI vers notre URL de base : https://api.hereticllm.com/v1. L'API utilise l'authentification standard par token Bearer. Vous pouvez générer une clé API en vous inscrivant avec simplement une adresse e-mail et un mot de passe sur la page Obtenir la clé API. La clé s'affiche immédiatement après l'inscription et peut être régénérée à tout moment, ce qui invalide la clé précédente.
Définissez la variable d'environnement OPENAI_API_KEY ou passez la clé directement dans la configuration de votre client. Assurez-vous que votre URL de base est mise à jour vers l'endpoint Heretic. Cette configuration vous permet d'utiliser les SDK OpenAI officiels sans aucun changement de code, en remplaçant simplement l'URL de base et la clé.
Première requête
Effectuez votre première requête vers l'endpoint de complétions de chat. L'identifiant du modèle est uncensored. Ce modèle à poids ouverts est ajusté pour répondre sans refus de contenu pour un usage adulte légal, ce qui le rend idéal pour le codage sans censure, l'écriture créative ou la recherche. La fenêtre de contexte prend en charge jusqu'à 100 000 tokens pour le prompt et la complétion combinés.
Voici un exemple cURL de base pour tester l'endpoint. Remplacez YOUR_API_KEY par votre clé réelle.
La réponse sera un objet au format standard OpenAI contenant le texte généré.
curl https://api.hereticllm.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Intégration SDK Python
Intégrez l'API dans vos applications Python en utilisant le package officiel openai. La bibliothèque gère automatiquement la sérialisation JSON et le streaming. Initialisez le client avec votre clé API et l'URL de base correcte. Ensuite, appelez chat.completions.create avec l'ID de modèle uncensored.
Cette approche fonctionne sans problème pour les flux de travail synchrones et asynchrones. Le modèle répond aux prompts standard, à l'appel de fonctions et aux paramètres de streaming tout comme les autres endpoints compatibles OpenAI. Vous pouvez passer des prompts système pour guider le comportement du modèle ou utiliser des messages utilisateur pour une interaction directe.
from openai import OpenAI
client = OpenAI(base_url="https://api.hereticllm.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Intégration SDK Node.js
Pour les projets JavaScript et TypeScript, utilisez le package npm openai. Configurez le client avec l'URL de base Heretic et votre clé API. L'API prend en charge les structures de requête standard, y compris les définitions d'outils et l'appel de fonctions.
Assurez-vous de gérer correctement la réponse, en particulier lors de l'utilisation des modèles async/await. Le modèle renvoie des réponses textuelles qui peuvent être traitées directement dans la logique de votre application. Cette intégration est idéale pour créer des interfaces de chat, des agents automatisés ou des pipelines de traitement de données nécessitant des capacités LLM sans censure.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.hereticllm.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Réponses en streaming
Activez les réponses en temps réel en activant le streaming dans votre requête API. Définissez le paramètre stream sur true. L'API renverra un flux Server-Sent Events (SSE) contenant des chunks de texte au fur et à mesure de leur génération. Cela réduit la latence perçue et offre une expérience utilisateur plus fluide pour les applications de chat.
Chaque chunk du flux contient une partie de la réponse. Gérez ces chunks de manière incrémentale pour mettre à jour votre interface utilisateur en temps réel. La fonctionnalité de streaming est entièrement compatible avec les SDK OpenAI, vous pouvez donc utiliser les itérateurs stream ou les écouteurs d'événements standard pour traiter les données efficacement.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Limites de débit, erreurs et contexte
L'API applique une limite de 300 requêtes par minute par clé et une taille de corps de requête de 8 Mo. Si vous dépassez la limite de débit, vous recevrez une erreur 429. Les erreurs d'authentification renvoient un statut 401, indiquant une clé API invalide ou manquante. Si votre crédit prépayé est épuisé, l'API renvoie une erreur 402, nécessitant un rechargement.
Le crédit n'expire jamais, et vous pouvez recharger à partir de 10 $ en utilisant des cryptomonnaies (USDT ou USDC), avec des crédits bonus pour les dépôts plus importants. Le modèle prend en charge une fenêtre de contexte de 100 000 tokens. Assurez-vous que vos prompts et complétions tiennent dans cette limite. Pour plus de détails sur les tarifs et les limites, visitez la page Tarifs.
Caractéristiques techniques
Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.
| Élément | Valeur |
|---|---|
| Format | compatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé |
| Base URL | https://api.hereticllm.com/v1 |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Authentification | Authorization: Bearer YOUR_KEY |
| ID du modèle | uncensored |
| Appel de fonctions | oui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool |
| Mode JSON | response_format: {"type": "json_object"} |
| Paramètres | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Sortie max. | jusqu'au reste de la fenêtre de 100 000 tokens ; max_tokens optionnel (pas de plafond distinct) |
| Fenêtre de contexte | 100 000 tokens (entrée + sortie) |
| Streaming | oui — server-sent events ; le dernier bloc contient l'usage des tokens |
| Taille | jusqu'à 8 Mo par requête |
| Concurrence | 8 requêtes simultanées par clé |
| En-têtes | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Limite de débit | 300 requêtes par minute et par clé |
| Facturation | crédit prépayé selon l'usage réel ; erreurs et refus gratuits |
| Essai gratuit | 0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge |
| Prix | 0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie |
| Validité | le crédit payé n'expire jamais, sans abonnement |
| Bonus | +5 % dès 50 $, +10 % dès 100 $ |
| Recharge | USDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $ |
| Connexion | Google ou e-mail et mot de passe |
| Clés | une clé active par compte ; une nouvelle remplace l'ancienne |
| Contenu | contenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé |
Codes d'erreur
Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.
| Code | Type | Signification |
|---|---|---|
400 | bad_request | JSON invalide, messages vides, mauvais paramètre ou contexte trop long |
401 | missing_key · invalid_key · key_revoked | clé absente, erronée ou remplacée |
402 | no_credit | plus de crédit — rechargez, la reprise est immédiate |
403 | content_blocked | contenu sexuel impliquant des mineurs — refusé, non facturé |
404 | not_found | endpoint inconnu |
413 | request_too_large | corps supérieur à 8 Mo |
429 | rate_limited · concurrency | au-delà de 300/min ou 8 en parallèle — patientez |
503 | upstream_busy | modèle occupé — réessayez dans quelques secondes |
Questions et réponses
Le modèle sans censure est-il gratuit ?
Le modèle n'est pas gratuit mais utilise un système de crédit prépayé en paiement à l'usage. Les nouveaux comptes reçoivent 0,50 $ de crédit d'essai gratuit valable 7 jours. Les crédits payés n'expirent jamais et vous pouvez recharger à partir de 10 $.
Quelle est la taille de la fenêtre de contexte ?
Le modèle prend en charge une fenêtre de contexte de 100 000 tokens, qui inclut à la fois le prompt d'entrée et la complétion générée. Cela permet des interactions à long contexte et des tâches de traitement de données volumineuses.
L'API prend-elle en charge l'appel de fonctions ?
Oui, l'API prend en charge l'appel de fonctions et d'outils. Vous pouvez définir des outils dans votre requête, et le modèle répondra avec des données structurées que votre application pourra exécuter. Cela est compatible avec les modèles standard des SDK OpenAI.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, changez l'URL de base. C'est toute la configuration.