FR ▾
Obtenir une clé API

Heretic LLMHeretic LLM : Documentation API

Heretic LLM : Documentation API

Commencez avec l'API Heretic LLM en quelques minutes. Utilisez les SDK OpenAI standard pour envoyer du texte et recevoir des réponses sans censure du modèle 'uncensored' sans gérer l'infrastructure GPU.

URL de base et authentification

Pour commencer à utiliser l'API Heretic LLM, pointez votre client compatible OpenAI vers notre URL de base : https://api.hereticllm.com/v1. L'API utilise l'authentification standard par token Bearer. Vous pouvez générer une clé API en vous inscrivant avec simplement une adresse e-mail et un mot de passe sur la page Obtenir la clé API. La clé s'affiche immédiatement après l'inscription et peut être régénérée à tout moment, ce qui invalide la clé précédente.

Définissez la variable d'environnement OPENAI_API_KEY ou passez la clé directement dans la configuration de votre client. Assurez-vous que votre URL de base est mise à jour vers l'endpoint Heretic. Cette configuration vous permet d'utiliser les SDK OpenAI officiels sans aucun changement de code, en remplaçant simplement l'URL de base et la clé.

Première requête

Effectuez votre première requête vers l'endpoint de complétions de chat. L'identifiant du modèle est uncensored. Ce modèle à poids ouverts est ajusté pour répondre sans refus de contenu pour un usage adulte légal, ce qui le rend idéal pour le codage sans censure, l'écriture créative ou la recherche. La fenêtre de contexte prend en charge jusqu'à 100 000 tokens pour le prompt et la complétion combinés.

Voici un exemple cURL de base pour tester l'endpoint. Remplacez YOUR_API_KEY par votre clé réelle.

La réponse sera un objet au format standard OpenAI contenant le texte généré.

curl https://api.hereticllm.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Intégration SDK Python

Intégrez l'API dans vos applications Python en utilisant le package officiel openai. La bibliothèque gère automatiquement la sérialisation JSON et le streaming. Initialisez le client avec votre clé API et l'URL de base correcte. Ensuite, appelez chat.completions.create avec l'ID de modèle uncensored.

Cette approche fonctionne sans problème pour les flux de travail synchrones et asynchrones. Le modèle répond aux prompts standard, à l'appel de fonctions et aux paramètres de streaming tout comme les autres endpoints compatibles OpenAI. Vous pouvez passer des prompts système pour guider le comportement du modèle ou utiliser des messages utilisateur pour une interaction directe.

from openai import OpenAI

client = OpenAI(base_url="https://api.hereticllm.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Intégration SDK Node.js

Pour les projets JavaScript et TypeScript, utilisez le package npm openai. Configurez le client avec l'URL de base Heretic et votre clé API. L'API prend en charge les structures de requête standard, y compris les définitions d'outils et l'appel de fonctions.

Assurez-vous de gérer correctement la réponse, en particulier lors de l'utilisation des modèles async/await. Le modèle renvoie des réponses textuelles qui peuvent être traitées directement dans la logique de votre application. Cette intégration est idéale pour créer des interfaces de chat, des agents automatisés ou des pipelines de traitement de données nécessitant des capacités LLM sans censure.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.hereticllm.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Réponses en streaming

Activez les réponses en temps réel en activant le streaming dans votre requête API. Définissez le paramètre stream sur true. L'API renverra un flux Server-Sent Events (SSE) contenant des chunks de texte au fur et à mesure de leur génération. Cela réduit la latence perçue et offre une expérience utilisateur plus fluide pour les applications de chat.

Chaque chunk du flux contient une partie de la réponse. Gérez ces chunks de manière incrémentale pour mettre à jour votre interface utilisateur en temps réel. La fonctionnalité de streaming est entièrement compatible avec les SDK OpenAI, vous pouvez donc utiliser les itérateurs stream ou les écouteurs d'événements standard pour traiter les données efficacement.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Limites de débit, erreurs et contexte

L'API applique une limite de 300 requêtes par minute par clé et une taille de corps de requête de 8 Mo. Si vous dépassez la limite de débit, vous recevrez une erreur 429. Les erreurs d'authentification renvoient un statut 401, indiquant une clé API invalide ou manquante. Si votre crédit prépayé est épuisé, l'API renvoie une erreur 402, nécessitant un rechargement.

Le crédit n'expire jamais, et vous pouvez recharger à partir de 10 $ en utilisant des cryptomonnaies (USDT ou USDC), avec des crédits bonus pour les dépôts plus importants. Le modèle prend en charge une fenêtre de contexte de 100 000 tokens. Assurez-vous que vos prompts et complétions tiennent dans cette limite. Pour plus de détails sur les tarifs et les limites, visitez la page Tarifs.

Caractéristiques techniques

Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.

ÉlémentValeur
Formatcompatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé
Base URLhttps://api.hereticllm.com/v1
EndpointsPOST /v1/chat/completions · GET /v1/models
AuthentificationAuthorization: Bearer YOUR_KEY
ID du modèleuncensored
Appel de fonctionsoui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool
Mode JSONresponse_format: {"type": "json_object"}
Paramètrestemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Sortie max.jusqu'au reste de la fenêtre de 100 000 tokens ; max_tokens optionnel (pas de plafond distinct)
Fenêtre de contexte100 000 tokens (entrée + sortie)
Streamingoui — server-sent events ; le dernier bloc contient l'usage des tokens
Taillejusqu'à 8 Mo par requête
Concurrence8 requêtes simultanées par clé
En-têtesX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Limite de débit300 requêtes par minute et par clé
Facturationcrédit prépayé selon l'usage réel ; erreurs et refus gratuits
Essai gratuit0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge
Prix0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie
Validitéle crédit payé n'expire jamais, sans abonnement
Bonus+5 % dès 50 $, +10 % dès 100 $
RechargeUSDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $
ConnexionGoogle ou e-mail et mot de passe
Clésune clé active par compte ; une nouvelle remplace l'ancienne
Contenucontenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé

Codes d'erreur

Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.

CodeTypeSignification
400bad_requestJSON invalide, messages vides, mauvais paramètre ou contexte trop long
401missing_key · invalid_key · key_revokedclé absente, erronée ou remplacée
402no_creditplus de crédit — rechargez, la reprise est immédiate
403content_blockedcontenu sexuel impliquant des mineurs — refusé, non facturé
404not_foundendpoint inconnu
413request_too_largecorps supérieur à 8 Mo
429rate_limited · concurrencyau-delà de 300/min ou 8 en parallèle — patientez
503upstream_busymodèle occupé — réessayez dans quelques secondes

Questions et réponses

Le modèle sans censure est-il gratuit ?

Le modèle n'est pas gratuit mais utilise un système de crédit prépayé en paiement à l'usage. Les nouveaux comptes reçoivent 0,50 $ de crédit d'essai gratuit valable 7 jours. Les crédits payés n'expirent jamais et vous pouvez recharger à partir de 10 $.

Quelle est la taille de la fenêtre de contexte ?

Le modèle prend en charge une fenêtre de contexte de 100 000 tokens, qui inclut à la fois le prompt d'entrée et la complétion générée. Cela permet des interactions à long contexte et des tâches de traitement de données volumineuses.

L'API prend-elle en charge l'appel de fonctions ?

Oui, l'API prend en charge l'appel de fonctions et d'outils. Vous pouvez définir des outils dans votre requête, et le modèle répondra avec des données structurées que votre application pourra exécuter. Cela est compatible avec les modèles standard des SDK OpenAI.

Votre clé est à un formulaire de vous

Créez un compte, copiez la clé, changez l'URL de base. C'est toute la configuration.

Obtenir la clé APILire la documentation