DE ▾
API-Schlüssel erhalten

Heretic LLMHeretic LLM: API-Dokumentation

Heretic LLM: API-Dokumentation

Starte in wenigen Minuten mit der Heretic LLM API. Nutze die Standard-OpenAI-SDKs, um Text zu senden und unzensierte Antworten vom 'uncensored'-Modell zu erhalten, ohne GPU-Infrastruktur verwalten zu müssen.

Basis-URL und Authentifizierung

Um die Heretic LLM API zu nutzen, richte deinen OpenAI-kompatiblen Client auf unsere Basis-URL: https://api.hereticllm.com/v1. Die API verwendet die Standard-Bearer-Token-Authentifizierung. Du kannst einen API-Schlüssel generieren, indem du dich einfach mit E-Mail und Passwort registrierst. Der Schlüssel wird sofort nach der Registrierung angezeigt und kann jederzeit neu generiert werden, wodurch der vorherige Schlüssel ungültig wird.

Setze die Umgebungsvariable OPENAI_API_KEY oder gib den Schlüssel direkt in deiner Client-Konfiguration an. Stelle sicher, dass deine Basis-URL auf den Heretic-Endpunkt aktualisiert ist. Diese Einrichtung ermöglicht es dir, die offiziellen OpenAI-SDKs ohne Codeänderungen zu nutzen, indem du einfach die Basis-URL und den Schlüssel austauschst.

Erste Anfrage

Stelle deine erste Anfrage an den Chat-Vervollständigungs-Endpunkt. Die Modell-ID ist uncensored. Dieses Open-Weight-Modell ist darauf ausgelegt, ohne Inhaltsablehnungen für die legale erwachsene Nutzung zu antworten, was es ideal für unzensiertes Coding, kreatives Schreiben oder Forschung macht. Das Kontextfenster unterstützt bis zu 100.000 Token für Prompt und Vervollständigung zusammen.

Unten findest du ein einfaches cURL-Beispiel, um den Endpunkt zu testen. Ersetze YOUR_API_KEY durch deinen tatsächlichen Schlüssel.

Die Antwort ist ein Standard-OpenAI-Format-Objekt, das den generierten Text enthält.

curl https://api.hereticllm.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Python SDK-Integration

Integriere die API in deine Python-Anwendungen mit dem offiziellen openai-Paket. Die Bibliothek verarbeitet die JSON-Serialisierung und das Streaming automatisch. Initialisiere den Client mit deinem API-Schlüssel und der korrekten Basis-URL. Rufe dann chat.completions.create mit der Modell-ID uncensored auf.

Dieser Ansatz funktioniert nahtlos für sowohl synchrone als auch asynchrone Workflows. Das Modell reagiert auf Standard-Prompts, Function Calling und Streaming-Parameter wie andere OpenAI-kompatible Endpunkte. Du kannst System-Prompts übergeben, um das Verhalten des Modells zu steuern, oder Benutzernachrichten für direkte Interaktionen verwenden.

from openai import OpenAI

client = OpenAI(base_url="https://api.hereticllm.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Node.js SDK-Integration

Für JavaScript- und TypeScript-Projekte verwende das openai npm-Paket. Konfiguriere den Client mit der Heretic-Basis-URL und deinem API-Schlüssel. Die API unterstützt Standard-Anfragestrukturen, einschließlich Tool-Definitionen und Function Calling.

Stelle sicher, dass du die Antwort korrekt verarbeitest, insbesondere bei der Verwendung von async/await-Mustern. Das Modell gibt Textantworten zurück, die direkt in deiner Anwendungslogik verarbeitet werden können. Diese Integration ist ideal für den Aufbau von Chat-Schnittstellen, automatisierten Agenten oder Datenverarbeitungspipelines, die unzensierte LLM-Fähigkeiten erfordern.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.hereticllm.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Streaming-Antworten

Aktiviere Echtzeit-Antworten, indem du das Streaming in deiner API-Anfrage aktivierst. Setze den Parameter stream auf true. Die API gibt einen Server-Sent Events (SSE)-Stream zurück, der Textabschnitte enthält, sobald sie generiert werden. Dies reduziert die wahrgenommene Latenz und bietet ein flüssigeres Benutzererlebnis für Chat-Anwendungen.

Jeder Abschnitt im Stream enthält einen Teil der Antwort. Verarbeite diese Abschnitte inkrementell, um deine Benutzeroberfläche in Echtzeit zu aktualisieren. Die Streaming-Funktion ist vollständig mit den OpenAI-SDKs kompatibel, sodass du die Standard-stream-Iteratoren oder Event-Listener verwenden kannst, um die Daten effizient zu verarbeiten.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Ratenlimits, Fehler und Kontext

Die API erzwingt ein Limit von 300 Anfragen pro Minute pro Schlüssel und eine Anforderungskörpergröße von 8 MB. Wenn du das Ratenlimit überschreitest, erhältst du einen 429-Fehler. Authentifizierungsfehler geben einen 401-Status zurück, der einen ungültigen oder fehlenden API-Schlüssel anzeigt. Wenn dein Prepaid-Guthaben aufgebraucht ist, gibt die API einen 402-Fehler zurück, der eine Aufladung erfordert.

Guthaben verfällt nie, und du kannst ab $10 mit Krypto (USDT oder USDC) aufladen, wobei größere Einzahlungen Bonusguthaben bieten. Das Modell unterstützt ein Kontextfenster von 100.000 Token. Stelle sicher, dass deine Prompts und Vervollständigungen in dieses Limit passen. Weitere Details zu Preisen und Limits findest du auf der Preisseite.

Technische Daten

Alle echten Grenzen und Funktionen der API auf einen Blick – prüfe sie, bevor du Guthaben kaufst.

MerkmalWert
API-FormatOpenAI-kompatibel: jedes OpenAI-SDK funktioniert – nur Base-URL und Schlüssel ändern
Base-URLhttps://api.hereticllm.com/v1
EndpunktePOST /v1/chat/completions · GET /v1/models
AuthentifizierungAuthorization: Bearer YOUR_KEY
Modell-IDuncensored
Function Callingja – tools, tool_choice; Antworten mit tool_calls, auch im Stream; Ergebnisse als role: tool
JSON-Modusresponse_format: {"type": "json_object"}
Parametertemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Max. Ausgabebis zum Rest des 100.000-Token-Fensters; max_tokens optional (kein separates Limit)
Kontextfenster100.000 Tokens (Eingabe + Ausgabe)
Streamingja – Server-Sent Events, der letzte Chunk enthält die Token-Nutzung
Anfragegrößebis 8 MB
Parallelität8 gleichzeitige Anfragen pro Schlüssel
Antwort-HeaderX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Ratenlimit300 Anfragen pro Minute und Schlüssel
AbrechnungPrepaid-Guthaben nach echter Nutzung; Fehler und Ablehnungen sind kostenlos
Testguthaben$0,50 für 7 Tage, ohne Karte · Testschlüssel: 2 parallele Anfragen, 60 pro Minute; volle Limits (8 und 300) nach erster Aufladung
Preis$0,25 pro 1 Mio. Eingabe-Tokens · $1,00 pro 1 Mio. Ausgabe-Tokens
Gültigkeitbezahltes Guthaben verfällt nie, kein Abo
Bonus+5 % ab $50, +10 % ab $100
AufladenUSDT (TRC20) oder USDC (Base), jeder ganze Betrag von $10 bis $500
AnmeldungGoogle oder E-Mail und Passwort
Schlüsselein aktiver Schlüssel pro Konto; ein neuer ersetzt den alten
InhalteInhalte für Erwachsene erlaubt; sexuelle Inhalte mit Minderjährigen werden abgelehnt

Fehlercodes

Fehler kommen als JSON mit festem type; fehlgeschlagene oder abgelehnte Anfragen kosten nichts.

CodeTypBedeutung
400bad_requestungültiges JSON, leere Nachrichten, falscher Parameter oder Kontext zu lang
401missing_key · invalid_key · key_revokedSchlüssel fehlt, ist falsch oder wurde ersetzt
402no_creditkein Guthaben – aufladen, dann geht es sofort weiter
403content_blockedsexuelle Inhalte mit Minderjährigen – abgelehnt, nicht berechnet
404not_foundunbekannter Endpunkt
413request_too_largeAnfrage größer als 8 MB
429rate_limited · concurrencyüber 300/Min. oder 8 parallel – kurz warten
503upstream_busyModell ausgelastet – in Sekunden erneut versuchen

Fragen und Antworten

Ist das unzensierte Modell kostenlos?

Das Modell ist nicht kostenlos, sondern nutzt ein Pay-as-you-go-System mit Prepaid-Guthaben. Neue Konten erhalten $0,50 Testguthaben, das 7 Tage gültig ist. Bezahltes Guthaben verfällt nie, und du kannst ab $10 aufladen.

Wie groß ist das Kontextfenster?

Das Modell unterstützt ein Kontextfenster von 100.000 Token, das sowohl den Eingabe-Prompt als auch die generierte Vervollständigung umfasst. Dies ermöglicht Interaktionen mit langem Kontext und Aufgaben zur Verarbeitung großer Datenmengen.

Unterstützt die API Function Calling?

Ja, die API unterstützt Tool- und Function Calling. Du kannst Tools in deiner Anfrage definieren, und das Modell antwortet mit strukturierten Daten, die von deiner Anwendung ausgeführt werden können. Dies ist mit Standard-OpenAI-SDK-Mustern kompatibel.

Dein Schlüssel ist nur ein Formular entfernt

Erstelle ein Konto, kopiere den Schlüssel, ändere die Basis-URL. Das ist die gesamte Einrichtung.

API-Schlüssel erhaltenDokumentation lesen