Heretic LLMHeretic LLM: Dokumentacja API
Heretic LLM: Dokumentacja API
Zacznij korzystać z API Heretic LLM w kilka minut. Użyj standardowych SDK OpenAI, aby wysyłać tekst i otrzymywać odpowiedzi bez cenzury od modelu 'uncensored' bez zarządzania infrastrukturą GPU.
Adres bazowy i uwierzytelnianie
Aby rozpocząć korzystanie z API Heretic LLM, skieruj swój klient kompatybilny z OpenAI pod nasz bazowy URL: https://api.hereticllm.com/v1. API wykorzystuje standardową autoryzację tokenem Bearer. Możesz wygenerować klucz API, logując się tylko za pomocą adresu e-mail i hasła na stronie Pobierz klucz API. Klucz jest wyświetlany natychmiast po rejestracji i może być wygenerowany ponownie w dowolnym momencie, co unieważnia poprzedni klucz.
Ustaw zmienną środowiskową OPENAI_API_KEY lub przekaż klucz bezpośrednio w konfiguracji klienta. Upewnij się, że adres bazowy jest zaktualizowany do endpointu Heretic. To ustawienie pozwala używać oficjalnych SDK OpenAI bez zmian w kodzie, zmieniając tylko adres bazowy i klucz.
Pierwsze zapytanie
Wyślij pierwsze zapytanie do endpointu chat completions. Identyfikator modelu to uncensored. Ten model o otwartych wagach jest dostrojony do odpowiadania bez odmów treści dla użytku dorosłego, co czyni go idealnym do programowania bez cenzury, twórczego pisania lub badań. Okno kontekstu obsługuje do 100 000 tokenów dla promptu i uzupełnienia łącznie.
Poniżej znajduje się podstawowy przykład cURL do przetestowania endpointu. Zastąp YOUR_API_KEY swoim rzeczywistym kluczem.
Odpowiedź będzie standardowym obiektem w formacie OpenAI zawierającym wygenerowany tekst.
curl https://api.hereticllm.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Integracja z Python SDK
Zintegruj API ze swoimi aplikacjami Python za pomocą oficjalnego pakietu openai. Biblioteka obsługuje serializację JSON i strumieniowanie automatycznie. Zainicjuj klienta swoim kluczem API i poprawnym adresem bazowym. Następnie wywołaj chat.completions.create z identyfikatorem modelu uncensored.
To podejście działa bezproblemowo zarówno w przepływach synchronicznych, jak i asynchronicznych. Model reaguje na standardowe prompty, wywoływanie funkcji i parametry strumieniowania tak samo jak inne endpointy kompatybilne z OpenAI. Możesz przekazywać prompty systemowe, aby kierować zachowaniem modelu, lub używać wiadomości użytkownika do bezpośredniej interakcji.
from openai import OpenAI
client = OpenAI(base_url="https://api.hereticllm.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Integracja z Node.js SDK
Dla projektów JavaScript i TypeScript użyj pakietu npm openai. Skonfiguruj klienta z adresem bazowym Heretic i swoim kluczem API. API obsługuje standardowe struktury zapytań, w tym definicje narzędzi i wywoływanie funkcji.
Upewnij się, że poprawnie obsłużysz odpowiedź, zwłaszcza przy użyciu wzorców async/await. Model zwraca odpowiedzi tekstowe, które można przetwarzać bezpośrednio w logice Twojej aplikacji. Ta integracja jest idealna do budowania interfejsów czatu, agentów zautomatyzowanych lub potoków przetwarzania danych wymagających możliwości LLM bez cenzury.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.hereticllm.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Odpowiedzi strumieniowe
Włącz odpowiedzi w czasie rzeczywistym, włączając strumieniowanie w żądaniu API. Ustaw parametr stream na true. API zwróci strumień zdarzeń wysyłanych przez serwer (SSE) zawierający fragmenty tekstu, gdy są generowane. Zmniejsza to postrzeganą opóźnienie i zapewnia płynniejsze doświadczenie użytkownika dla aplikacji czatu.
Każdy fragment w strumieniu zawiera część odpowiedzi. Obsługuj te fragmenty inkrementalnie, aby aktualizować interfejs użytkownika w czasie rzeczywistym. Funkcja strumieniowania jest w pełni kompatybilna z SDK OpenAI, więc możesz używać standardowych iteratorów stream lub nasłuchiwaczy zdarzeń do efektywnego przetwarzania danych.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Limity, błędy i kontekst
API narzuca limit 300 zapytań na minutę na klucz i rozmiar ciała żądania 8 MB. Jeśli przekroczysz limit zapytań, otrzymasz błąd 429. Błędy uwierzytelniania zwracają status 401, wskazując na nieprawidłowy lub brakujący klucz API. Jeśli Twój przedpłacony kredyt zostanie wyczerpany, API zwróci błąd 402, wymagający doładowania.
Kredyt nigdy nie wygasa, a Ty możesz doładować od $10 używając kryptowalut (USDT lub USDC), z bonusowymi kredytami za większe wpłaty. Model obsługuje okno kontekstu 100 000 tokenów. Upewnij się, że Twoje prompty i uzupełnienia mieszczą się w tym limicie. Aby uzyskać więcej szczegółów dotyczących cen i limitów, odwiedź stronę Cennik.
Specyfikacja techniczna
Wszystkie rzeczywiste limity i funkcje API w jednym miejscu — sprawdź je przed doładowaniem.
| Element | Wartość |
|---|---|
| Format API | zgodne z OpenAI: działa każdy SDK OpenAI — zmień base URL i klucz |
| Base URL | https://api.hereticllm.com/v1 |
| Endpointy | POST /v1/chat/completions · GET /v1/models |
| Uwierzytelnianie | Authorization: Bearer YOUR_KEY |
| ID modelu | uncensored |
| Wywoływanie funkcji | tak — tools, tool_choice; odpowiedź zawiera tool_calls, także w strumieniu; wyniki jako role: tool |
| Tryb JSON | response_format: {"type": "json_object"} |
| Parametry | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Maks. odpowiedź | do reszty okna 100 000 tokenów; max_tokens opcjonalne (bez osobnego limitu) |
| Okno kontekstu | 100 000 tokenów (wejście + odpowiedź) |
| Strumieniowanie | tak — server-sent events; ostatni fragment zawiera zużycie tokenów |
| Rozmiar zapytania | do 8 MB |
| Równoległe zapytania | do 8 jednocześnie na klucz |
| Nagłówki odpowiedzi | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Limit zapytań | 300 zapytań na minutę na klucz |
| Rozliczenie | przedpłacony kredyt według rzeczywistego zużycia; błędy i odmowy są darmowe |
| Darmowy kredyt | $0,50 na 7 dni, bez karty · Klucz próbny: 2 równoległe żądania, 60 na minutę; pełne limity (8 i 300) po pierwszym doładowaniu |
| Cena | $0,25 za 1 mln tokenów wejścia · $1,00 za 1 mln tokenów wyjścia |
| Ważność | opłacony kredyt nie wygasa, bez subskrypcji |
| Bonus | +5% od $50, +10% od $100 |
| Doładowanie | USDT (TRC20) lub USDC (Base), dowolna pełna kwota od $10 do $500 |
| Logowanie | Google albo e-mail i hasło |
| Klucze | jeden aktywny klucz na konto; nowy zastępuje stary |
| Treści | treści dla dorosłych dozwolone; treści seksualne z udziałem nieletnich są odrzucane |
Kody błędów
Błędy wracają jako JSON ze stałym type; nieudane i odrzucone zapytania są bezpłatne.
| Kod | Typ | Znaczenie |
|---|---|---|
400 | bad_request | błędny JSON, puste wiadomości, zły parametr lub za długi kontekst |
401 | missing_key · invalid_key · key_revoked | brak klucza, zły klucz lub klucz zastąpiony nowym |
402 | no_credit | brak kredytu — doładuj, działa od razu |
403 | content_blocked | treści seksualne z nieletnimi — odmowa, bez opłaty |
404 | not_found | nieznany endpoint |
413 | request_too_large | treść większa niż 8 MB |
429 | rate_limited · concurrency | ponad 300/min lub 8 równolegle — odczekaj i ponów |
503 | upstream_busy | model zajęty — ponów za kilka sekund |
Pytania i odpowiedzi
Czy model bez cenzury jest darmowy?
Model nie jest darmowy, ale korzysta z systemu przedpłaconego kredytu. Nowe konta otrzymują $0,50 kredytu próbnego ważnego przez 7 dni. Płacony kredyt nie wygasa, a Ty możesz go doładować od $10.
Jaki jest rozmiar okna kontekstu?
Model obsługuje okno kontekstu 100 000 tokenów, obejmujące zarówno prompt, jak i wygenerowane uzupełnienie. Pozwala to na długie interakcje i przetwarzanie dużych danych.
Czy API obsługuje wywoływanie narzędzi?
Tak, API obsługuje wywoływanie narzędzi i funkcji. Możesz zdefiniować narzędzia w zapytaniu, a model zwróci dane strukturalne do wykonania przez Twoją aplikację. Jest to kompatybilne ze standardowymi wzorcami SDK OpenAI.
Twój klucz jest o jeden formularz stąd
Utwórz konto, skopiuj klucz, zmień adres bazowy. To cała konfiguracja.