Heretic LLMHeretic LLM: API 문서
Heretic LLM: API 문서
몇 분 안에 Heretic LLM API를 시작하세요. GPU 인프라를 관리하지 않고도 표준 OpenAI SDK를 사용하여 'uncensored' 모델에서 무검열 응답을 받으며 텍스트를 전송하세요.
베이스 URL 및 인증
Heretic LLM API를 사용하려면 OpenAI 호환 클라이언트를 베이스 URL로 설정하세요: https://api.hereticllm.com/v1. API는 표준 Bearer 토큰 인증을 사용합니다. 이메일과 비밀번호만으로 Get API Key 페이지에서 가입하여 API 키를 생성할 수 있습니다. 키는 가입 직후 표시되며 언제든지 재생성할 수 있으며, 이전 키는 무효화됩니다.
OPENAI_API_KEY 환경 변수를 설정하거나 클라이언트 구성에 키를 직접 전달하세요. 베이스 URL을 Heretic 엔드포인트로 업데이트했는지 확인하세요. 이 설정은 베이스 URL과 키만 변경해도 공식 OpenAI SDK를 코드 변경 없이 사용할 수 있게 합니다.
첫 번째 요청
채팅 완료 엔드포인트에 첫 번째 요청을 보내세요. 모델 식별자는 uncensored입니다. 이 오픈 웨이트 모델은 합법적인 성인 용도를 위해 콘텐츠 거부 없이 답변하도록 조정되어 무검열 코딩, 창작 글쓰기 또는 연구에 이상적입니다. 컨텍스트 창은 프롬프트와 생성된 텍스트를 합쳐 최대 100,000개의 토큰을 지원합니다.
아래는 엔드포인트를 테스트하기 위한 기본 cURL 예제입니다. YOUR_API_KEY을 실제 키로 바꾸세요.
응답은 생성된 텍스트를 포함하는 표준 OpenAI 형식 객체입니다.
curl https://api.hereticllm.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Python SDK 통합
공식 openai 패키지를 사용하여 Python 응용 프로그램에 API를 통합하세요. 라이브러리는 JSON 직렬화 및 스트리밍을 자동으로 처리합니다. API 키와 올바른 베이스 URL로 클라이언트를 초기화한 후, 모델 ID uncensored로 chat.completions.create를 호출하세요.
이 접근 방식은 동기식 및 비동기식 워크플로우 모두에서 원활하게 작동합니다. 모델은 표준 프롬프트, 함수 호출 및 스트리밍 매개변수에 다른 OpenAI 호환 엔드포인트와 동일하게 응답합니다. 모델의 동작을 안내하기 위해 시스템 프롬프트를 전달하거나 직접 상호작용을 위해 사용자 메시지를 사용할 수 있습니다.
from openai import OpenAI
client = OpenAI(base_url="https://api.hereticllm.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Node.js SDK 통합
JavaScript 및 TypeScript 프로젝트의 경우 openai npm 패키지를 사용하세요. Heretic 베이스 URL과 API 키로 클라이언트를 구성하세요. API는 도구 정의 및 함수 호출을 포함하는 표준 요청 구조를 지원합니다.
async/await 패턴을 사용할 때 특히 응답을 올바르게 처리하세요. 모델은 응용 프로그램 로직에서 직접 처리할 수 있는 텍스트 응답을 반환합니다. 이 통합은 무검열 LLM 기능이 필요한 채팅 인터페이스, 자동화 에이전트 또는 데이터 처리 파이프라인 구축에 이상적입니다.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.hereticllm.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
스트리밍 응답
API 요청에서 stream 매개변수를 true로 설정하여 스트리밍을 활성화하면 실시간 응답을 받을 수 있습니다. API는 생성되는 텍스트 청크를 포함하는 서버 전송 이벤트(SSE) 스트림을 반환합니다. 이는 지각된 지연 시간을 줄이고 채팅 애플리케이션에 더 매끄러운 사용자 경험을 제공합니다.
스트림의 각 청크는 응답의 일부를 포함합니다. 이러한 청크를 순차적으로 처리하여 UI를 실시간으로 업데이트하세요. 스트리밍 기능은 OpenAI SDK와 완전히 호환되므로 표준 stream 반복자 또는 이벤트 리스너를 사용하여 데이터를 효율적으로 처리할 수 있습니다.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
속도 제한, 오류 및 컨텍스트
API는 키당 분당 300개의 요청 제한과 8 MB 요청 본문 크기를 적용합니다. 속도 제한을 초과하면 429 오류가 발생합니다. 인증 오류는 401 상태를 반환하며, 이는 유효하지 않거나 누락된 API 키를 나타냅니다. 선불 크레딧이 고갈되면 API는 402 오류를 반환하며 충전이 필요합니다.
크레딧은 만료되지 않으며, 크립토(USDT 또는 USDC)를 사용하여 $10부터 충전할 수 있습니다. 더 큰 예치 시 보너스 크레딧이 제공됩니다. 이 모델은 100,000개의 토큰 컨텍스트 창을 지원합니다. 프롬프트와 생성된 텍스트가 이 제한 내에 들어오도록 하세요. 가격 및 제한에 대한 자세한 내용은 가격 페이지를 방문하세요.
기술 사양
크레딧을 구매하기 전에 확인할 수 있도록 API의 실제 한도와 기능을 한곳에 정리했습니다.
| 항목 | 내용 |
|---|---|
| 형식 | OpenAI 호환: 어떤 OpenAI SDK든 base URL과 키만 바꾸면 동작 |
| Base URL | https://api.hereticllm.com/v1 |
| 엔드포인트 | POST /v1/chat/completions · GET /v1/models |
| 인증 | Authorization: Bearer YOUR_KEY |
| 모델 ID | uncensored |
| 함수 호출 | 지원 — tools, tool_choice; 응답에 tool_calls (스트리밍 포함), 결과는 role: tool로 전송 |
| JSON 모드 | response_format: {"type": "json_object"} |
| 파라미터 | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| 최대 출력 | 100,000 토큰 윈도우의 남은 만큼; max_tokens는 선택 사항(별도 상한 없음) |
| 컨텍스트 창 | 100,000 토큰 (입력 + 출력) |
| 스트리밍 | 지원 — SSE, 마지막 청크에 토큰 사용량 포함 |
| 요청 크기 | 최대 8 MB |
| 동시 요청 | 키당 동시 8개 |
| 응답 헤더 | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| 속도 제한 | 키당 분당 300회 |
| 과금 | 선불 크레딧에서 실제 사용량만큼 차감, 오류·거부는 무료 |
| 무료 체험 | $0.50, 7일, 카드 불필요 · 체험 키: 동시 요청 2건, 분당 60건. 첫 충전 후 전체 한도(8건, 300건) 적용 |
| 가격 | 입력 100만 토큰당 $0.25 · 출력 100만 토큰당 $1.00 |
| 유효기간 | 유료 크레딧은 만료되지 않으며 구독 없음 |
| 보너스 | $50 이상 +5%, $100 이상 +10% |
| 충전 | USDT (TRC20) 또는 USDC (Base), $10~$500 사이 원하는 정수 금액 |
| 로그인 | Google 또는 이메일과 비밀번호 |
| 키 | 계정당 활성 키 1개, 새 키를 만들면 이전 키는 무효 |
| 콘텐츠 | 성인 콘텐츠 허용, 미성년자가 관련된 성적 콘텐츠는 거부 |
오류 코드
오류는 고정된 type을 가진 JSON으로 반환되며, 실패하거나 거부된 요청은 과금되지 않습니다.
| 코드 | 유형 | 의미 |
|---|---|---|
400 | bad_request | 잘못된 JSON, 빈 메시지, 잘못된 파라미터 또는 컨텍스트 초과 |
401 | missing_key · invalid_key · key_revoked | 키 없음·잘못됨·새 키로 교체됨 |
402 | no_credit | 잔액 없음 — 충전하면 즉시 재개 |
403 | content_blocked | 미성년자 관련 성적 콘텐츠 — 거부, 과금 없음 |
404 | not_found | 알 수 없는 엔드포인트 |
413 | request_too_large | 본문 8 MB 초과 |
429 | rate_limited · concurrency | 분당 300회 또는 동시 8개 초과 — 잠시 후 재시도 |
503 | upstream_busy | 모델 혼잡 — 몇 초 후 재시도 |
질문과 답변
무검열 모델은 무료인가요?
모델은 무료가 아니며 선불 크레딧 선불 시스템입니다. 신규 계정은 7일 유효한 $0.50 무료 체험 크레딧을 받습니다. 유료 크레딧은 만료되지 않으며 $10부터 충전할 수 있습니다.
컨텍스트 창 크기는 얼마인가요?
모델은 입력 프롬프트와 생성된 응답을 모두 포함하는 100,000 토큰의 컨텍스트 창을 지원합니다. 이는 긴 컨텍스트 상호작용과 대규모 데이터 처리 작업을 가능하게 합니다.
API는 도구 호출을 지원하나요?
네, API는 도구 및 함수 호출을 지원합니다. 요청에 도구를 정의하면 모델이 응용 프로그램에서 실행할 수 있는 구조화된 데이터로 응답합니다. 이는 표준 OpenAI SDK 패턴과 호환됩니다.