So hostest du ein unzensiertes LLM über eine OpenAI-kompatible API
Das Hosting eines unzensierten LLM bietet einen direkten Endpunkt ohne Ablehnungen, der auf die Generierung von erwachsenen, kreativen oder uneingeschränkten Inhalten zugeschnitten ist. Durch die Nutzung einer OpenAI-kompatiblen Architektur erhältst du sofortige SDK-Integration ohne den Overhead des Model-Routings oder komplexe Anbieterbindung.
Aktualisiert
Wichtige Punkte
- Nutze eine Single-Model-Architektur, um Routing-Komplexität zu eliminieren und ein konsistentes unzensiertes Verhalten zu gewährleisten.
- Ein OpenAI-kompatibler Endpunkt ermöglicht es dir, deinen API-Schlüssel und die Basis-URL einzufügen, um sofort eine Integration durchzuführen.
- Transparente Token-basierte Abrechnung mit Prepaid-Krypto-Guthaben stellt sicher, dass du nur für die tatsächliche Nutzung zahlst; Fehler und Ablehnungen sind kostenlos.
- Die Privatsphäre wird gewahrt, indem Prompts nicht in die Trainingsdaten einfließen, mit einer harten Grenze für sexuellen Inhalt, der Minderjährige betrifft, unabhängig von der allgemeinen Toleranz des Modells.
Warum ein unzensiertes LLM hosten?
Standard-LLM-APIs wenden oft strenge Inhaltsfilter an, die legale erwachsene Themen, nuancierte kreative Texte oder kontroverse Themen ablehnen können. Das Hosting eines unzensierten LLM bedeutet, dass du die Inference-Schicht kontrollierst und sicherstellst, dass das Modell auf deine Prompts reagiert, ohne willkürliche Ablehnungen. Dies ist entscheidend für Anwendungen, die rohe, ungefilterte Textgenerierung benötigen, wie Rollenspiel-Engines, kreative Schreibassistenten oder Forschungstools zur Analyse sensibler Daten.
Im Gegensatz zu Aggregatoren, die Anfragen über mehrere Modelle leiten, bietet eine gehostete unzensierte LLM-API typischerweise ein einzelnes, abgestimmtes Modell. Dies vereinfacht das Debugging und stellt ein konsistentes Verhalten in deiner Anwendung sicher. Du vermeidest die Unvorhersehbarkeit von Modellversionen oder plötzlichen Richtlinienänderungen großer Anbieter. Das Ergebnis ist ein zuverlässiger, determinischer Text-in/Text-out-Dienst, der deine Eingabeparameter respektiert.
Die richtige Architektur wählen
Die effizienteste Architektur für unzensierte Inference ist eine Single-Model-Einrichtung. Aggregatoren führen oft Latenz und Komplexität ein, indem sie Anfragen an verschiedene Modelle leiten, was die unzensierten Eigenschaften deines Hauptmodells verwässern kann. Durch das Hosting eines einzelnen Large Language Models behältst du die volle Kontrolle über die Inference-Pipeline und stellst sicher, dass die Anpassung des Modells für die Inhaltstoleranz konsistent angewendet wird.
Achte auf eine API, die nur die notwendigen Endpunkte bereitstellt: POST /v1/chat/completions für die Generierung und GET /v1/models für Metadaten. Vermeide Dienste, die Embeddings, Bildgenerierung oder Fine-Tuning anbieten, es sei denn, du benötigst sie, da diese unnötigen Overhead verursachen. Eine fokussierte API reduziert Latenz und Kosten und bietet einen reinen Textgenerierungsdienst, der sich nahtlos in bestehende OpenAI-kompatible Clients integriert.
API-Endpunkt-Struktur
Eine OpenAI-kompatible API folgt einer standardisierten RESTful-Struktur. Um Text zu generieren, sendest du eine POST-Anfrage an /v1/chat/completions mit deinen Nachrichten und Parametern. Die Basis-URL ist typischerweise etwas wie https://api.uncensoredgpt.cc/v1. Du musst deinen API-Schlüssel im Authorization-Header angeben.
Der Endpunkt GET /v1/models gibt eine Liste verfügbarer Modelle zurück, die in einer Single-Model-Einrichtung normalerweise nur einen Eintrag auflistet. Dies bestätigt, dass der Dienst aktiv ist und Anfragen entgegennimmt. Es gibt keine komplexen Routing-Tabellen oder Fallback-Mechanismen; die API ist für eine direkte, vorhersehbare Interaktion ausgelegt.
- POST /v1/chat/completions: Hauptendpunkt für die Textgenerierung.
- GET /v1/models: Endpunkt zur Überprüfung der Modellverfügbarkeit.
- Authorization: Bearer-Token für alle Anfragen erforderlich.
Umgang mit Kontextfenstern
Ein Kontextfenster mit 100.000 Token ermöglicht umfangreiche Eingaben und Ausgaben innerhalb einer einzelnen Anfrage. Diese Kapazität ist wesentlich für die Generierung langer Texte, komplexe Reasoning-Aufgaben oder die Verarbeitung großer Dokumente. Das Kontextfenster umfasst sowohl den Prompt (Eingabe) als auch die Completion (Ausgabe). Du musst sicherstellen, dass die Gesamtzahl der Token dieses Limit nicht überschreitet.
Achte auf die maximale Ausgabelänge. Obwohl das Kontextfenster 100.000 Token umfasst, kann die maximale Ausgabe pro Anfrage auf 32.000 Token begrenzt sein. Wenn du keinen max_tokens-Parameter angibst, kann die Standard-Ausgabelänge auf 2.048 Token begrenzt sein. Plane deine Prompts entsprechend, um den Nutzen des verfügbaren Kontexts zu maximieren, ohne harte Grenzen zu erreichen.
Streaming und Echtzeit-Ausgabe
Streaming wird über Server-Sent Events (SSE) unterstützt. Dies ermöglicht es dir, Token in Echtzeit zu empfangen, während sie generiert werden, was die Benutzererfahrung für interaktive Anwendungen verbessert. Die API streamt Token-Nutzungsdaten im letzten Chunk und liefert so genaue Abrechnungsdaten auch während Streaming-Sitzungen.
Um das Streaming zu aktivieren, setze den stream-Parameter auf true in deiner Anfrage. Die Antwort ist eine Reihe von Events, die jeweils eine teilweise Completion enthalten. Dies ist ideal für Chat-Schnittstellen, Live-Code-Generierung und alle Szenarien, in denen Latenz wichtig ist. Du kannst diese Events mit Standard-HTTP-Client-Bibliotheken parsen.
Tool-Nutzung und Function Calling
Die API unterstützt Function Calling, wodurch das Modell strukturierte Daten generieren oder externe Tools aufrufen kann. Du kannst Funkschemata im tools-Parameter definieren und tool_choice angeben, um zu steuern, wie das Modell diese nutzt. Dies ermöglicht komplexe Workflows, in denen das LLM Daten abrufen, Berechnungen durchführen oder Aktionen basierend auf Benutzereingaben auslösen kann.
Der JSON-Modus ist ebenfalls über den response_format-Parameter mit {"type": "json_object"} verfügbar. Dies stellt sicher, dass das Modell gültiges JSON ausgibt, was für die programmatische Integration entscheidend ist. Du kannst Parameter wie temperature, top_p und seed anpassen, um Kreativität und Reproduzierbarkeit zu steuern. Diese Funktionen machen die API geeignet für den Bau anspruchsvoller KI-gesteuerter Anwendungen.
Token-Verwaltung und Abrechnung
Die Abrechnung ist transparent und basiert auf der tatsächlichen Token-Nutzung. Der Preis beträgt $0,25 pro 1M Input-Token und $1,00 pro 1M Output-Token. Fehler und Ablehnungen sind kostenlos, was bedeutet, dass du nur für erfolgreiche Completions zahlst. Es gibt keine monatlichen Gebühren oder Abonnements; du lädst Guthaben auf, das verfällt nie.
Aufladungen werden per Kryptowährung akzeptiert, speziell USDT (TRC20) oder USDC (Base). Mindestaufladebeträge reichen von 10 $ bis 500 $, mit Bonusguthaben für höhere Beträge. Keine Kreditkarten oder PayPal für Aufladungen akzeptiert. Ein neues Konto erhält 0,50 $ an Testguthaben, gültig für 7 Tage, keine Karte erforderlich. Limits umfassen 300 Anfragen pro Minute und 8 parallele Anfragen pro Schlüssel.
Privatsphäre und Datenverarbeitung
Privatsphäre ist für viele Benutzer ein wichtiger Aspekt. Die API verwendet deine Prompts nicht für Trainingsdaten, wodurch deine Eingabe privat bleibt. Die Kontoeinrichtung erfordert nur eine E-Mail-Adresse, ohne Telefonnummer. Dies minimiert die Sammlung persönlicher Daten und bietet gleichzeitig vollen Zugriff auf die API.
Inhaltseinschränkungen sind minimal, aber spezifisch. Das Modell lehnt legale erwachsene, fiktive oder kontroverse Themen nicht ab. Es gilt jedoch eine harte Grenze: Sexuelle Inhalte mit Minderjährigen werden immer blockiert. Dies gewährleistet die Einhaltung grundlegender rechtlicher Standards und erhält gleichzeitig eine hochgradig permissive Umgebung für andere Inhaltstypen.
Erste Schritte mit deinem Schlüssel
Die Anmeldung ist einfach. Du kannst „Mit Google fortfahren“ verwenden oder ein Konto mit E-Mail und Passwort erstellen. Nach der Registrierung wird dein API-Schlüssel sofort angezeigt, sodass du sofort mit Anfragen beginnen kannst. Es ist keine Telefonnummer-Verifizierung erforderlich, und der Prozess ist auf Geschwindigkeit ausgelegt.
Um zu integrieren, aktualisiere die Basis-URL deines Clients auf https://api.uncensoredgpt.cc/v1 und setze den API-Schlüssel. Verwende die Modell-ID "uncensored" für alle Anfragen. Dieser Single-Model-Ansatz gewährleistet Konsistenz und eliminiert die Komplexität des Routeings. Du kannst sofort mit Streaming, Function Calling oder der Generierung langer Texte beginnen.
Fragen und Antworten
Ist diese API für NSFW-Inhalte geeignet?
Ja, das Modell ist unzensiert und lehnt legale erwachsene, fiktive oder kontroverse Themen nicht ab. Es wurde entwickelt, um NSFW-Inhalte ohne willkürliche Einschränkungen zu verarbeiten, mit einer harten Grenze für sexuelle Inhalte mit Minderjährigen.
Wie bezahle ich für die API?
Zahlungen werden nur per Kryptowährung akzeptiert: USDT (TRC20) oder USDC (Base). Es gibt keine Optionen für Kreditkarte, PayPal oder Banküberweisung. Aufladungen liegen zwischen $10 und $500, und Guthaben verfällt nie.
Wie groß ist das Kontextfenster?
Das Kontextfenster umfasst 100.000 Token, einschließlich sowohl des Prompts als auch der Completion. Die maximale Ausgabe pro Anfrage beträgt 32.000 Token bzw. 2.048, wenn <code>max_tokens</code> nicht angegeben ist.
Nutzt die API meine Daten zum Training?
Nein, Prompts werden nicht zum Training verwendet. Der Dienst ist auf Privatsphäre ausgelegt und benötigt nur eine E-Mail-Adresse zur Kontoeinrichtung. Deine Eingabedaten bleiben dein Eigentum.
Dein Schlüssel ist nur ein Formular entfernt
Erstelle ein Konto, kopiere den Schlüssel, ändere die Basis-URL. Das ist die gesamte Einrichtung.