Jak hostować model LLM bez cenzury przez API kompatybilne z OpenAI
Hostowanie modelu LLM bez cenzury zapewnia bezpośredni endpoint do wnioskowania bez odrzuceń, dostosowany do generowania treści dla dorosłych, kreatywnych lub nieograniczonych. Korzystając z architektury kompatybilnej z OpenAI, zyskujesz natychmiastową integrację SDK bez narzutów związanych z routingiem modeli czy złożonymi blokadami dostawcy.
Zaktualizowano
Kluczowe punkty
- Użyj architektury opartej na jednym modelu, aby wyeliminować złożoność routingu i zapewnić spójne zachowanie bez cenzury.
- Endpoint kompatybilny z OpenAI pozwala na podmianę klucza API i adresu URL bazowego dla natychmiastowej integracji.
- Przejrzyste rozliczenie za tokeny z przedpłaconym kredytem krypto zapewnia, że płacisz tylko za faktyczne użycie, a błędy i odrzucenia są darmowe.
- Prywatność jest zachowywana poprzez wykluczenie promptów z danych treningowych, z twardym blokiem na treści o charakterze seksualnym osób poniżej 18. roku życia, niezależnie od ogólnej tolerancji modelu.
Dlaczego hostować model LLM bez cenzury?
Standardowe API LLM często stosują ścisłe filtry treści, które mogą odrzucać legalne tematy dla dorosłych, subtelne teksty twórcze lub kontrowersyjne tematy. Hostowanie modelu LLM bez cenzury oznacza, że Ty kontrolujesz warstwę wnioskowania, zapewniając, że model odpowiada na Twoje prompty bez arbitralnych odrzuceń. Jest to kluczowe dla aplikacji wymagających surowej generacji tekstu bez filtrów, takich jak silniki do odgrywania ról, asystenci do pisania twórczego lub narzędzia analityczne przetwarzające wrażliwe dane.
W przeciwieństwie do agregatorów, które kierują zapytania przez wiele modeli, hostowane API LLM bez cenzury zazwyczaj obsługuje pojedynczy, dostrojony model. Upraszcza to debugowanie i zapewnia spójne zachowanie w Twojej aplikacji. Unikasz nieprzewidywalności wynikającej z wersji modeli lub nagłych zmian polityki przez dużych dostawców. Rezultatem jest niezawodna usługa wejścia tekstowego / wyjścia tekstowego, która szanuje Twoje parametry wejściowe.
Wybór odpowiedniej architektury
Najbardziej wydajną architekturą do wnioskowania bez cenzury jest konfiguracja z jednym modelem. Agregatorzy często wprowadzają opóźnienia i złożoność, kierując zapytania do różnych modeli, co może rozmywać cechy bez cenzury Twojego głównego modelu. Hostując pojedynczy duży model językowy, zachowujesz pełną kontrolę nad potokiem wnioskowania i zapewniajesz, że dostrojanie modelu do tolerancji treści jest stosowane spójnie.
Szukaj API, które udostępnia tylko niezbędne endpointy: POST /v1/chat/completions do generowania i GET /v1/models do metadanych. Unikaj usług oferujących embeddingi, generowanie obrazów lub dostrajanie, chyba że ich potrzebujesz, ponieważ dodają one niepotrzebny narzut. Skupione API zmniejsza opóźnienia i koszty, zapewniając czystą usługę generowania tekstu, która bezproblemowo integruje się z istniejącymi klientami kompatybilnymi z OpenAI.
Struktura endpointu API
API kompatybilne z OpenAI stosuje standardową strukturę RESTful. Aby wygenerować tekst, wyślij zapytanie POST do /v1/chat/completions ze swoimi wiadomościami i parametrami. Adres URL bazowy to zazwyczaj coś w stylu https://api.uncensoredgpt.cc/v1. Musisz dołączyć swój klucz API w nagłówku Authorization.
Endpoint GET /v1/models zwraca listę dostępnych modeli, które w konfiguracji z jednym modelem będą zwykle zawierać tylko jeden wpis. Potwierdza to, że usługa jest aktywna i gotowa do przyjmowania zapytań. Nie ma złożonych tabel routingu ani mechanizmów rezerwowych; API jest zaprojektowane do bezpośredniej, przewidywalnej interakcji.
- POST /v1/chat/completions: Główny endpoint do generowania tekstu.
- GET /v1/models: Endpoint do weryfikacji dostępności modelu.
- Authorization: Token Bearer wymagany we wszystkich zapytaniach.
Obsługa okien kontekstu
Okno kontekstu o pojemności 100 000 tokenów pozwala na duże ilości danych wejściowych i wyjściowych w ramach jednego zapytania. Ta pojemność jest niezbędna przy generowaniu długich treści, złożonych zadaniach rozumowania lub przetwarzaniu dużych dokumentów. Okno kontekstu obejmuje zarówno prompt (wejście), jak i uzupełnienie (wyjście). Musisz upewnić się, że łączna liczba tokenów nie przekracza tego limitu.
Pamiętaj o maksymalnej długości odpowiedzi. Choć okno kontekstu wynosi 100 000 tokenów, maksymalna długość odpowiedzi na zapytanie może być ograniczona do 32 000 tokenów. Jeśli nie określisz parametru max_tokens, domyślna długość uzupełnienia może być ograniczona do 2048 tokenów. Zaplanuj swoje prompty odpowiednio, aby zmaksymalizować użyteczność dostępnego kontekstu bez uderzania w twarde limity.
Strumieniowanie i wynik w czasie rzeczywistym
Strumieniowanie jest wspierane za pomocą Wydarzeń Wysyłanych przez Serwer (SSE). Pozwala to na otrzymywanie tokenów w czasie rzeczywistym, gdy są generowane, co poprawia doświadczenie użytkownika w aplikacjach interaktywnych. API przesyła informacje o zużyciu tokenów w ostatnim fragmencie, dostarczając dokładne dane do rozliczeń nawet podczas sesji strumieniowania.
Aby włączyć strumieniowanie, ustaw parametr stream na true w swoim zapytaniu. Odpowiedź będzie serią zdarzeń, z których każde zawiera częściowe uzupełnienie. Jest to idealne dla interfejsów czatu, generowania kodu na żywo i w dowolnym scenariuszu, w którym liczy się opóźnienie. Możesz parsować te zdarzenia za pomocą standardowych bibliotek klientów HTTP.
Używanie narzędzi i wywoływanie funkcji
API obsługuje wywoływanie funkcji, pozwalając modelowi na generowanie danych strukturalnych lub wywoływanie zewnętrznych narzędzi. Możesz zdefiniować schematy funkcji w parametrze tools i określić tool_choice, aby kontrolować, jak model decyduje się ich używać. Umożliwia to złożone przepływy pracy, w których LLM może pobierać dane, wykonywać obliczenia lub uruchamiać akcje na podstawie danych wejściowych użytkownika.
Tryb JSON jest również dostępny poprzez parametr response_format ustawiony na {"type": "json_object"}. Zapewnia to, że model zwraca poprawny JSON, co jest kluczowe dla integracji programistycznej. Możesz dostosować parametry takie jak temperature, top_p i seed, aby kontrolować kreatywność i reprodukowalność. Te funkcje sprawiają, że API nadaje się do budowania zaawansowanych aplikacji opartych na AI.
Zarządzanie tokenami i rozliczenia
Rozliczenia są przejrzyste i oparte na rzeczywistym zużyciu tokenów. Cena to $0,25 za 1M tokenów wejściowych i $1,00 za 1M tokenów wyjściowych. Błędy i odrzucenia są darmowe, co oznacza, że płacisz tylko za pomyślne uzupełnienia. Nie ma miesięcznych opłat ani subskrypcji; doładowujesz wstępnie kredyt, który nigdy nie wygasa.
Doładowania przyjmujemy kryptowalutami, konkretnie USDT (TRC20) lub USDC (Base). Minimalne kwoty doładowania wynoszą od $10 do $500, z bonusowymi kredytami za większe kwoty. Nie przyjmujemy kart kredytowych ani PayPal do doładowań. Nowe konto otrzymuje $0,50 kredytu próbnego ważnego przez 7 dni, bez wymagania karty. Limity obejmują 300 zapytań na minutę i 8 równoległych zapytań na klucz.
Prywatność i obsługa danych
Prywatność jest kluczowym aspektem dla wielu użytkowników. API nie wykorzystuje Twoich promptów do danych treningowych, zapewniając prywatność Twoich danych wejściowych. Do założenia konta potrzebny jest tylko adres e-mail, bez numeru telefonu. Minimalizuje to zbieranie danych osobowych, zapewniając pełny dostęp do API.
Ograniczenia treści są minimalne, ale konkretne. Model nie odrzuca legalnych tematów dla dorosłych, fikcyjnych lub kontrowersyjnych. Jednak obowiązuje ścisły limit: treści seksualne z udziałem małoletnich są zawsze blokowane. Zapewnia to zgodność z podstawowymi standardami prawnymi, jednocześnie utrzymując bardzo liberalne środowisko dla innych typów treści.
Pierwsze kroki z Twoim kluczem
Rejestracja jest prosta. Możesz użyć opcji „Kontynuuj z Google” lub utworzyć konto za pomocą adresu e-mail i hasła. Po zarejestrowaniu Twój klucz API jest wyświetlany natychmiast, pozwalając na rozpoczęcie wysyłania zapytań bez opóźnień. Nie jest wymagana weryfikacja numerem telefonu, a proces jest zaprojektowany pod kątem szybkości.
Aby zintegrować, zaktualizuj adres URL bazowy klienta na https://api.uncensoredgpt.cc/v1 i ustaw klucz API. Użyj identyfikatora modelu „uncensored” we wszystkich zapytaniach. To podejście z jednym modelem zapewnia spójność i eliminuje złożoność routingu. Możesz rozpocząć strumieniowanie, wywoływanie funkcji lub generowanie długich tekstów natychmiast.
Pytania i odpowiedzi
Czy to API nadaje się do treści NSFW?
Tak, model jest bez cenzury i nie odrzuca legalnych tematów dla dorosłych, fikcyjnych lub kontrowersyjnych. Jest zaprojektowany do obsługi treści NSFW bez arbitralnych ograniczeń, z wyjątkiem ścisłego bloku treści seksualnych z udziałem małoletnich.
Jak zapłacić za API?
Płatności przyjmujemy wyłącznie kryptowalutami: USDT (TRC20) lub USDC (Base). Nie ma opcji karty kredytowej, PayPal ani przelewu bankowego. Doładowania wynoszą od $10 do $500, a kredyty nigdy nie wygasają.
Jaki jest rozmiar okna kontekstu?
Okno kontekstu wynosi 100 000 tokenów, obejmując zarówno prompt, jak i uzupełnienie. Maksymalna długość odpowiedzi na zapytanie to 32 000 tokenów, lub 2048, jeśli <code>max_tokens</code> nie jest określony.
Czy API wykorzystuje moje dane do trenowania?
Nie, prompty nie są wykorzystywane do trenowania. Usługa jest zaprojektowana tak, aby była prywatna — do założenia konta wystarczy tylko adres e-mail, a Twoje dane wejściowe pozostają Twoje.
Twój klucz jest o jeden formularz stąd
Załóż konto, skopiuj klucz, zmień bazowy URL. To cała konfiguracja.