Cara Meng-host LLM Tanpa Sensor via API Kompatibel OpenAI
Meng-hosting LLM tanpa sensor menyediakan endpoint inferensi langsung tanpa penolakan yang disesuaikan untuk generasi konten dewasa, kreatif, atau tanpa batasan. Dengan menggunakan arsitektur yang kompatibel dengan OpenAI, Anda mendapatkan integrasi SDK langsung tanpa overhead pemrosesan permintaan atau ketergantungan vendor yang kompleks.
Diperbarui
Poin kunci
- Gunakan arsitektur single-model untuk menghilangkan kompleksitas routing dan memastikan perilaku tanpa sensor yang konsisten.
- Endpoint yang kompatibel dengan OpenAI memungkinkan Anda mengganti kunci API dan URL dasar untuk integrasi langsung.
- Penagihan per token yang transparan dengan saldo kripto prabayar memastikan Anda hanya membayar untuk penggunaan aktual, dengan kesalahan dan penolakan dihitung gratis.
- Privasi dijaga dengan menjaga agar prompt tidak masuk ke dalam data pelatihan, dengan pemblokiran keras terhadap konten seksual yang melibatkan anak di bawah umur terlepas dari toleransi umum model.
Mengapa Meng-host LLM Tanpa Sensor?
API LLM standar sering menerapkan filter konten ketat yang dapat menolak tema dewasa yang sah, penulisan kreatif yang halus, atau topik kontroversial. Meng-host LLM tanpa sensor berarti Anda mengontrol lapisan inferensi, memastikan model merespons prompt Anda tanpa penolakan sewenang-wenang. Ini sangat penting untuk aplikasi yang memerlukan generasi teks mentah tanpa filter, seperti mesin roleplay, asisten penulisan kreatif, atau alat penelitian yang menganalisis data sensitif.
Berbeda dengan agregator yang mengarahkan permintaan melalui beberapa model, API LLM tanpa sensor yang di-host biasanya melayani satu model yang telah disesuaikan. Ini menyederhanakan debugging dan memastikan perilaku yang konsisten di seluruh aplikasi Anda. Anda menghindari ketidakpastian versi model atau perubahan kebijakan mendadak dari penyedia besar. Hasilnya adalah layanan teks masuk/keluar yang andal dan deterministik yang menghormati parameter input Anda.
Memilih Arsitektur yang Tepat
Arsitektur paling efisien untuk inferensi tanpa sensor adalah pengaturan single-model. Agregator sering memperkenalkan latensi dan kompleksitas dengan mengarahkan permintaan ke berbagai model, yang dapat mengencerkan karakteristik tanpa sensor dari model utama Anda. Dengan meng-host satu model bahasa besar, Anda mempertahankan kontrol penuh atas pipeline inferensi dan memastikan bahwa penyesuaian model untuk toleransi konten diterapkan secara konsisten.
Cari API yang hanya mengekspos endpoint yang diperlukan: POST /v1/chat/completions untuk generasi dan GET /v1/models untuk metadata. Hindari layanan yang menawarkan embedding, generasi gambar, atau fine-tuning kecuali Anda membutuhkannya, karena ini menambah overhead yang tidak perlu. API yang fokus mengurangi latensi dan biaya, menyediakan layanan generasi teks murni yang terintegrasi dengan lancar dengan klien yang kompatibel dengan OpenAI.
Struktur Endpoint API
API yang kompatibel dengan OpenAI mengikuti struktur RESTful standar. Untuk menghasilkan teks, Anda mengirim permintaan POST ke /v1/chat/completions dengan pesan dan parameter Anda. URL dasar biasanya seperti https://api.uncensoredgpt.cc/v1. Anda harus menyertakan kunci API Anda di header Authorization.
Endpoint GET /v1/models mengembalikan daftar model yang tersedia, yang dalam pengaturan single-model biasanya hanya mencantumkan satu entri. Ini mengkonfirmasi bahwa layanan aktif dan siap menerima permintaan. Tidak ada tabel routing kompleks atau mekanisme fallback; API dirancang untuk interaksi langsung dan prediktif.
- POST /v1/chat/completions: Endpoint utama untuk generasi teks.
- GET /v1/models: Endpoint untuk memverifikasi ketersediaan model.
- Authorization: Token Bearer diperlukan untuk semua permintaan.
Menangani Jendela Konteks
Jendela konteks 100.000 token memungkinkan input dan output yang substansial dalam satu permintaan. Kapasitas ini penting untuk generasi konten panjang, tugas penalaran kompleks, atau pemrosesan dokumen besar. Jendela konteks mencakup prompt (input) dan completion (output). Anda harus memastikan bahwa jumlah token total tidak melebihi batas ini.
Perhatikan panjang output maksimum. Meskipun jendela konteks adalah 100.000 token, output maksimum per permintaan mungkin dibatasi hingga 32.000 token. Jika Anda tidak menentukan parameter max_tokens, panjang output default mungkin dibatasi hingga 2.048 token. Rencanakan prompt Anda sesuai untuk memaksimalkan utilitas konteks yang tersedia tanpa mencapai batas keras.
Streaming dan Output Waktu Nyata
Streaming didukung melalui Server-Sent Events (SSE). Ini memungkinkan Anda menerima token secara waktu nyata saat dihasilkan, meningkatkan pengalaman pengguna untuk aplikasi interaktif. API mengalirkan informasi penggunaan token di chunk terakhir, menyediakan data penagihan yang akurat bahkan selama sesi streaming.
Untuk mengaktifkan streaming, tetapkan parameter stream ke true dalam permintaan Anda. Respons akan berupa serangkaian peristiwa, masing-masing berisi completion parsial. Ini ideal untuk antarmuka obrolan, generasi kode langsung, dan skenario di mana latensi penting. Anda dapat mengurai peristiwa ini menggunakan pustaka klien HTTP standar.
Penggunaan Alat dan Pemanggilan Fungsi
API mendukung pemanggilan fungsi, memungkinkan model menghasilkan data terstruktur atau memanggil alat eksternal. Anda dapat menentukan skema fungsi dalam parameter tools dan menentukan tool_choice untuk mengontrol bagaimana model memutuskan untuk menggunakannya. Ini memungkinkan alur kerja kompleks di mana LLM dapat mengambil data, melakukan perhitungan, atau memicu tindakan berdasarkan input pengguna.
Mode JSON juga tersedia melalui parameter response_format yang ditetapkan ke {"type": "json_object"}. Ini memastikan model menghasilkan JSON yang valid, yang sangat penting untuk integrasi programatik. Anda dapat menyesuaikan parameter seperti temperature, top_p, dan seed untuk mengontrol kreativitas dan reproduktibilitas. Fitur-fitur ini membuat API cocok untuk membangun aplikasi AI canggih.
Manajemen Token dan Penagihan
Penagihan transparan dan berdasarkan penggunaan token nyata. Harganya adalah $0,25 per 1M token input dan $1,00 per 1M token output. Kesalahan dan penolakan gratis, artinya Anda hanya membayar untuk completion yang berhasil. Tidak ada biaya bulanan atau langganan; Anda memuat saldo prabayar, yang tidak pernah kedaluwarsa.
Isi saldo diterima melalui mata uang kripto, khususnya USDT (TRC20) atau USDC (Base). Jumlah minimum isi saldo berkisar dari $10 hingga $500, dengan kredit bonus untuk jumlah yang lebih besar. Tidak ada kartu kredit atau PayPal yang diterima untuk isi saldo. Akun baru menerima $0,50 dalam kredit uji coba yang berlaku selama 7 hari, tanpa memerlukan kartu. Batasan termasuk 300 permintaan per menit dan 8 permintaan paralel per kunci.
Privasi dan Penanganan Data
Privasi adalah pertimbangan utama bagi banyak pengguna. API tidak menggunakan prompt Anda untuk data pelatihan, memastikan bahwa input Anda tetap privat. Pembuatan akun hanya memerlukan alamat email, tanpa nomor telepon yang diperlukan. Ini meminimalkan pengumpulan data pribadi sambil memberikan akses penuh ke API.
Pembatasan konten minimal tetapi spesifik. Model tidak menolak topik dewasa, fiksi, atau kontroversial yang sah. Namun, batas keras berlaku: konten seksual yang melibatkan anak di bawah umur selalu diblokir. Ini memastikan kepatuhan dengan standar hukum dasar sambil mempertahankan lingkungan yang sangat permisif untuk jenis konten lainnya.
Memulai dengan Kunci Anda
Mendaftar sangat mudah. Anda dapat menggunakan "Lanjutkan dengan Google" atau membuat akun dengan email dan kata sandi. Setelah terdaftar, kunci API Anda ditampilkan segera, memungkinkan Anda mulai membuat permintaan tanpa penundaan. Tidak diperlukan verifikasi nomor telepon, dan prosesnya dirancang untuk kecepatan.
Untuk mengintegrasikan, perbarui URL dasar klien Anda menjadi https://api.uncensoredgpt.cc/v1 dan atur kunci API. Gunakan ID model "uncensored" untuk semua permintaan. Pendekatan single-model ini memastikan konsistensi dan menghilangkan kompleksitas routing. Anda dapat mulai streaming, memanggil fungsi, atau menghasilkan teks panjang segera.
Tanya jawab
Apakah API ini cocok untuk konten NSFW?
Ya, model tanpa sensor dan tidak menolak topik dewasa, fiksi, atau kontroversial yang sah. Model ini dirancang untuk menangani konten NSFW tanpa pembatasan sewenang-wenang, kecuali pemblokiran ketat pada konten seksual yang melibatkan anak di bawah umur.
Bagaimana cara membayar untuk API?
Pembayaran hanya diterima melalui mata uang kripto: USDT (TRC20) atau USDC (Base). Tidak ada opsi kartu kredit, PayPal, atau transfer bank. Isi ulang berkisar antara $10 hingga $500, dan saldo prabayar tidak pernah kedaluwarsa.
Berapa ukuran jendela konteks?
Jendela konteks adalah 100.000 token, yang mencakup baik prompt maupun completion. Output maksimum per permintaan adalah 32.000 token, atau 2.048 jika <code>max_tokens</code> tidak ditentukan.
Apakah API menggunakan data Anda untuk pelatihan?
Tidak, prompt tidak digunakan untuk pelatihan. Layanan ini dirancang untuk bersifat privat, hanya memerlukan email untuk pembuatan akun dan memastikan bahwa data input Anda tetap menjadi milik Anda.
Kunci Anda hanya selangkah lagi dari satu formulir
Buat akun, salin kunci, ubah URL dasar. Itulah seluruh proses penyiapan.