Hosting LLM privat di server GPU dedicated
Jalankan model bahasa besar Anda sendiri di server GPU NVIDIA dedicated alih-alih membayar per token ke API pihak ketiga. Dengan hosting LLM di IPHOST, model, prompt dan jawabannya tetap berada di hardware yang hanya Anda gunakan, di pusat data kami yang bersertifikat ISO/IEC 27001 di Chisinau. Anda mendapatkan akses root penuh, harga bulanan tetap dan tanpa batas permintaan atau token.
GPU mana untuk model mana
Jumlah memori GPU (VRAM) menentukan model mana yang dapat Anda jalankan. Sebagai patokan, sebuah model membutuhkan sekitar 2 GB VRAM per miliar parameter dalam FP16, sekitar 1 GB dalam 8-bit dan sekitar 0.6 GB dalam 4-bit, ditambah ruang untuk konteks.
| Ukuran model | Contoh model | Paket yang direkomendasikan |
|---|---|---|
| 7–8B dalam FP16 | Llama 3.1 8B, Mistral 7B, Qwen 2.5 7B | NVIDIA L4 24 GB |
| 13–32B dalam 4-bit | Qwen 2.5 32B, DeepSeek-R1 Distill 32B, Gemma 2 27B | NVIDIA L4 24 GB atau A40 48 GB |
| 13–20B dalam FP16 | Phi-4 14B, Qwen 2.5 14B | NVIDIA A40 48 GB |
| 70B dalam 4-bit | Llama 3.3 70B, Qwen 2.5 72B | NVIDIA A40 48 GB |
| 70B dalam 8-bit, fine-tuning | Llama 3.3 70B, LoRA pada model 13–34B | 2x NVIDIA A100 40 GB |
Lihat detail setiap kartu: server dedicated NVIDIA L4, server dedicated NVIDIA A40 dan server dedicated 2x NVIDIA A100.
Ollama, vLLM dan API yang kompatibel dengan OpenAI
Setiap server GPU dilengkapi dengan Linux, driver NVIDIA dan CUDA yang sudah terinstal, sehingga Anda dapat menjalankan model dalam hitungan menit:
- Ollama – cara paling sederhana untuk mengunduh dan menjalankan model terbuka dengan satu perintah, dengan REST API lokal.
- vLLM – server inferensi throughput tinggi untuk produksi, dengan batching, tensor parallelism lintas GPU dan API yang kompatibel dengan OpenAI.
- llama.cpp – inferensi efisien untuk model terkuantisasi GGUF.
- Open WebUI – antarmuka bergaya ChatGPT untuk tim Anda di atas Ollama atau vLLM.
Karena Ollama dan vLLM menyediakan endpoint yang kompatibel dengan OpenAI, sebagian besar aplikasi yang dibangun untuk OpenAI API dapat beralih ke server Anda sendiri hanya dengan mengubah base URL.
LLM self-hosted atau API berbayar?
API berbayar praktis untuk penggunaan sesekali, tetapi tagihannya bertambah dengan setiap token. Saat aplikasi Anda mengirim permintaan sepanjang hari, server GPU dedicated biasanya lebih murah: harganya tetap sama baik Anda memproses seribu maupun sejuta permintaan. Self-hosting juga memungkinkan Anda memilih dan melakukan fine-tuning model terbuka, memegang kendali penuh atas pembaruan dan menjaga data sensitif tetap jauh dari layanan pihak ketiga.
Untuk apa tim menggunakannya
- Asisten internal dan chatbot yang dilatih dengan dokumen perusahaan (RAG).
- Otomatisasi dukungan pelanggan dan klasifikasi email.
- Asisten kode untuk tim pengembang.
- Peringkasan dokumen, terjemahan dan ekstraksi data.
- Fitur AI di dalam produk SaaS tanpa biaya per token.
Cara memesan
Pilih paket GPU di bawah dan periode penagihannya: 3 bulan, atau 12 bulan dengan diskon hingga 14%. Server GPU dikirim secara pre-order dalam 14 hari; jika kami melewati tanggal tersebut, Anda mendapatkan pengembalian dana penuh. Bandingkan semua kartu di halaman GPU server hosting.