Hosting LLM di Server GPU Dedicated

Jalankan Llama, Mistral, Qwen atau DeepSeek di server GPU NVIDIA dedicated milik Anda sendiri, dengan harga bulanan tetap dan tanpa biaya per token, di pusat data ISO/IEC 27001 kami di Chisinau.

  • Model privat Data Anda tetap di server Anda
  • Ollama dan vLLM API yang kompatibel dengan OpenAI
  • VRAM hingga 80 GB L4 A40 dan 2x A100
  • Harga bulanan tetap Tanpa biaya per token
Hosting LLM di Server GPU Dedicated

Server GPU untuk hosting LLM

GPU L4 24GB
1x Xeon Gold 6248
Inferensi AI, transcoding video, dan VDI: satu NVIDIA L4 24 GB hemat daya pada HPE DL360 Gen10. Diskon hingga 14% saat membayar untuk 12 bulan.
Prosesor 20 core
Memori 128 GB
Penyimpanan SSD 2× 1.6 TB SSD
Waktu penyerahan 14 hari
396.29 $/bulan ≈ Rp 7.114.000/bulan·belum termasuk PPN
Pesan sekarang
GPU 2x A100 40GB
2x Xeon Gold 6230R
Pelatihan dan fine-tuning model: dua kartu NVIDIA A100 40 GB dan RAM 256 GB. Diskon hingga 14% saat membayar untuk 12 bulan.
Prosesor 52 core
Memori 256 GB
Penyimpanan SSD 2× 1.6 TB SSD
Waktu penyerahan 14 hari
1191.14 $/bulan ≈ Rp 21.381.000/bulan·belum termasuk PPN
Pesan sekarang

Harga dalam Rupiah bersifat perkiraan; tagihan dalam USD.

Apa yang termasuk di setiap paket

Perangkat keras

  • 2x 1.6 TB HGST SAS-SSD
  • Manajemen jarak jauh iLO

Jaringan

  • Port jaringan 1 Gbps
  • Trafik bulanan 30 TB
  • 1 IPv4

Proteksi DDoS

  • Proteksi DDoS dasar

Dukungan

  • Dukungan dasar Dukungan dasar mencakup penggantian gratis perangkat keras yang rusak serta instalasi atau instalasi ulang sistem operasi dasar.
  • Unmanaged
  • OS pilihan Anda
  • Proxmox sesuai permintaan
  • RAID hardware
  • Termasuk 1 IPv4
3,000+
Klien aktif
14+
Tahun pengalaman
24/7
Dukungan teknis

Lokasi Server IPHOST

World Map - Server Locations
Ashburn, AS · segera hadir
London, Inggris · segera hadir
Amsterdam, Belanda · segera hadir
Bukares, Rumania
Chisinau, Moldova
  • Chisinau, Moldova
  • Bukares, Rumania
  • Amsterdam, Belanda · segera hadir
  • London, Inggris · segera hadir
  • Ashburn, AS · segera hadir
Uptime server 99.98%
Suhu Rata-rata 24 °C
Jaringan 80 Gbps
3 carrier transit + 4 IXP
2× generator 250 kW
Sistem proteksi kebakaran

Opsi untuk server dedicated Anda

Alamat IPv4 tambahan

Alamat IPv4 tambahan

Hingga 8 alamat IPv4 tambahan per server, untuk SSL, email, atau proyek terpisah.

Harga berdasarkan permintaan
Backup eksternal

Backup eksternal

Ruang backup di luar server, dapat diakses melalui FTP atau NFS, untuk salinan data Anda yang terjadwal.

Harga berdasarkan permintaan
Pengumuman BGP subnet /24

Pengumuman BGP subnet /24

Kami mengumumkan blok alamat /24 milik Anda dari jaringan kami: setup $58, lalu $23/bulan.

Harga berdasarkan permintaan
Dukungan lanjutan

Dukungan lanjutan

Pekerjaan pada sistem operasi dan aplikasi sesuai permintaan: $46/jam.

Harga berdasarkan permintaan

Hosting LLM privat di server GPU dedicated

Jalankan model bahasa besar Anda sendiri di server GPU NVIDIA dedicated alih-alih membayar per token ke API pihak ketiga. Dengan hosting LLM di IPHOST, model, prompt dan jawabannya tetap berada di hardware yang hanya Anda gunakan, di pusat data kami yang bersertifikat ISO/IEC 27001 di Chisinau. Anda mendapatkan akses root penuh, harga bulanan tetap dan tanpa batas permintaan atau token.

GPU mana untuk model mana

Jumlah memori GPU (VRAM) menentukan model mana yang dapat Anda jalankan. Sebagai patokan, sebuah model membutuhkan sekitar 2 GB VRAM per miliar parameter dalam FP16, sekitar 1 GB dalam 8-bit dan sekitar 0.6 GB dalam 4-bit, ditambah ruang untuk konteks.

Ukuran modelContoh modelPaket yang direkomendasikan
7–8B dalam FP16Llama 3.1 8B, Mistral 7B, Qwen 2.5 7BNVIDIA L4 24 GB
13–32B dalam 4-bitQwen 2.5 32B, DeepSeek-R1 Distill 32B, Gemma 2 27BNVIDIA L4 24 GB atau A40 48 GB
13–20B dalam FP16Phi-4 14B, Qwen 2.5 14BNVIDIA A40 48 GB
70B dalam 4-bitLlama 3.3 70B, Qwen 2.5 72BNVIDIA A40 48 GB
70B dalam 8-bit, fine-tuningLlama 3.3 70B, LoRA pada model 13–34B2x NVIDIA A100 40 GB

Lihat detail setiap kartu: server dedicated NVIDIA L4, server dedicated NVIDIA A40 dan server dedicated 2x NVIDIA A100.

Ollama, vLLM dan API yang kompatibel dengan OpenAI

Setiap server GPU dilengkapi dengan Linux, driver NVIDIA dan CUDA yang sudah terinstal, sehingga Anda dapat menjalankan model dalam hitungan menit:

  • Ollama – cara paling sederhana untuk mengunduh dan menjalankan model terbuka dengan satu perintah, dengan REST API lokal.
  • vLLM – server inferensi throughput tinggi untuk produksi, dengan batching, tensor parallelism lintas GPU dan API yang kompatibel dengan OpenAI.
  • llama.cpp – inferensi efisien untuk model terkuantisasi GGUF.
  • Open WebUI – antarmuka bergaya ChatGPT untuk tim Anda di atas Ollama atau vLLM.

Karena Ollama dan vLLM menyediakan endpoint yang kompatibel dengan OpenAI, sebagian besar aplikasi yang dibangun untuk OpenAI API dapat beralih ke server Anda sendiri hanya dengan mengubah base URL.

LLM self-hosted atau API berbayar?

API berbayar praktis untuk penggunaan sesekali, tetapi tagihannya bertambah dengan setiap token. Saat aplikasi Anda mengirim permintaan sepanjang hari, server GPU dedicated biasanya lebih murah: harganya tetap sama baik Anda memproses seribu maupun sejuta permintaan. Self-hosting juga memungkinkan Anda memilih dan melakukan fine-tuning model terbuka, memegang kendali penuh atas pembaruan dan menjaga data sensitif tetap jauh dari layanan pihak ketiga.

Untuk apa tim menggunakannya

  • Asisten internal dan chatbot yang dilatih dengan dokumen perusahaan (RAG).
  • Otomatisasi dukungan pelanggan dan klasifikasi email.
  • Asisten kode untuk tim pengembang.
  • Peringkasan dokumen, terjemahan dan ekstraksi data.
  • Fitur AI di dalam produk SaaS tanpa biaya per token.

Cara memesan

Pilih paket GPU di bawah dan periode penagihannya: 3 bulan, atau 12 bulan dengan diskon hingga 14%. Server GPU dikirim secara pre-order dalam 14 hari; jika kami melewati tanggal tersebut, Anda mendapatkan pengembalian dana penuh. Bandingkan semua kartu di halaman GPU server hosting.

Ulasan Google dari Pelanggan Kami

Andrei Ursu
Andrei Ursu

We are working for more then 10 years with IPHOST - always good services and very friendly staff.

Paul Belce
Paul Belce

Easy to use for beginners, all functions at a glance, the site builder was very useful

Blue Dj
Blue Dj

Nu folosesc de mult acest serviciu dar pana acu functioneaza totu ok

George Deac
George Deac

[Style: fractal contemporary orchestral-electronic fusion — gradual evolution from minimal sound particles to complex neural resonance.] [Structure: ~6:00 duration. Begins from silence — microscopic pulses forming into… Baca di Google

Vasile Radu
Vasile Radu

Everything went habubu! Smooth and silk process where everything works!

Kisah sukses

Dumitru Talmazan

Konsultan bisnis dan pendiri · Talmazan School

Ion Curmei

Direktur Pelaksana · Panda Tur

Elena Dorotova

Direktur Pemasaran · ALFA Diagnostica

Vitalie Plamadeala

Direktur Teknis · ProTV

Bergabunglah dengan Program Afiliasi kami untuk LLM Hosting!

Rekomendasikan server GPU IPHOST untuk LLM hosting ke jaringan Anda dan dapatkan 10% dari setiap transaksi mereka, termasuk pembayaran berulang.

Gabung Sekarang
IPHOST Robot Assistant

FAQ Server Dedicated

Jawaban untuk pertanyaan umum seputar server dedicated, pengaturan, pengelolaan, dan performa.

LLM hosting berarti menjalankan large language model di server Anda sendiri, bukan menggunakan API pihak ketiga. Anda memilih modelnya, mengendalikan datanya, dan membayar harga tetap untuk perangkat keras alih-alih membayar per token.

Llama 3 70B yang dikuantisasi ke 4-bit membutuhkan sekitar 40 GB VRAM, sehingga dapat berjalan di NVIDIA A40 dengan 48 GB. Untuk kualitas 8-bit atau fine-tuning, pilih paket 2x NVIDIA A100 dengan total 80 GB.

Ya. Ollama dan vLLM sama-sama menyediakan endpoint yang kompatibel dengan OpenAI, sehingga aplikasi yang ditulis untuk API OpenAI dapat menggunakan server Anda cukup dengan mengubah base URL dan nama model.

Untuk penggunaan harian yang stabil, biasanya ya: server GPU dedicated memiliki harga bulanan tetap tanpa biaya per token. Untuk beban kerja yang sesekali atau sangat kecil, API bayar sesuai pemakaian bisa lebih murah.