Server dedicated 2x NVIDIA A100 untuk training dan fine-tuning
NVIDIA A100 adalah GPU pusat data berarsitektur Ampere yang dirancang untuk pelatihan AI dan komputasi berkinerja tinggi. Paket A100 kami menempatkan dua kartu A100 40 GB dalam satu server dedicated, memberikan total 80 GB memori HBM2 cepat, 52 core CPU, dan RAM 256 GB. Seluruh server sepenuhnya milik Anda: tanpa lapisan virtualisasi dan tanpa klien lain di GPU.
Spesifikasi NVIDIA A100 40GB
| Arsitektur | Ampere |
|---|---|
| Memori GPU | 40 GB HBM2 dengan ECC per kartu, total 80 GB |
| Bandwidth memori | 1,555 GB/s |
| Core CUDA | 6,912 per kartu |
| Multi-Instance GPU | Hingga 7 instance terisolasi per kartu |
| Konsumsi daya (TDP) | 250 W per kartu |
| Antarmuka | PCIe Gen4 x16, dual slot |
Konfigurasi server
Paket A100 berjalan pada HPE DL380 Gen10 dengan dua kartu NVIDIA A100 40 GB, dua prosesor Intel Xeon Gold 6230R (52 core, 104 thread), RAM ECC 256 GB, dan dua SAS-SSD enterprise 1.6 TB. Termasuk port jaringan 1 Gbps dengan trafik bulanan 30 TB, satu alamat IPv4, proteksi DDoS dasar, dan manajemen jarak jauh iLO.
Yang dapat Anda jalankan di 2x NVIDIA A100
- Fine-tuning – LoRA dan QLoRA pada model 13–34B, fine-tuning penuh model 7B.
- Inferensi 70B – bagi model 70B dalam 8-bit ke kedua GPU dengan tensor parallelism vLLM.
- Training – computer vision, sistem rekomendasi, dan model kustom dengan PyTorch atau TensorFlow.
- Beberapa pekerjaan sekaligus – jalankan dua beban kerja berdampingan, atau gunakan MIG untuk membagi setiap kartu menjadi GPU terisolasi yang lebih kecil.
- HPC dan data science – RAPIDS, simulasi, dan analitik berakselerasi GPU.
Harga dan penagihan NVIDIA A100
Harga pada tabel di atas adalah harga bulanan dengan penagihan triwulanan, 3 bulan di muka. Jika Anda membayar untuk 12 bulan, harga bulanan hingga 14% lebih rendah. Server GPU dikirimkan secara pre-order dalam 14 hari; jika kami melewati tanggal tersebut, Anda mendapatkan pengembalian dana penuh.
A100 atau GPU lain?
Pilih paket A100 untuk training, fine-tuning, dan beban kerja yang membutuhkan dua GPU. Jika Anda hanya menjalankan inferensi, satu kartu sering kali sudah cukup: lihat server dedicated NVIDIA A40 dengan 48 GB, atau server dedicated NVIDIA L4 untuk model yang lebih kecil dan video. Semua paket tercantum di halaman hosting server GPU.