NVIDIA A100 vs H100: GPU Mana untuk Beban Kerja LLM?

NVIDIA A100 vs H100: GPU Mana untuk Beban Kerja LLM?

Jawaban singkatnya: NVIDIA H100 adalah GPU yang lebih cepat, sering kali dengan selisih yang besar untuk beban kerja transformer, karena menambahkan presisi FP8 melalui Transformer Engine dan memiliki arsitektur yang lebih baru. A100 satu generasi lebih tua, tetapi masih menjalankan semua framework AI utama, lebih murah untuk dibeli maupun disewa, dan menangani fine-tuning serta inferensi untuk model berukuran kecil dan menengah dengan baik. Pilih H100 jika kecepatan pelatihan menentukan jadwal Anda, dan A100 jika biaya bulanan lebih penting dan model Anda muat dalam memori.

A100 vs H100: perbandingan spesifikasi

SpesifikasiA100 40GBA100 80GBH100 80GB
ArsitekturAmpereAmpereHopper
Tahun peluncuran202020202022
Memori40 GB HBM2, ECC80 GB HBM2e, ECC80 GB HBM
Bandwidth memori1,555 GB/s2,039 GB/sLebih tinggi dari A100
Dukungan FP8TidakTidakYa (Transformer Engine)
Multi-Instance GPUHingga 7 instanceHingga 7 instanceHingga 7 instance
TDP (versi PCIe)250 W300 WHingga 350 W

Kedua GPU bekerja dengan CUDA, PyTorch, TensorFlow, vLLM, dan TensorRT-LLM, sehingga kode Anda tidak perlu diubah saat berpindah di antara keduanya.

Perbedaan performa

Perbedaan terbesar berasal dari presisi. A100 mendukung FP32, FP16, BF16, dan INT8, tetapi tidak FP8. H100 menambahkan Transformer Engine yang secara otomatis mengalihkan lapisan antara FP8 dan presisi yang lebih tinggi selama pelatihan dan inferensi. FP8 memangkas penggunaan memori hingga separuh dibandingkan FP16 dan meningkatkan throughput.

Dalam praktiknya, H100 melatih model transformer jauh lebih cepat daripada A100 dan melayani lebih banyak permintaan per GPU pada saat inferensi. Keunggulan ini paling besar ketika tumpukan perangkat lunak menggunakan FP8, misalnya melalui TensorRT-LLM atau versi terbaru vLLM. Pada FP16 atau BF16, H100 tetap lebih cepat, tetapi selisihnya lebih kecil.

Penskalaan multi-GPU juga berbeda. Pada sistem HGX dan SXM, kartu H100 saling berkomunikasi melalui NVLink 4 dengan kecepatan hingga 900 GB/s. Kartu PCIe dari kedua generasi berkomunikasi lebih lambat, yang tidak terlalu berpengaruh untuk fine-tuning dan inferensi pada satu node.

Memori dan model mana yang muat

Memori menentukan model mana yang dapat Anda jalankan sama sekali. Aturan praktis yang berguna untuk bobot model:

  • FP16 atau BF16: sekitar 2 GB VRAM per miliar parameter
  • 8-bit: sekitar 1 GB per miliar parameter
  • 4-bit: sekitar 0.6 GB per miliar parameter

Tambahkan memori untuk konteks dan KV cache, yang bertambah seiring panjang urutan dan jumlah pengguna bersamaan. Dengan mempertimbangkan hal tersebut:

  • Model 7B dalam FP16 membutuhkan sekitar 14 GB untuk bobot dan berjalan dengan nyaman pada satu A100 40GB.
  • Model 13B dalam FP16 membutuhkan sekitar 26 GB, yang muat pada A100 40GB dengan konteks sedang.
  • Model 70B dalam 4-bit membutuhkan sekitar 42 GB, sehingga memerlukan kartu 80 GB atau dua kartu 40 GB dengan model yang dibagi di antara keduanya.
  • Model 70B dalam FP16 membutuhkan sekitar 140 GB dan tidak muat pada satu kartu 80 GB dari kedua tipe tersebut.

Fine-tuning penuh membutuhkan memori jauh lebih banyak daripada inferensi, karena gradien dan state optimizer juga berada di GPU. Metode seperti LoRA dan QLoRA mengurangi kebutuhan ini secara signifikan sehingga model berukuran menengah dapat di-fine-tune pada perangkat keras A100. Dukungan FP8 pada H100 memberinya ruang ekstra pada kapasitas 80 GB yang sama.

Biaya dan ketersediaan

H100 lebih mahal untuk dibeli dan lebih mahal untuk disewa per jam maupun per bulan. A100 telah lebih lama beredar di pasar, sehingga tersedia luas dari para penyedia hosting dengan harga lebih rendah. Pertanyaan sebenarnya adalah apakah kecepatan ekstra tersebut menghemat cukup waktu untuk membenarkan harganya. Jika proses pelatihan selesai dalam semalam pada A100 dan tidak ada yang menunggu hasilnya, membayar untuk kecepatan H100 hanya memberikan sedikit manfaat.

Kapan memilih A100

  • Anda menjalankan inferensi untuk model 7B hingga 13B, atau model lebih besar yang dikuantisasi.
  • Anda melakukan fine-tuning dengan LoRA atau QLoRA, bukan pelatihan dari awal.
  • Anggaran Anda lebih penting daripada waktu untuk memperoleh hasil.
  • Anda ingin membagi satu GPU menjadi beberapa instance terisolasi dengan MIG untuk beberapa tim atau layanan.

Kapan memilih H100

  • Anda melatih model transformer berukuran besar dan waktu pelatihan secara langsung memengaruhi jadwal produk Anda.
  • Anda melayani lalu lintas tinggi dan membutuhkan throughput maksimal per GPU.
  • Perangkat lunak Anda sudah menggunakan FP8 melalui Transformer Engine atau TensorRT-LLM.
  • Anda membutuhkan NVLink 4 di banyak GPU untuk pelatihan terdistribusi.

Server A100 di IPHOST

IPHOST menawarkan server dedicated 2x NVIDIA A100 yang ditempatkan di pusat data milik kami sendiri yang bersertifikat ISO/IEC 27001 di Chisinau, Moldova. Server ini adalah HPE DL380 Gen10 dengan dua kartu NVIDIA A100 40GB PCIe, dua prosesor Intel Xeon Gold 6230R (52 core), RAM 256 GB, dua SSD SAS 1.6 TB, dan port 1 Gbps dengan trafik 30 TB. Server tersedia melalui pre-order dengan pengiriman dalam 14 hari, ditagih per kuartal, dengan diskon hingga 14% jika Anda membayar untuk 12 bulan. Secara bersama-sama, kedua kartu memberi Anda memori GPU sebesar 80 GB.

Server ini cocok untuk inferensi privat dan fine-tuning, serta merupakan fondasi yang solid untuk hosting LLM. Jika beban kerja Anda lebih ringan, rangkaian hosting server GPU kami juga mencakup server dengan satu NVIDIA L4 24GB atau NVIDIA A40 48GB.

Kesimpulan

H100 unggul dalam kecepatan, terutama dengan FP8, dan merupakan pilihan yang tepat untuk pelatihan skala besar. A100 tetap menjadi GPU yang mumpuni dan hemat biaya untuk inferensi dan fine-tuning ketika Anda tidak membutuhkan generasi terbaru. Perkirakan kebutuhan memori Anda dan nilai dari waktu pelatihan, lalu tentukan pilihan.