NVIDIA L4 vs A100: GPU Mana untuk Inferensi atau Pelatihan?

NVIDIA L4 vs A100: GPU Mana untuk Inferensi atau Pelatihan?

Jika Anda sedang membandingkan NVIDIA L4 dan A100, berikut jawaban singkatnya: pilih L4 untuk inferensi yang efisien dan pekerjaan video, dan pilih A100 untuk pelatihan, fine-tuning, dan model yang lebih besar. Kedua kartu ini berasal dari generasi yang berbeda dan dirancang untuk tugas yang berbeda. Panduan ini membahas perbedaan yang penting dalam praktik.

L4 vs A100: spesifikasi berdampingan

SpesifikasiNVIDIA L4NVIDIA A100 40GB (PCIe)
ArsitekturAda Lovelace (2023)Ampere (2020)
Memori24 GB GDDR6 ECC40 GB HBM2 ECC
Bandwidth memori300 GB/s1,555 GB/s
CUDA core7,4246,912
Daya (TDP)72 W250 W
Dukungan FP8YaTidak
Multi-Instance GPU (MIG)TidakHingga 7 instance
Encode video perangkat kerasAV1, HEVC, H.264Tidak ada

Memori dan ukuran model

VRAM menentukan model mana yang dapat Anda muat sama sekali. Aturan praktis yang berguna untuk model bahasa:

  • FP16: sekitar 2 GB per miliar parameter
  • 8-bit: sekitar 1 GB per miliar parameter
  • 4-bit: sekitar 0.6 GB per miliar parameter

Selain itu, jendela konteks (KV cache) membutuhkan memori yang bertambah seiring panjang prompt dan jumlah permintaan paralel.

Dengan 24 GB, L4 menjalankan model 7B atau 8B dalam FP16 dengan ruang untuk konteks, serta model hingga sekitar 30B dalam 4-bit. A100 40GB menjalankan model 13B dalam FP16 atau model kelas 30B dalam 8-bit, dengan ruang lebih lega untuk konteks yang panjang. Model 70B dalam 4-bit membutuhkan sekitar 42 GB sebelum konteks, sehingga tidak muat pada satu A100 40GB, tetapi Anda dapat membaginya ke dua kartu.

Throughput dan bandwidth memori

L4 memiliki lebih banyak CUDA core dan arsitektur yang lebih baru, namun A100 biasanya melayani LLM lebih cepat. Alasannya adalah bandwidth memori. Menghasilkan setiap token berarti membaca bobot model dari memori, sehingga perpindahan data sering kali lebih membatasi kecepatan daripada komputasi.

A100 memindahkan data sekitar lima kali lebih banyak per detik dibandingkan L4. A100 menghasilkan token lebih cepat pada model yang sama dan bertahan jauh lebih baik dengan batch besar dan banyak pengguna bersamaan. L4 cocok untuk lalu lintas sedang, alat internal, dan API. Dukungan FP8 natifnya juga membantu: engine yang menggunakan FP8 memangkas penggunaan memori dan mempersempit sebagian kesenjangan pada model yang didukung.

Daya dan efisiensi

L4 mengonsumsi daya 72 W; A100 mengonsumsi 250 W. Untuk inferensi yang muat dalam 24 GB, L4 menghasilkan jauh lebih banyak pekerjaan per watt, dan desainnya yang single-slot dan low-profile muat dalam server 1U standar. Hal ini menjadikannya pilihan yang baik untuk layanan always-on dengan beban yang stabil. A100 menggunakan daya lebih besar tetapi menyelesaikan pekerjaan berat lebih cepat, sehingga untuk pelatihan, total waktu dan energi per proses lebih penting daripada konsumsi daya semata.

Beban kerja video

Di sinilah kedua kartu paling berbeda. L4 melakukan encode dan decode AV1, HEVC, dan H.264 secara perangkat keras, sehingga menangani transcoding, streaming, dan analitik video dalam satu kartu berdaya rendah. A100 tidak memiliki encoder perangkat keras, yang menjadikannya pilihan yang kurang tepat untuk video. Jika Anda mengganti kartu T4 yang lebih lama, L4 adalah penerus alaminya dalam peran berdaya rendah yang sama. L4 juga bekerja dengan baik untuk computer vision dan pengenalan suara.

Pelatihan dan fine-tuning

Pelatihan membutuhkan memori untuk bobot, gradien, state optimizer, dan aktivasi, sering kali beberapa kali lebih banyak daripada inferensi. A100 dibangun untuk ini: memori lebih besar, bandwidth lebih tinggi, batch lebih besar. MIG memungkinkan Anda membagi satu kartu menjadi hingga tujuh instance terisolasi untuk eksperimen atau beberapa tim kecil. L4 dapat menangani fine-tuning LoRA atau QLoRA ringan pada model kecil, tetapi jika fine-tuning merupakan bagian dari pekerjaan rutin Anda, pilih A100.

Pertimbangan biaya

L4 lebih murah untuk disewa dan dijalankan, sehingga untuk inferensi yang muat dalam 24 GB, L4 biasanya memberikan biaya per permintaan yang paling rendah. A100 lebih mahal, tetapi dapat menggantikan beberapa kartu yang lebih kecil ketika Anda membutuhkan model lebih besar, throughput lebih tinggi, atau kapasitas pelatihan. A100 yang sebagian besar waktunya menganggur saat melayani model kecil berarti pemborosan uang; pekerjaan pelatihan yang dipaksakan pada L4 berarti pemborosan waktu.

Cara memilih

  • Melayani model 7–8B, atau hingga ~30B dalam 4-bit? Pilih L4.
  • Transcoding, streaming, atau analitik video? Pilih L4.
  • Layanan always-on dengan anggaran daya yang ketat? Pilih L4.
  • Pelatihan atau fine-tuning rutin? Pilih A100.
  • Model lebih besar, konteks panjang, atau banyak pengguna bersamaan? Pilih A100.

Server L4 dan A100 di IPHOST

IPHOST mengoperasikan server GPU dedicated di pusat data milik sendiri yang bersertifikat ISO/IEC 27001 di Chisinau, Moldova. Server dedicated NVIDIA L4 kami dibangun di atas HPE DL360 Gen10 dengan Intel Xeon Gold 6248 (20 core), RAM 128 GB, dan 2x SAS-SSD 1.6 TB.

Untuk pelatihan dan model yang lebih besar, server dedicated 2x NVIDIA A100 menggunakan HPE DL380 Gen10 dengan dua prosesor Xeon Gold 6230R (total 52 core) dan RAM 256 GB. Kedua kartu memberi Anda memori GPU 80 GB untuk membagi satu model. Jika Anda menginginkan memori lebih besar pada satu kartu, lihat server NVIDIA A40 dengan 48 GB.

Setiap server GPU dilengkapi port 1 Gbps dan trafik 30 TB. Kami mengirimkan melalui pre-order dalam 14 hari dan menagih per kuartal, dengan diskon hingga 14% untuk 12 bulan. Jika Anda tidak ingin mengelola tumpukan perangkat lunak sendiri, lihat layanan hosting LLM kami.

Kesimpulan

L4 dan A100 sebenarnya tidak saling bersaing. L4 adalah kartu berdaya rendah yang efisien untuk inferensi, vision, dan video; A100 adalah kartu dengan bandwidth tinggi untuk pelatihan, fine-tuning, dan model yang lebih besar. Mulailah dari ukuran model dan beban kerja Anda, dan pilihannya biasanya menjadi jelas.