Panduan Lengkap: Memilih GPU Terbaik untuk Menjalankan LLM Lokal di 2026

Panduan Lengkap: Memilih GPU Terbaik untuk Menjalankan LLM Lokal di 2026

By Reggi, 19 Jul 2026

Ketika Elias membeli GPU-nya, dia tergiur dengan angka teraflop yang terpampang di kotak. Ia ingin menjalankan model coding 32B secara lokal. Elias memilih kartu dengan angka komputasi besar dan memori 16 GB, namun modelnya berjalan merangkak, hanya dua token per detik. Masalahnya, model tersebut tidak muat sepenuhnya di memori kartu grafisnya, sehingga tumpah ke RAM sistem, tempat kecepatannya anjlok drastis, lima hingga dua puluh kali lebih lambat. Kartu grafisnya memang cepat, tetapi Elias salah melihat angka prioritasnya.

Panduan ini adalah jawaban lengkap untuk pertanyaan yang salah dijawab Elias: GPU terbaik untuk menjalankan LLM lokal di perangkat keras Anda sendiri. Kami akan mulai dengan dasar-dasarnya, spesifikasi tunggal yang paling menentukan segalanya, serta perhitungan kuantisasi yang mengubah permainan. Kemudian, kami akan memeringkat dan membandingkan dua belas kartu, mulai dari harga Rp3 jutaan hingga server frontier Rp450 jutaan, lengkap dengan model spesifik dan presisi yang paling cocok untuk setiap kartu.

Kuncinya ada pada satu aturan utama: beli GPU berdasarkan VRAM terlebih dahulu. Jika modelnya muat di memori, ia akan berjalan cepat. Jika tidak muat, hal lain tidak akan berarti.

VRAM Adalah Kunci Utama

Sebuah model large language model (LLM) harus memuat weights atau bobotnya ke dalam memori untuk bisa berjalan. Sebuah GPU hanya bisa menggunakan model yang bobotnya muat di memori videonya, atau VRAM. Jika melebihi kapasitas VRAM, model tersebut akan tumpah ke RAM sistem biasa, yang jauh lebih lambat diakses. Penurunan performanya tidak bertahap. Contohnya, sebuah RTX 5090 yang menjalankan Llama 3.3 70B sepenuhnya di VRAM bisa menghasilkan lebih dari empat puluh token per detik. Namun, jika terpaksa mengalihkan sebagian ke RAM sistem, kecepatannya bisa turun menjadi satu atau dua token per detik, bahkan lebih lambat dari kecepatan membaca Anda.

Jadi, urutan pembelian GPU sudah jelas.

  1. VRAM menentukan model mana yang bisa Anda jalankan.
  2. Bandwidth menentukan seberapa cepat model tersebut berjalan setelah muat.
  3. Komputasi, atau teraflop di kotaknya, berada di urutan ketiga yang paling tidak relevan untuk inferensi. Prioritaskan VRAM, dan sisanya hanya tuning atau penyesuaian.

Kuantisasi Mengubah Permainan

Alasan model 70B yang dua tahun lalu membutuhkan server kini bisa berjalan di workstation adalah kuantisasi. Ini adalah proses kompresi weights dari presisi 16-bit ke 8-bit atau 4-bit. Kuantisasi memangkas penggunaan memori hingga 50 sampai 75 persen, dan penurunan kualitasnya lebih kecil dari yang kebanyakan orang duga. Sebagai panduan kasar, FP16 adalah baseline kualitas penuh, 8-bit mempertahankan sekitar 99 persen kualitas, dan 4-bit mempertahankan 90 hingga 95 persen, cukup mendekati sehingga model 4-bit biasanya sulit dibedakan dari aslinya.

Dalam angka, model 70B turun dari sekitar 140 GB pada presisi penuh menjadi sekitar 40 GB pada 4-bit. Format umum adalah GGUF (untuk inference berbasis CPU atau GPU ringan melalui llama.cpp, titik awal termudah) dan safetensors untuk inference berbasis GPU melalui vLLM. Kartu Blackwell menambahkan dukungan FP4 native, memangkas memori lagi hingga setengahnya dibandingkan 8-bit. Efek praktisnya, jika Anda melakukan kuantisasi dengan bijak, model yang seolah membutuhkan spesifikasi lebih tinggi seringkali bisa masuk ke dalam tier yang Anda mampu. Sepanjang panduan ini, Q4_K_M (khususnya Q4_K_M dalam GGUF) adalah asumsi default kecuali disebutkan lain.

Berapa Banyak VRAM yang Dibutuhkan Setiap Model?

Berikut adalah mapping yang seharusnya memandu pembelian Anda. Ini adalah angka perkiraan untuk bobot model pada 4-bit, sebelum memori tambahan yang digunakan oleh panjang konteks dan pengguna bersamaan. Jadi, anggap ini sebagai batas bawah dan tambahkan ruang cadangan.

Ukuran ModelVRAM yang Dibutuhkan (Perkiraan, 4-bit)Contoh ModelCatatan
7-14B5-9 GBLlama 3.1 8B, Qwen3 14B, Mistral 7BCocok untuk GPU 16 GB
27-32B17-20 GBQwen 32B, DeepSeek-R1 32BSweet spot untuk GPU 24 GB
70B~40 GBLlama 3.3 70BMembutuhkan GPU 48 GB+ tunggal atau dua kartu 32 GB
109B (MoE)~70-75 GBLlama 4 ScoutMembutuhkan GPU 80 GB+ tunggal
405B~250 GBMembutuhkan Mac Studio 256 GB+ atau kartu data center multi-GPU

Pola yang perlu diingat, kelas 27 hingga 32B pada kartu 24 GB adalah sweet spot nilai terbaik dari AI lokal saat ini. Model seperti Qwen 32B dan DeepSeek-R1 32B menawarkan kemampuan coding dan penalaran yang kuat, serta muat dalam satu kartu 24 GB pada 4-bit dengan ruang kepala untuk konteks. Di bawah itu, model 7 hingga 14B berjalan di hampir semua kartu dengan 16 GB VRAM. Di atas itu, 70B adalah tembok yang memaksa penggunaan kartu tunggal 48 GB-plus atau dua kartu 32 GB. Satu peringatan, KV cache yang menyimpan konteks akan bertambah seiring panjang prompt dan menambah beberapa gigabyte per pengguna bersamaan. Jadi, jika Anda melayani tim, anggarkan jauh di atas angka bobot saja.

GPU Terbaik untuk LLM Lokal, Berdasarkan Peringkat

Dua belas kartu, diurutkan secara kasar dari entry-level hingga frontier, masing-masing dengan kemampuan, model yang cocok, dan target penggunanya. Harga adalah perkiraan harga pasar pertengahan 2026. Kekurangan memori telah mendorong sebagian besar kartu di atas harga resminya, jadi pastikan daftar harga live dan periksa MillionMiner untuk ketersediaan.

Berikut daftar singkatnya sebelum kita masuk ke detail:

Kartu GPUVRAMBandwidthArsitektur (Fitur)Harga (Sekitar)Cocok untuk
RTX 5060 Ti16 GB GDDR7~448 GB/sBlackwell (FP4)~$4507-14B Q4/Q8 (pemula)
RTX 3090 (bekas)24 GB GDDR6X936 GB/sAmpere~$900Hingga 32B Q4 (pengembang serius)
RTX 409024 GB GDDR6X1.008 GB/sAda Lovelace~$2,400-$3,500Hingga 32B Q4 (kecepatan 24 GB maksimal)
RTX 509032 GB GDDR71.792 GB/sBlackwell (FP4)~$3,000-$5,00032B dengan headroom, 70B jika muat (raja konsumer)
RX 7900 XTX24 GB GDDR6960 GB/sRDNA 3 (ROCm 7.x)~$80024 GB models di Linux (alternatif non-NVIDIA)
Intel Arc B58012 GB GDDR6Battlemage~$2507-8B Q4 (pilihan termurah)
Mac Studio (M-series)Hingga 512 GB unified~400-820 GB/sApple SiliconMulai ~$2,000Model besar yang crash di GPU konsumer (kapasitas besar, senyap)
RTX PRO 6000 Blackwell96 GB GDDR7 ECC1.792 GB/sBlackwell (FP4)~$8,500 (kartu)70B FP8/Q8 di satu kartu (tim kecil, always-on)
A10080 GB HBM2e~2 TB/sAmpere70B Q4, fine-tuning QLoRA (kartu data center bernilai)
H10080 GB HBM33.35 TB/sHopper (FP8)Concurrent 70B serving (standar produksi)
H200141 GB HBM3e4.8 TB/sHopperProduksi terikat memori, konteks panjang
B200192 GB HBM3e~8 TB/sBlackwell (FP4)Inference & training skala frontier (flagship)

1. RTX 5060 Ti 16 GB: Awal yang Masuk Akal dengan Anggaran Terbatas

  • 16 GB GDDR7, sekitar 448 GB/s, Blackwell (FP4), sekitar $450
  • Paling cocok untuk: Model 7 hingga 14B pada Q4 atau Q8, berjalan dengan nyaman. Pikirkan Llama 3.1 8B, Qwen3 14B, Phi-4, Gemma 3, dan Mistral 7B untuk chat, bantuan coding, dan retrieval sederhana, dengan kecepatan 50 hingga 110 token per detik.
  • Terbaik untuk: Pengaturan lokal pertama Anda atau asisten coding yang ringan. Ini adalah kartu termurah saat ini dengan dukungan FP4 native. Peringatan jujur, 16 GB adalah keputusan satu tahun karena model terus berkembang. Jadi, jika Anda bisa sedikit berinvestasi lebih, RTX 3090 bekas 24 GB di bawah ini akan memberikan ruang cadangan selama bertahun-tahun dengan biaya yang tidak jauh lebih mahal.

2. RTX 3090 (bekas) 24 GB: Juara Nilai

  • 24 GB GDDR6X, 936 GB/s, sekitar $900 (bekas)
  • Paling cocok untuk: Semua model hingga kelas 32B pada Q4. Ini adalah rumah bagi Qwen 32B (salah satu model coding padat terbaik, sekitar 77 persen di SWE-bench) dan DeepSeek-R1 32B untuk penalaran, ditambah model 8 hingga 14B apa pun pada presisi lebih tinggi. Ini menghasilkan sekitar 87 persen throughput dari 4090.
  • Terbaik untuk: Pengembang solo serius yang menginginkan kemampuan paling banyak per dolar. Empat tahun setelah diluncurkan, kartu ini masih layak. 24 GB adalah keputusan tiga tahun yang jujur. Jika Anda membeli satu kartu dan ingin bertahan lama, ini adalah investasi paling cerdas dalam AI lokal.

3. RTX 4090 24 GB: 24 GB Tercepat, dengan Harga

  • 24 GB GDDR6X, 1.008 GB/s, sekitar $2,400 hingga $3,500 (dihentikan Oktober 2024)
  • Paling cocok untuk: Ukuran model yang sama dengan 3090 (hingga 32B pada Q4, 8B pada FP16, 20B tanpa offload), tetapi terasa lebih cepat. Sekitar 120 token per detik pada model 8B yang sepenuhnya ada di VRAM.
  • Terbaik untuk: Pembeli yang menginginkan kecepatan 24 GB maksimum dan menemukan harga yang tepat. Kekurangannya adalah nilai. Ini melakukan ukuran model yang sama dengan 3090 bekas dengan harga dua hingga tiga kali lipat, dan 5090 lebih cepat dengan VRAM lebih banyak. Layak hanya jika harganya di bawah sekitar $2,000.

4. RTX 5090 32 GB: Raja Konsumer

  • 32 GB GDDR7, 1.792 GB/s, Blackwell (FP4), sekitar $3,000 hingga $5,000
  • Paling cocok untuk: Model 32B solo dengan ruang kepala yang nyata (Qwen 32B, DeepSeek-R1 32B), model 34B pada Q8, dan 45+ token per detik pada model 70B jika muat. Throughput inference terkuantisasi dapat melebihi A100 40 GB yang lebih lama pada banyak beban kerja lokal.
  • Terbaik untuk: Prosumer yang menginginkan kartu konsumer tunggal tercepat, atau sepasang. Dua 5090 dapat digabungkan menjadi 64 GB yang dibutuhkan untuk 70B pada Q4. Kartu ini jarang dijual mendekati harga nominalnya, jadi berbelanjalah dengan hati-hati. Pilihan konsumer serba guna terbaik di tahun 2026.

5. Radeon RX 7900 XTX 24 GB: Pilihan Non-NVIDIA Terbaik

  • 24 GB GDDR6, 960 GB/s, RDNA 3, ROCm 7.x, sekitar $800
  • Paling cocok untuk: Rentang model 24 GB yang sama dengan 3090, hingga 32B pada Q4, di Linux melalui Ollama dan llama.cpp. ROCm 7.x telah membuat ini benar-benar stabil untuk inference.
  • Terbaik untuk: Pengguna Linux yang menginginkan 24 GB dengan harga ratusan dolar lebih murah dari kartu NVIDIA. Trade-off-nya adalah perangkat lunak. NVIDIA tetap menjadi default untuk vLLM, Unsloth, dan tooling produksi. Jadi, pilih AMD jika Anda sebagian besar menggunakan Ollama dan mengutamakan harga.

6. Intel Arc B580 12 GB: Cara Termurah untuk Memulai

  • 12 GB GDDR6, Battlemage, sekitar $250
  • Paling cocok untuk: Model 7 hingga 8B pada Q4, seperti Llama 3.2, Phi-4 Mini, dan Gemma. Cukup untuk merasakan inference lokal yang nyata dan memutuskan apakah akan berinvestasi lebih lanjut.
  • Terbaik untuk: Pintu masuk anggaran absolut dan para tinkerer atau hobbyist. Ini adalah rasio harga-ke-performa terbaik di bagian paling bawah, tetapi 12 GB membatasi Anda pada model kecil. Jadi, anggap ini sebagai langkah pertama daripada penggunaan harian.

7. Mac Studio (M-series): Alternatif Memori Terpadu

  • Memori terpadu hingga 512 GB, sekitar 400 hingga 820 GB/s, mulai sekitar $2,000
  • Paling cocok untuk: Model besar yang mungkin crash pada GPU konsumer. Mesin 128 GB menjalankan Llama 3.3 70B pada Q4 sekitar 12 hingga 15 token per detik. 256 GB ke atas dapat menampung model kelas 405B terkuantisasi. Memori terpadu Apple berarti RAM sistem adalah VRAM.
  • Terbaik untuk: Siapa pun yang menginginkan kapasitas model besar, kesunyian, dan daya rendah tanpa rig GPU. Kekurangannya adalah bandwidth yang lebih rendah, jadi token per second lebih lambat, dan berada di luar CUDA stack yang menjadi target sebagian besar alat training dan serving. VRAM per watt tak terkalahkan, namun bukan jalur tercepat.

8. RTX PRO 6000 Blackwell 96 GB: 70B dalam Satu Kartu

  • 96 GB GDDR7 ECC, 1.792 GB/s, tanpa NVLink, sekitar $8,500 (kartu)
  • Paling cocok untuk: Model 70B pada FP8 atau Q8 dalam SATU kartu dengan ruang kepala yang nyata untuk konteks panjang dan beberapa pengguna, ditambah model mixture-of-experts (MoE) 109B (Llama 4 Scout) pada Q4. Sekitar 829 token per detik pada model 32B di vLLM, dan lebih dari 1.500 pada model 120B pada 4-bit.
  • Terbaik untuk: Serving tim kecil yang selalu aktif, di mana Anda menginginkan kesederhanaan satu kartu daripada menyulap GPU konsumer. Bandwidth sama dengan 5090 dengan tiga kali lipat VRAM. Workstation atau server lengkap di sekitar kartu ini berharga sekitar $22,000 yang sudah dikonfigurasi.

9. A100 80 GB: Kartu Data Center Bernilai

  • 80 GB HBM2e, sekitar 2 TB/s, NVLink, data center
  • Paling cocok untuk: Model 70B pada Q4 dalam satu kartu, fine-tuning Llama 4 Scout QLoRA (sekitar 70 hingga 75 GB dengan Unsloth), dan model dense 7 hingga 34B apa pun dengan ruang kepala. Workhorse standar untuk fine-tuning yang hemat biaya.
  • Terbaik untuk: Tim yang membutuhkan memori data center sejati dan scaling NVLink yang bernilai. Ini tetap menjadi GPU server nilai terbaik untuk inference dan fine-tuning campuran, dan cocok untuk dibeli dan di deploy ke hosting daripada dijalankan di meja.

10. H100 80 GB: Standar Produksi

  • 80 GB HBM3, 3.35 TB/s, NVLink/NVSwitch, FP8, data center
  • Paling cocok untuk: Concurrent 70B serving melalui vLLM, di mana keuntungan sebenarnya terlihat. 70B single-stream menghasilkan sekitar 25 token per detik, tetapi lusinan pengguna dapat berbagi satu GPU tanpa penurunan kecepatan proporsional. FP8 mempercepat inference dan training.
  • Terbaik untuk: Inference dan training produksi dalam skala besar. Di sinilah serving serius berada, dan intinya adalah throughput di banyak pengguna, bukan kecepatan single-stream. Dibeli sebagai server dan di-deploy ke hosting.

11. H200 141 GB: Produksi Memori Maksimal

  • 141 GB HBM3e, 4.8 TB/s, data center
  • Paling cocok untuk: Model 70B dan yang lebih besar pada FP16 dalam satu GPU dengan ruang untuk KV cache yang sangat besar dan konteks panjang. Komputasi Hopper yang sama dengan H100 dengan memori yang jauh lebih banyak dan lebih cepat.
  • Terbaik untuk: Produksi yang terikat memori dan serving konteks panjang di mana 80 GB H100 menjadi faktor pembatas. Kartu yang dibeli dan di host, bukan bagian desktop.

12. NVIDIA B200 192 GB: Flagship Frontier

  • 192 GB HBM3e, sekitar 8 TB/s, Blackwell (FP4), data center
  • Paling cocok untuk: Inference dan training skala frontier. Ini memberikan 4 hingga 5 kali throughput inference H100, hingga 15 kali pada beban kerja LLM yang dioptimalkan, dan melayani model 70B pada FP16 dalam satu GPU dengan ruang cadangan untuk KV cache besar. FP4 native menggandakan throughput efektif lagi.
  • Terbaik untuk: Organisasi yang menginginkan throughput maksimum per GPU dan kompleksitas sistem terendah pada skala besar. Jika anggaran memungkinkan, ini mengurangi jumlah GPU dan kabel. MillionMiner menyediakan sibling Blackwell B100, papan 192 GB yang sama dengan daya lebih rendah, yang ditampilkan pada kartu ini. State of the art saat ini.

Multi-GPU dan Realita NVLink

Ketika satu kartu tidak cukup, kartu kedua akan memberi Anda VRAM aditif. Untuk inference, ini berhasil karena inference terikat memori. Tetapi ada kendala yang sering dilewatkan pembeli, NVLink, tautan langsung yang cepat antara GPU, telah dihapus dari kartu konsumer setelah RTX 3090. Dua 5090 atau dua PRO 6000 berkomunikasi melalui PCIe sebagai gantinya, membatasi scaling riil sekitar 70 hingga 80 persen. Jadi, dua kartu memberikan sekitar 1.4 hingga 1.5 kali throughput, bukan dua kali lipat.

Ada dua konsekuensi yang mengikuti. Untuk model yang muat pada satu kartu, satu kartu yang lebih besar selalu mengalahkan dua kartu yang lebih kecil. Ini adalah argumen untuk PRO 6000 96 GB dibandingkan dua kartu 32 GB pada tier 70B. Dan jika Anda menggunakan multi-GPU, pengaturan yang benar sangat penting. Kartu data center dengan NVLink, seperti A100, H100, dan yang lebih tinggi, scaling-nya jauh lebih bersih pada 85 hingga 93 persen, sebagian dari apa yang Anda bayar pada tier tersebut.

Beli atau Sewa? Perhitungan Jujur

Memiliki perangkat keras sendiri tidak selalu merupakan pilihan yang tepat. Faktor penentunya adalah utilisasi atau pemanfaatan. Kartu cloud ditagih per jam, sementara kartu yang dimiliki adalah biaya tetap yang Anda amortisasi di setiap jam ia berjalan. Titik crossover sudah jelas: di bawah sekitar 70 persen utilisasi berkelanjutan, menyewa lebih murah selama tiga tahun. Di atas sekitar 80 persen, perangkat keras yang dimiliki mencapai titik impas dalam empat hingga dua belas bulan.

Secara sederhana, jika Anda menyalakan model beberapa jam seminggu, Anda sebaiknya menyewa dan menghindari pemeliharaan. Jika Anda menjalankan inference sebagian besar waktu setiap hari, misalnya asisten yang selalu aktif, endpoint serving internal, atau fine-tuning berkelanjutan, Anda akan cepat masuk ke wilayah pembelian. Di sana, jalur kepemilikan terbagi lagi. Menjalankan workstation atau server GPU di rumah berarti konsumsi daya, panas, kebisingan, dan pemeliharaan driver semuanya menjadi tanggung jawab Anda. Alternatifnya adalah memiliki perangkat keras dan menempatkannya di fasilitas yang memang dirancang untuk itu: AI GPU hosting, atau colocation. Ini memberi Anda ekonomi kepemilikan dengan daya dan pendinginan yang tepat. Jadi, box multi-GPU berjalan dalam rack dan dipantau, bukan mengaum di bawah meja.

Pilihan Sesuai Kebutuhan Anda

  • Untuk coba-coba atau hobbyist: Intel Arc B580 atau RTX 5060 Ti untuk model 7 hingga 14B, atau berinvestasi lebih pada RTX 3090 bekas untuk ruang kepala 32B.
  • Pengembang solo serius: RTX 3090 bekas untuk nilai, atau RTX 5090 untuk pengalaman satu kartu tercepat.
  • Prosumer yang menjalankan 70B di rumah: Dua RTX 5090 (64 GB) pada Q4, atau satu RTX PRO 6000 (96 GB) untuk menghindari penalti PCIe. Mac Studio dengan 128 GB atau lebih, menerima token yang lebih lambat demi kapasitas dan daya rendah.
  • Tim kecil, serving yang selalu aktif: RTX PRO 6000, atau A100, idealnya di-host daripada dijalankan di lokasi.
  • Skala produksi atau enterprise: H100, H200, atau B200 untuk throughput bersamaan, dibeli sebagai server dan di-deploy ke hosting.

Elias mengembalikan kartu cepat dengan memori yang terlalu sedikit dan membeli 3090 bekas. Model 32B yang tadinya merangkak kini berjalan dengan kecepatan yang bisa digunakan, seluruhnya di VRAM, pada kartu yang lebih murah. Itu adalah inti dari seluruh panduan ini: GPU yang tepat untuk LLM lokal adalah yang memiliki memori yang cukup untuk menampung model yang Anda inginkan, lalu bandwidth yang cukup untuk menjalankannya dengan cepat. Komputasi adalah hal terakhir yang perlu Anda khawatirkan.

Putuskan modelnya, lihat kebutuhan VRAM dari tabel, beli satu tier di atasnya untuk ruang kepala, dan periksa apakah penggunaan Anda membenarkan kepemilikan sama sekali. Jika ya, jalur termudah adalah memiliki hardware yang di-host di mana daya dan pendinginan ditangani, dan untuk mem-benchmark kartu yang tepat sebelum Anda berkomitmen. Beli berdasarkan memori, bukan pemasaran.

Pertanyaan yang Sering Diajukan

Apa GPU terbaik untuk menjalankan LLM lokal di 2026? Tergantung pada ukuran model yang ingin Anda jalankan, tetapi bagi kebanyakan orang, pilihan terbaik adalah RTX 3090 bekas (24 GB) dengan harga sekitar $900, yang mampu menangani model hingga 32B. RTX 5090 (32 GB) adalah raja kecepatan konsumen, dan RTX PRO 6000 Blackwell (96 GB) menjalankan 70B dalam satu kartu. Cocokkan VRAM dengan model target Anda terlebih dahulu, lalu optimalkan bandwidth.

Berapa banyak VRAM yang saya butuhkan untuk menjalankan model 70B secara lokal? Sekitar 40 GB pada 4-bit hanya untuk bobotnya saja, sebelum konteks dan konkurensi, yang meniadakan penggunaan kartu 24 GB tunggal. Pilihan realistis adalah kartu tunggal 48 GB-plus (RTX 6000 Ada, A100), dua RTX 5090 32 GB yang digabungkan menjadi 64 GB, RTX PRO 6000 96 GB, atau Mac dengan memori terpadu 128 GB. Pada FP16 penuh, model 70B membutuhkan sekitar 140 GB, yang merupakan wilayah data center.

GPU mana yang menjalankan Qwen 32B atau DeepSeek-R1 32B? Satu kartu 24 GB menangani kelas 32B pada Q4_K_M, itulah sebabnya RTX 3090 bekas (24 GB) adalah sweet spot nilai terbaik. Qwen 32B membutuhkan sekitar 19 GB pada Q4 dan DeepSeek-R1 32B sekitar jumlah yang sama, keduanya muat di 3090, RTX 4090, RTX 5090, atau Radeon RX 7900 XTX dengan ruang kepala konteks. Model 32B ini adalah kualitas terbaik yang dapat Anda jalankan dengan nyaman pada satu kartu yang terjangkau.

Apakah RTX 5090 atau RTX 3090 bekas lebih baik untuk LLM lokal? 5090 (32 GB) jauh lebih cepat dan menampung model yang sedikit lebih besar, tetapi dengan harga $3,000 hingga $5,000, harganya beberapa kali lipat dari 3090 bekas (24 GB, sekitar $900). Bagi sebagian besar pengguna, 3090 adalah nilai yang lebih baik, menjalankan ukuran yang sama hingga 32B hanya lebih lambat. Pilih 5090 untuk kecepatan satu kartu maksimum atau 8 GB tambahan, pilih 3090 untuk kemampuan per dolar.

Apakah kuantisasi mengurangi kualitas model? Lebih sedikit dari yang kebanyakan orang duga. FP16 adalah baseline, 8-bit mempertahankan sekitar 99 persen kualitas, dan 4-bit mempertahankan sekitar 90 hingga 95 persen, sulit dibedakan untuk sebagian besar tugas sambil menggunakan 50 hingga 75 persen lebih sedikit memori. Q4_K_M di GGUF adalah default praktis untuk penggunaan lokal, sisakan 8-bit atau FP16 untuk pekerjaan yang sensitif presisi.

Bisakah saya menjalankan LLM lokal di GPU AMD atau Intel? Ya. Radeon RX 7900 XTX (24 GB) AMD dengan ROCm 7.x menjalankan model hingga 32B dengan baik di Linux melalui Ollama, dan Intel Arc B580 (12 GB) adalah entri murah untuk model 7 hingga 8B. NVIDIA tetap menjadi default karena CUDA mendukung vLLM, Unsloth, dan tooling produksi secara out of the box, tetapi AMD adalah pilihan nilai yang sah untuk pengaturan Linux berbasis Ollama.

Haruskah saya membeli GPU atau menyewa GPU cloud? Ini tergantung pada utilisasi. Di bawah sekitar 70 persen penggunaan berkelanjutan, menyewa lebih murah selama tiga tahun dan menghindari pemeliharaan. Di atas sekitar 80 persen, kepemilikan mencapai titik impas dalam empat hingga dua belas bulan. Sewa untuk pekerjaan sesekali atau bursty, beli untuk inference yang selalu aktif, serving internal, atau fine-tuning berkelanjutan. Untuk beban kerja berat yang dimiliki, hosting perangkat keras menangkap ekonomi kepemilikan tanpa menjalankan kartu panas di rumah.

Bisakah Mac menjalankan LLM lokal sebagai pengganti GPU khusus? Ya. Apple Silicon menggunakan memori terpadu yang dibagi antara CPU dan GPU. Jadi, Mac Studio dengan 128 GB menjalankan model 70B pada 4-bit sekitar 12 hingga 15 token per detik, dan mesin yang lebih besar menampung model kelas 405B terkuantisasi. Trade-off-nya adalah bandwidth yang lebih rendah dari GPU khusus, sehingga token per second lebih lambat, dan berada di luar CUDA stack yang menjadi target sebagian besar alat.

GPU mana yang terbaik untuk data center atau serving produksi? Untuk produksi, NVIDIA H100 (80 GB) adalah standar untuk concurrent serving melalui vLLM, H200 (141 GB) menambah memori untuk model yang lebih besar dan konteks panjang, dan B200 (192 GB) memberikan 4 hingga 5 kali throughput inference H100 untuk skala frontier. A100 (80 GB) tetap menjadi pilihan nilai. Ini dibeli sebagai server dan biasanya di-deploy ke hosting di mana daya dan pendinginan ditangani.


Referensi

https://millionminer.com/news/best-gpu-for-running-llms-locally


🔥 Sedang Ramai Dibaca