1. Mengapa CPU Biasa Kewalahan Menjalankan LLM?
Central Processing Unit (CPU) konvensional dirancang sebagai arsitektur generalis: memiliki sedikit core (4 hingga 32 core) dengan clock speed tinggi dan memori cache yang besar. Desain ini sangat ideal untuk tugas sekuensial (serial logic) seperti sistem operasi, browser web, atau game interaktif.
Namun, Large Language Model tidak membutuhkan kalkulasi sekuensial yang rumit. LLM membutuhkan jutaan operasi perkalian dan penjumlahan matriks (GEMM - General Matrix Multiply) secara paralel untuk setiap token kata yang dihasilkan.
Di sinilah GPU (Graphics Processing Unit) dan Tensor Cores mendominasi: GPU memiliki ribuan core kecil yang mampu memproses ratusan ribu operasi matematika sederhana secara serentak dalam satu siklus clock.
2. Terobosan Unified Memory Architecture (UMA)
Selama bertahun-tahun, bottleneck terbesar dalam komputasi AI adalah Memory Bandwidth dan batas VRAM kartu grafis PC tradisional. Jika Anda memiliki GPU dengan 16 GB VRAM, Anda tidak dapat memuat model AI yang membutuhkan 18 GB bobot memori, meskipun PC Anda memiliki RAM 128 GB. Terjadi transfer data yang lambat via slot PCIe.
Apple Silicon (chip M-Series: M2, M3, M4) merevolusi paradigma ini dengan Unified Memory Architecture (UMA):
- CPU, GPU, dan Neural Engine (NPU) mengakses kolam memori yang sama persis tanpa perlu menyalin data antar bus fisik.
- Sebuah MacBook atau Mac Studio dengan Unified Memory 64 GB hingga 128 GB dapat mengalokasikan hingga 96 GB langsung untuk bobot model AI.
- Hasilnya: model AI kelas frontier (70 Miliar Parameter) dapat dimuat dan dijalankan secara mandiri di satu laptop tanpa server rack data center seharga miliaran rupiah.
3. Keajaiban Kuantisasi: FP16 Menuju INT8 dan INT4
Saat sebuah model AI selesai dilatih di superkomputer, bobot setiap parameternya biasanya disimpan dalam format presisi mengambang 16-bit (FP16), yang membutuhkan 2 byte memori per parameter. Model 70B parameter membutuhkan minimal 140 GB VRAM murni hanya untuk dimuat ke memori.
Melalui teknik Kuantisasi (Quantization) seperti GGUF, AWQ, dan EXL2:
| Format Presisi | Kebutuhan Memori (Model 7B) | Kebutuhan Memori (Model 70B) | Penurunan Kualitas Nalar |
|---|---|---|---|
| FP16 (Original) | ~14.5 GB | ~140 GB | 0% (Baseline) |
| INT8 (8-bit) | ~8.0 GB | ~72 GB | < 0.5% (Tidak Terasa) |
| INT4 (Q4_K_M) | ~4.5 GB | ~39 GB | < 1.5% (Sangat Optimal) |
Dengan kuantisasi 4-bit, ukuran model terkompresi hingga 70% dengan penurunan akurasi nalar di bawah 2%. Hal inilah yang memungkinkan laptop komersial biasa menjalankan karyawan AI cerdas dengan latensi respons 25–45 token per detik.
