Cần bao nhiêu VRAM để chạy Llama 3.1 70B?
Công thức tính tham số và KV cache theo context 8k–128k khi nhiều user đồng thời.
VRAM cho LLM = trọng số mô hình + KV cache + activation tạm. Bỏ KV cache sẽ ước lượng thấp, đặc biệt khi context 32k–128k hoặc nhiều session song song.
Trọng số theo precision
- FP16: 70B × 2 byte ≈ 140 GB — cần 2× H100 80 GB.
- INT8: ≈ 70 GB — vừa một H100, sát ngưỡng.
- 4-bit AWQ/GPTQ: ≈ 40–45 GB — A6000 48 GB hoặc 2× RTX 4090 tensor parallel.
KV cache theo context
GAML gần đúng: layers × 2 × hidden × seq_len × batch × bytes. Llama 70B context 8k, batch 4, FP16 có thể thêm 8–16 GB. Context 128k nhân lên nhanh; hãy giảm precision cache (FP8) hoặc giới hạn concurrent request.
Quy tắc thực tế: 7B–13B → RTX 4090; 32B 4-bit → 4090/5090; 70B 4-bit đa user → H100 hoặc cụm 2 GPU. Dùng VRAM Calculator trên site để ước lượng trước khi đặt máy.
Cần máy chủ cho workload này?
NOC thuemaychu.vn hỗ trợ chọn CPU, GPU và băng thông. PoC trong 24 giờ.
Bài viết liên quan
GPU Server là gì? Cách chọn GPU cho mô hình ngôn ngữ lớn
Khác biệt VRAM GDDR6X, GDDR7 và HBM3 khi nạp checkpoint mô hình lớn.
RTX 4090 vs RTX 5090: hiệu năng inference AI năm 2025
Băng thông GDDR7 1.792 GB/s và throughput token/s thực tế trên vLLM.
Cài Proxmox VE trên dedicated server với ZFS RAID 10
Tối ưu I/O NVMe enterprise, VLAN và IP tĩnh cho từng container LXC/VM.