Công cụ tính

Cần bao nhiêu VRAM để chạy Llama 3.1 70B?

Công thức tính tham số và KV cache theo context 8k–128k khi nhiều user đồng thời.

thuemaychu.vnCập nhật 10 Tháng 5, 2025
Sơ đồ bộ xử lý tính toán token và trọng số mạng nơ-ron

VRAM cho LLM = trọng số mô hình + KV cache + activation tạm. Bỏ KV cache sẽ ước lượng thấp, đặc biệt khi context 32k–128k hoặc nhiều session song song.

Trọng số theo precision

  • FP16: 70B × 2 byte ≈ 140 GB — cần 2× H100 80 GB.
  • INT8: ≈ 70 GB — vừa một H100, sát ngưỡng.
  • 4-bit AWQ/GPTQ: ≈ 40–45 GB — A6000 48 GB hoặc 2× RTX 4090 tensor parallel.

KV cache theo context

GAML gần đúng: layers × 2 × hidden × seq_len × batch × bytes. Llama 70B context 8k, batch 4, FP16 có thể thêm 8–16 GB. Context 128k nhân lên nhanh; hãy giảm precision cache (FP8) hoặc giới hạn concurrent request.

Quy tắc thực tế: 7B–13B → RTX 4090; 32B 4-bit → 4090/5090; 70B 4-bit đa user → H100 hoặc cụm 2 GPU. Dùng VRAM Calculator trên site để ước lượng trước khi đặt máy.

Cần máy chủ cho workload này?

NOC thuemaychu.vn hỗ trợ chọn CPU, GPU và băng thông. PoC trong 24 giờ.

Bài viết liên quan

Xem tất cả bài viết
GọiFBZaloSalesZaloOA