GPU / AI

GPU Server là gì? Cách chọn GPU cho mô hình ngôn ngữ lớn

Khác biệt VRAM GDDR6X, GDDR7 và HBM3 khi nạp checkpoint mô hình lớn.

thuemaychu.vnCập nhật 20 Tháng 5, 2025
Khung máy chủ với GPU tăng tốc AI trong data center

GPU Server là máy chủ vật lý gắn một hoặc nhiều card NVIDIA, dùng PCIe Gen4/Gen5 và nguồn dư công suất để chạy tính toán song song. Với LLM, GPU không thay CPU hoàn toàn: CPU điều phối tokenizer, hàng đợi request và I/O, còn GPU giữ trọng số mô hình và KV cache trong VRAM.

VRAM quyết định mô hình nào chạy được

Checkpoint FP16 chiếm khoảng 2 byte mỗi tham số. Llama 3 8B cần ~16 GB, Llama 3.1 70B cần ~140 GB trước khi tính KV cache. Quantization AWQ/GPTQ 4-bit giảm còn khoảng 0,6 byte/tham số nhưng vẫn phải chừa VRAM cho context dài và batch size.

  • GDDR6X (RTX 3090/4090): 24 GB, phù hợp 7B–13B, SDXL, LoRA.
  • GDDR7 (RTX 5090): 32 GB, inference 32B–70B quantized, video AI.
  • HBM3 (H100 80 GB): huấn luyện và serving 70B+ với tensor parallel.

Cách chọn cấu hình thuê GPU Server

Chọn theo workload, không theo tên card. Inference chatbot latency thấp cần VRAM đủ nạp full model trên một card. Fine-tune LoRA 7B–13B chạy tốt trên RTX 4090 24 GB. Cụm 70B production nên dùng nhiều H100 với NVLink hoặc InfiniBand.

Tại thuemaychu.vn, GPU Server được đặt tại Data Center Tier III, cài sẵn CUDA, Docker, vLLM và Ollama. Bàn giao trong 15 phút, IPMI riêng, hỗ trợ NOC 24/7.

Cần máy chủ cho workload này?

NOC thuemaychu.vn hỗ trợ chọn CPU, GPU và băng thông. PoC trong 24 giờ.

Bài viết liên quan

Xem tất cả bài viết
GọiFBZaloSalesZaloOA