GPU Server là gì? Cách chọn GPU cho mô hình ngôn ngữ lớn
Khác biệt VRAM GDDR6X, GDDR7 và HBM3 khi nạp checkpoint mô hình lớn.
GPU Server là máy chủ vật lý gắn một hoặc nhiều card NVIDIA, dùng PCIe Gen4/Gen5 và nguồn dư công suất để chạy tính toán song song. Với LLM, GPU không thay CPU hoàn toàn: CPU điều phối tokenizer, hàng đợi request và I/O, còn GPU giữ trọng số mô hình và KV cache trong VRAM.
VRAM quyết định mô hình nào chạy được
Checkpoint FP16 chiếm khoảng 2 byte mỗi tham số. Llama 3 8B cần ~16 GB, Llama 3.1 70B cần ~140 GB trước khi tính KV cache. Quantization AWQ/GPTQ 4-bit giảm còn khoảng 0,6 byte/tham số nhưng vẫn phải chừa VRAM cho context dài và batch size.
- GDDR6X (RTX 3090/4090): 24 GB, phù hợp 7B–13B, SDXL, LoRA.
- GDDR7 (RTX 5090): 32 GB, inference 32B–70B quantized, video AI.
- HBM3 (H100 80 GB): huấn luyện và serving 70B+ với tensor parallel.
Cách chọn cấu hình thuê GPU Server
Chọn theo workload, không theo tên card. Inference chatbot latency thấp cần VRAM đủ nạp full model trên một card. Fine-tune LoRA 7B–13B chạy tốt trên RTX 4090 24 GB. Cụm 70B production nên dùng nhiều H100 với NVLink hoặc InfiniBand.
Tại thuemaychu.vn, GPU Server được đặt tại Data Center Tier III, cài sẵn CUDA, Docker, vLLM và Ollama. Bàn giao trong 15 phút, IPMI riêng, hỗ trợ NOC 24/7.
Cần máy chủ cho workload này?
NOC thuemaychu.vn hỗ trợ chọn CPU, GPU và băng thông. PoC trong 24 giờ.
Bài viết liên quan
RTX 4090 vs RTX 5090: hiệu năng inference AI năm 2025
Băng thông GDDR7 1.792 GB/s và throughput token/s thực tế trên vLLM.
Cài Proxmox VE trên dedicated server với ZFS RAID 10
Tối ưu I/O NVMe enterprise, VLAN và IP tĩnh cho từng container LXC/VM.
Cần bao nhiêu VRAM để chạy Llama 3.1 70B?
Công thức tính tham số và KV cache theo context 8k–128k khi nhiều user đồng thời.