RTX 4090 vs RTX 5090: hiệu năng inference AI năm 2025
Băng thông GDDR7 1.792 GB/s và throughput token/s thực tế trên vLLM.
RTX 4090 (Ada Lovelace, 24 GB GDDR6X) vẫn là card phổ biến cho GenAI. RTX 5090 (Blackwell, 32 GB GDDR7) tăng VRAM và băng thông nhớ — hai yếu tố quyết định throughput token khi serving LLM.
Thông số cần nhìn khi thuê GPU
- RTX 4090: 16.384 CUDA, 24 GB, băng thông ~1.008 GB/s, TDP 450W.
- RTX 5090: 32 GB GDDR7, băng thông ~1.792 GB/s, Tensor Core thế hệ mới.
- Cả hai đều chạy CUDA 12, PyTorch và vLLM trên Ubuntu 22.04.
Token/s trên vLLM
Với Llama 3 8B FP16, 4090 đạt khoảng 80–110 token/s một luồng. 5090 cao hơn nhờ băng thông nhớ khi batch tăng. Llama 70B 4-bit: 4090 phải offload một phần trọng số; 32 GB của 5090 giữ được KV cache context 8k–16k ổn định hơn.
Chọn 4090 khi tối ưu chi phí 7B–13B. Chọn 5090 khi cần headroom VRAM, nhiều user đồng thời hoặc pipeline video AI. Cả hai cấu hình GPU Server của chúng tôi đều có uplink 1 Gbps không giới hạn trong nước.
Cần máy chủ cho workload này?
NOC thuemaychu.vn hỗ trợ chọn CPU, GPU và băng thông. PoC trong 24 giờ.
Bài viết liên quan
GPU Server là gì? Cách chọn GPU cho mô hình ngôn ngữ lớn
Khác biệt VRAM GDDR6X, GDDR7 và HBM3 khi nạp checkpoint mô hình lớn.
Cài Proxmox VE trên dedicated server với ZFS RAID 10
Tối ưu I/O NVMe enterprise, VLAN và IP tĩnh cho từng container LXC/VM.
Cần bao nhiêu VRAM để chạy Llama 3.1 70B?
Công thức tính tham số và KV cache theo context 8k–128k khi nhiều user đồng thời.