Benchmark

RTX 4090 vs RTX 5090: hiệu năng inference AI năm 2025

Băng thông GDDR7 1.792 GB/s và throughput token/s thực tế trên vLLM.

thuemaychu.vnCập nhật 18 Tháng 5, 2025
Chip GPU NVIDIA Blackwell với mạch đồng và ánh sáng neon

RTX 4090 (Ada Lovelace, 24 GB GDDR6X) vẫn là card phổ biến cho GenAI. RTX 5090 (Blackwell, 32 GB GDDR7) tăng VRAM và băng thông nhớ — hai yếu tố quyết định throughput token khi serving LLM.

Thông số cần nhìn khi thuê GPU

  • RTX 4090: 16.384 CUDA, 24 GB, băng thông ~1.008 GB/s, TDP 450W.
  • RTX 5090: 32 GB GDDR7, băng thông ~1.792 GB/s, Tensor Core thế hệ mới.
  • Cả hai đều chạy CUDA 12, PyTorch và vLLM trên Ubuntu 22.04.

Token/s trên vLLM

Với Llama 3 8B FP16, 4090 đạt khoảng 80–110 token/s một luồng. 5090 cao hơn nhờ băng thông nhớ khi batch tăng. Llama 70B 4-bit: 4090 phải offload một phần trọng số; 32 GB của 5090 giữ được KV cache context 8k–16k ổn định hơn.

Chọn 4090 khi tối ưu chi phí 7B–13B. Chọn 5090 khi cần headroom VRAM, nhiều user đồng thời hoặc pipeline video AI. Cả hai cấu hình GPU Server của chúng tôi đều có uplink 1 Gbps không giới hạn trong nước.

Cần máy chủ cho workload này?

NOC thuemaychu.vn hỗ trợ chọn CPU, GPU và băng thông. PoC trong 24 giờ.

Bài viết liên quan

Xem tất cả bài viết
GọiFBZaloSalesZaloOA