GPU Server · AI Ready

Các GPU mạnh nhất hiện nay

Catalog thông số Blackwell, Hopper, Ada Lovelace và CDNA 4 trên thuemaychu.vn. Chọn VRAM, băng thông và Tensor phù hợp LLM, fine-tune và render — bàn giao trên máy chủ riêng tại Data Center Tier III.

288 GB
VRAM lớn nhất / GPU
MI350X HBM3E
9 PFLOPS
FP4 Tensor peak
B200 dense
8 TB/s
Băng thông nhớ
B200 · MI350X
1,8 TB/s
NVLink 5
Blackwell SXM
Catalog · Cập nhật 09/2026

Thông số GPU theo từng dòng

Peak Tensor theo datasheet hãng (dense hoặc TOPS công bố). VRAM usable khi inference có thể thấp hơn một phần do KV cache, driver và framework.

So sánh

Chọn 2–3 GPU để đối chiếu thông số

Chọn từ danh sách dưới đây hoặc tick trên bảng / card. Ô thứ 3 là tùy chọn.

Đã chọn 0/3 — chọn thêm 2 GPU để hiện bảng so sánh.

11 GPU
So sánhGPUKiến trúcVRAMBăng thôngAI computeTDPPhù hợp
NVIDIA B200TopBlackwell GB100192 GB HBM3e8 TB/s9 PFLOPS FP41.000 WTrain LLM lớn, cụm HGX 8 GPU
AMD Instinct MI350XTopCDNA 4288 GB HBM3E8 TB/s9,2 PFLOPS MXFP41.000 WInference mô hình cực lớn, ROCm
NVIDIA H200 SXMHopper GH100141 GB HBM3e4,8 TB/s3,96 PFLOPS FP8700 WInference 70B+, train 70B
NVIDIA H100 SXM5Hopper GH10080 GB HBM33,35 TB/s3,96 PFLOPS FP8700 WTrain / fine-tune 7B–70B
RTX PRO 6000 BlackwellBlackwell96 GB GDDR7 ECC1.792 GB/s4.000 AI TOPS600 WFine-tune 70B, workstation AI
NVIDIA L40SAda Lovelace48 GB GDDR6 ECC864 GB/s1.466 TFLOPS FP8350 WInference, render, VDI
RTX 6000 AdaAda Lovelace48 GB GDDR6 ECC960 GB/s1.457 TFLOPS FP8300 WInference 24/7, DCC
RTX A6000Ampere GA10248 GB GDDR6 ECC768 GB/s309 TFLOPS FP16300 WRender, inference 13B–34B
GeForce RTX 5090TopBlackwell GB20232 GB GDDR71.792 GB/s3.352 AI TOPS575 WGenAI, 70B Q4, video AI
GeForce RTX 4090Ada Lovelace AD10224 GB GDDR6X1.008 GB/s1.321 AI TOPS450 WFine-tune 8B, SDXL, LLM 13B
GeForce RTX 3090Ampere GA10224 GB GDDR6X936 GB/s285 TFLOPS FP16350 WLLM 7B–13B, SDXL, 3D
NVIDIA · Datacenter

NVIDIA B200

Flagship

GPU AI mạnh nhất hiện nay. Dual-die, Tensor thế hệ 5 với FP4 native — train và inference mô hình 100B+ trên một node.

VRAM192 GB / 288 GB max
Kiến trúcBlackwell GB100
Bộ nhớ192 GB HBM3e
Băng thông8 TB/s
Transistors208 tỷ
TensorThế hệ 5 · FP4 / FP8
AI compute9 PFLOPS FP4
Kết nốiNVLink 5 · 1,8 TB/s
TDP1.000 W
Form factorSXM
BusPCIe 5.0 x16
ECCHBM ECC
Mô hình phù hợp
70B FP16 · 405B FP8/FP4
Liên hệ giải pháp
Tư vấn kỹ thuật
AMD · Datacenter

AMD Instinct MI350X

288 GB HBM3E

VRAM lớn nhất trên một GPU. 288 GB HBM3E giúp nạp checkpoint 405B mà không phải tensor-parallel nhiều card.

VRAM288 GB / 288 GB max
Kiến trúcCDNA 4
Bộ nhớ288 GB HBM3E
Băng thông8 TB/s
Stream processors16.384
TensorMatrix Core · MXFP4/FP8
AI compute9,2 PFLOPS MXFP4
Kết nốiInfinity Fabric · 1,07 TB/s
TDP1.000 W
Form factorOAM
BusPCIe 5.0 x16
ECCFull-chip ECC
Mô hình phù hợp
405B+ trên 1 GPU
Liên hệ giải pháp
Tư vấn kỹ thuật
NVIDIA · Datacenter

NVIDIA H200 SXM

141 GB HBM3e

Hopper với bộ nhớ nâng cấp. Cùng compute H100, VRAM 141 GB và 4,8 TB/s — tối ưu inference 70B–405B.

VRAM141 GB / 288 GB max
Kiến trúcHopper GH100
Bộ nhớ141 GB HBM3e
Băng thông4,8 TB/s
CUDA cores16.896
TensorThế hệ 4 · FP8
AI compute3,96 PFLOPS FP8
Kết nốiNVLink 4 · 900 GB/s
TDP700 W
Form factorSXM
BusPCIe 5.0 x16
ECCHBM ECC
Mô hình phù hợp
Llama 3.1 70B–405B
Liên hệ giải pháp
Tư vấn kỹ thuật
NVIDIA · Datacenter

NVIDIA H100 SXM5

80 GB HBM3

Chuẩn de-facto cho train LLM. Hệ sinh thái CUDA, NCCL, NeMo trưởng thành; cụm 8 GPU NVLink sẵn trên rack.

VRAM80 GB / 288 GB max
Kiến trúcHopper GH100
Bộ nhớ80 GB HBM3
Băng thông3,35 TB/s
CUDA cores16.896
TensorThế hệ 4 · FP8
AI compute3,96 PFLOPS FP8
Kết nốiNVLink 4 · 900 GB/s
TDP700 W
Form factorSXM5
BusPCIe 5.0 x16
ECCHBM ECC
Mô hình phù hợp
Llama 3 70B FP16 (2–4 GPU)
Liên hệ giải pháp
Tư vấn kỹ thuật
NVIDIA · Workstation

RTX PRO 6000 Blackwell

96 GB ECC

Workstation mạnh nhất: 96 GB GDDR7 ECC, MIG 4 instance, FP4 Tensor. Fine-tune 70B và inference agentic AI trên 1 card.

VRAM96 GB / 288 GB max
Kiến trúcBlackwell
Bộ nhớ96 GB GDDR7 ECC
Băng thông1.792 GB/s
CUDA cores24.064
TensorThế hệ 5 · FP4
AI compute4.000 AI TOPS
Kết nốiPCIe 5.0 · MIG 4-way
TDP600 W
Form factorDual-slot workstation
BusPCIe 5.0 x16
ECCGDDR7 ECC
Mô hình phù hợp
Llama 70B QLoRA · 70B FP8
Liên hệ giải pháp
Tư vấn kỹ thuật
NVIDIA · Workstation

NVIDIA L40S

48 GB ECC

GPU datacenter đa năng: inference, render, vGPU. 48 GB ECC, NVENC thế hệ 8, TDP 350 W — mật độ rack cao.

VRAM48 GB / 288 GB max
Kiến trúcAda Lovelace
Bộ nhớ48 GB GDDR6 ECC
Băng thông864 GB/s
CUDA cores18.176
TensorThế hệ 4 · FP8
AI compute1.466 TFLOPS FP8
Kết nốiPCIe 4.0 x16
TDP350 W
Form factorFHFL dual-slot
BusPCIe 4.0 x16
ECCGDDR6 ECC
Mô hình phù hợp
13B FP16 · 70B Q4
Liên hệ giải pháp
Tư vấn kỹ thuật
NVIDIA · Workstation

RTX 6000 Ada

48 GB ECC

Card professional Ada 48 GB. Băng thông 960 GB/s, TDP 300 W — ổn định cho inference 24/7 và CAD/3D.

VRAM48 GB / 288 GB max
Kiến trúcAda Lovelace
Bộ nhớ48 GB GDDR6 ECC
Băng thông960 GB/s
CUDA cores18.176
TensorThế hệ 4 · FP8
AI compute1.457 TFLOPS FP8
Kết nốiPCIe 4.0 x16
TDP300 W
Form factorDual-slot blower
BusPCIe 4.0 x16
ECCGDDR6 ECC
Mô hình phù hợp
13B FP16 · 70B quantized
Liên hệ giải pháp
Tư vấn kỹ thuật
NVIDIA · Workstation

RTX A6000

48 GB ECC

Ampere 48 GB vẫn phổ biến cho render và inference. NVLink 2-way ghép 96 GB khi cần context dài.

VRAM48 GB / 288 GB max
Kiến trúcAmpere GA102
Bộ nhớ48 GB GDDR6 ECC
Băng thông768 GB/s
CUDA cores10.752
TensorThế hệ 3 · TF32
AI compute309 TFLOPS FP16
Kết nốiNVLink 2-way
TDP300 W
Form factorDual-slot blower
BusPCIe 4.0 x16
ECCGDDR6 ECC
Mô hình phù hợp
Llama 13B FP16 · 70B Q3
Liên hệ giải pháp
Tư vấn kỹ thuật
NVIDIA · High-end GPU

GeForce RTX 5090

32 GB GDDR7

GPU consumer mạnh nhất. 21.760 CUDA, GDDR7 1.792 GB/s, Tensor FP4 — inference 70B quantized và video AI realtime.

VRAM32 GB / 288 GB max
Kiến trúcBlackwell GB202
Bộ nhớ32 GB GDDR7
Băng thông1.792 GB/s
CUDA cores21.760
TensorThế hệ 5 · FP4
AI compute3.352 AI TOPS
Kết nốiPCIe 5.0 x16
TDP575 W
Form factorTriple-slot
BusPCIe 5.0 x16
ECCKhông
Mô hình phù hợp
Llama 70B Q4 · SDXL / video
14.500.000 đ/tháng
Cấu hình máy chủ
NVIDIA · High-end GPU

GeForce RTX 4090

24 GB Ada

16.384 CUDA, Tensor thế hệ 4 (FP8). Fine-tune Llama 8B và inference 13B–70B quantized với mật độ giá tốt.

VRAM24 GB / 288 GB max
Kiến trúcAda Lovelace AD102
Bộ nhớ24 GB GDDR6X
Băng thông1.008 GB/s
CUDA cores16.384
TensorThế hệ 4 · FP8
AI compute1.321 AI TOPS
Kết nốiPCIe 4.0 x16
TDP450 W
Form factorTriple-slot
BusPCIe 4.0 x16
ECCKhông
Mô hình phù hợp
Llama 3 8B FP16 · 70B Q4
9.800.000 đ/tháng
Cấu hình máy chủ
NVIDIA · High-end GPU

GeForce RTX 3090

24 GB VRAM

10.496 CUDA, 24 GB GDDR6X. Vẫn đủ cho LLM 7B–13B, Stable Diffusion XL và render 3D với chi phí thuê thấp.

VRAM24 GB / 288 GB max
Kiến trúcAmpere GA102
Bộ nhớ24 GB GDDR6X
Băng thông936 GB/s
CUDA cores10.496
TensorThế hệ 3
AI compute285 TFLOPS FP16
Kết nốiPCIe 4.0 x16
TDP350 W
Form factorTriple-slot
BusPCIe 4.0 x16
ECCKhông
Mô hình phù hợp
Llama 13B Q8 · SDXL
7.500.000 đ/tháng
Cấu hình máy chủ
Chọn GPU theo workload

GPU nào cho mô hình của bạn?

Cách chọn GPU cho LLM
Llama 3 / Qwen 8B
~16 GB FP16
RTX 4090 · RTX 3090

Inference realtime, fine-tune LoRA trên 1 card.

Llama 70B quantized
~40 GB Q4
RTX 5090 · 2× RTX 4090

vLLM / Ollama, context 8k–32k.

Llama 70B FP16
~140 GB
H100 · H200 · PRO 6000

Fine-tune QLoRA trên 96 GB; FP16 cần H100/H200.

Llama 405B / DeepSeek
141–288 GB
H200 · B200 · MI350X

FP8/FP4 trên Blackwell; MI350X nạp 1 card.

Train LLM from scratch
Cụm NVLink
HGX B200 / H100 8 GPU

NCCL, InfiniBand 400–800G, checkpoint NVMe.

Stable Diffusion · Video AI
24–32 GB
RTX 5090 · RTX 4090

SDXL, Flux, HunyuanVideo — Tensor FP4/FP8.

Cụm GB200 NVL72 · Private AI Pod
72 GPU Blackwell, NVLink 5 domain, InfiniBand 800G. Train mô hình frontier trên rack liquid-cooled tại DC Việt Nam.
Tư vấn cụm AI
Cài sẵn AI stack
Ubuntu 22.04, NVIDIA Container Toolkit, Docker, PyTorch, vLLM, Ollama, DeepSpeed, ROCm 7 cho Instinct.
Xem tài liệu triển khai
Bắt đầu ngay

Sẵn sàng nâng cấp hạ tầng?

Nhận tư vấn, báo giá theo hợp đồng năm, và PoC miễn phí trong 24 giờ lên đến 7 ngày.

Hỗ trợ chuyển dữ liệu miễn phíDùng thử máy chủ PoC theo yêu cầu
GọiFBZaloSalesZaloOA