不正经的显卡选择方案¶
一、性能排序¶
这里的性能是计算性能(FP32、FP16、TF32等)
| 排名 | 显卡 | 架构 | 综合计算性能(RTX 4090=100) | 显存 | Compute Capability | 最低支持 CUDA Toolkit |
|---|---|---|---|---|---|---|
| 1 | RTX PRO 6000 Blackwell | Blackwell | 170~200 | 96GB | 12.0 | CUDA 12.8+ |
| 2 | RTX 5090 | Blackwell | 150~170 | 32GB | 12.0 | CUDA 12.8+ |
| 3 | RTX 4090 | Ada Lovelace | 100 | 24GB / 48GB | 8.9 | CUDA 11.8+ |
| 4 | RTX 4080 SUPER | Ada Lovelace | 74 | 16GB / 32GB | 8.9 | CUDA 11.8+ |
| 5 | RTX 3090 Ti | Ampere | 60 | 24GB | 8.6 | CUDA 11.1+ |
| 6 | RTX 3090 | Ampere | 57 | 24GB | 8.6 | CUDA 11.1+ |
| 7 | RTX 3080 Ti | Ampere | 54 | 12GB | 8.6 | CUDA 11.1+ |
| 8 | RTX 4070 Ti | Ada Lovelace | 53 | 12GB | 8.9 | CUDA 11.8+ |
| 9 | RTX 5060 Ti 16GB | Blackwell | 48~52 | 16GB | 12.0 | CUDA 12.8+ |
| 10 | RTX 3080 | Ampere | 47 | 10GB | 8.6 | CUDA 11.1+ |
| 11 | RTX 3070 | Ampere | 34 | 8GB | 8.6 | CUDA 11.1+ |
| 12 | RTX 4060 Ti 16GB | Ada Lovelace | 32 | 16GB | 8.9 | CUDA 11.8+ |
| 13 | RTX 2080 Ti | Turing | 27 | 11GB | 7.5 | CUDA 10.0+ |
| 14 | RTX 3060 12GB | Ampere | 22 | 12GB | 8.6 | CUDA 11.1+ |
| 15 | GTX 1080 | Pascal | 10 | 8GB | 6.1 | CUDA 8.0+ |
二、按显存大小排¶
| 96G显存 | 48G显存 | 32G显存 | 24G显存 | 16G显存 | 12G显存 | 11G显存 | 10G显存 | 8G显存 |
|---|---|---|---|---|---|---|---|---|
| PRO 6000 96GB | 4090 48GB | 1. 5090 32G 2. 4080Super 32G |
1. RTX4090 2. RTX3090Ti 3. RTX3090 |
1. RTX5060Ti 16GB 2. RTX4060Ti |
1. RTX3080Ti 2. RTX4070Ti 3. RTX3060 |
RTX2080Ti 11G | RTX3080 | 1. RTX3070 2. RTX1080 |
三、DeepSeek / Qwen / Gemma 模型推理¶
| 模型 | 参数 | 类型 | 4bit占用(约) | RTX PRO 6000 96G |
RTX5090 32G |
RTX4090 24G |
RTX4080S 32G |
RTX3090Ti 24G |
RTX3090 24G |
RTX3080Ti 12G |
RTX5060Ti 16G |
RTX4060Ti 16G |
RTX2080Ti 11G |
RTX3060 12G |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Qwen3.5-9B | 9B | Dense | 7GB | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU |
| Qwen3.5-27B | 27B | Dense | 20GB | GPU | GPU | GPU | GPU | GPU | GPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU |
| Qwen3.5-35B-A3B | 35B | MoE | 24GB | GPU | GPU | GPU | GPU | GPU | GPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU |
| Qwen3.5-122B-A10B | 122B | MoE | 78GB | GPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | - | - | - | - | - |
| Qwen3.6-27B | 27B | Dense | 20GB | GPU | GPU | GPU | GPU | GPU | GPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU |
| Qwen3.6-35B-A3B | 35B | MoE | 24GB | GPU | GPU | GPU | GPU | GPU | GPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU |
| GLM-4.7-Flash | 30B | MoE | 21GB | GPU | GPU | GPU | GPU | GPU | GPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU |
| DeepSeek-R1-8B | 8B | Dense | 6GB | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU |
| DeepSeek-R1-14B | 14B | Dense | 10GB | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU |
| DeepSeek-R1-32B | 32B | Dense | 22GB | GPU | GPU | GPU | GPU | GPU | GPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU |
| DeepSeek-R1-70B | 70B | Dense | 42GB | GPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU |
| Llama 3.3-8B | 8B | Dense | 6GB | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU |
| Llama 3.3-70B | 70B | Dense | 42GB | GPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU |
| Gemma 3-12B | 12B | Dense | 9GB | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU |
| Gemma 3-27B | 27B | Dense | 20GB | GPU | GPU | GPU | GPU | GPU | GPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU |
| Phi-4-14B | 14B | Dense | 10GB | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU | GPU |
| GPT-OSS-20B | 20B | Dense | 14GB | GPU | GPU | GPU | GPU | GPU | GPU | GPU+CPU | GPU | GPU | GPU+CPU | GPU+CPU |
| GPT-OSS-120B | 120B | MoE | 74GB | GPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | GPU+CPU | - | - | - | - | - |
- GPU:模型可基本完全驻留显存运行
- GPU+CPU:需要 GPU + 系统内存协同(Offload)
- -:显卡显存 + 系统内存不足,不建议运行