跳转至

不正经的显卡选择方案

一、性能排序

这里的性能是计算性能(FP32、FP16、TF32等)

排名 显卡 架构 综合计算性能(RTX 4090=100) 显存 Compute Capability 最低支持 CUDA Toolkit
1 RTX PRO 6000 Blackwell Blackwell 170~200 96GB 12.0 CUDA 12.8+
2 RTX 5090 Blackwell 150~170 32GB 12.0 CUDA 12.8+
3 RTX 4090 Ada Lovelace 100 24GB / 48GB 8.9 CUDA 11.8+
4 RTX 4080 SUPER Ada Lovelace 74 16GB / 32GB 8.9 CUDA 11.8+
5 RTX 3090 Ti Ampere 60 24GB 8.6 CUDA 11.1+
6 RTX 3090 Ampere 57 24GB 8.6 CUDA 11.1+
7 RTX 3080 Ti Ampere 54 12GB 8.6 CUDA 11.1+
8 RTX 4070 Ti Ada Lovelace 53 12GB 8.9 CUDA 11.8+
9 RTX 5060 Ti 16GB Blackwell 48~52 16GB 12.0 CUDA 12.8+
10 RTX 3080 Ampere 47 10GB 8.6 CUDA 11.1+
11 RTX 3070 Ampere 34 8GB 8.6 CUDA 11.1+
12 RTX 4060 Ti 16GB Ada Lovelace 32 16GB 8.9 CUDA 11.8+
13 RTX 2080 Ti Turing 27 11GB 7.5 CUDA 10.0+
14 RTX 3060 12GB Ampere 22 12GB 8.6 CUDA 11.1+
15 GTX 1080 Pascal 10 8GB 6.1 CUDA 8.0+

二、按显存大小排

96G显存 48G显存 32G显存 24G显存 16G显存 12G显存 11G显存 10G显存 8G显存
PRO 6000 96GB 4090 48GB 1. 5090 32G
2. 4080Super 32G
1. RTX4090
2. RTX3090Ti
3. RTX3090
1. RTX5060Ti 16GB
2. RTX4060Ti
1. RTX3080Ti
2. RTX4070Ti
3. RTX3060
RTX2080Ti 11G RTX3080 1. RTX3070
2. RTX1080

三、DeepSeek / Qwen / Gemma 模型推理

模型 参数 类型 4bit占用(约) RTX PRO 6000
96G
RTX5090
32G
RTX4090
24G
RTX4080S
32G
RTX3090Ti
24G
RTX3090
24G
RTX3080Ti
12G
RTX5060Ti
16G
RTX4060Ti
16G
RTX2080Ti
11G
RTX3060
12G
Qwen3.5-9B 9B Dense 7GB GPU GPU GPU GPU GPU GPU GPU GPU GPU GPU GPU
Qwen3.5-27B 27B Dense 20GB GPU GPU GPU GPU GPU GPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU
Qwen3.5-35B-A3B 35B MoE 24GB GPU GPU GPU GPU GPU GPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU
Qwen3.5-122B-A10B 122B MoE 78GB GPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU - - - - -
Qwen3.6-27B 27B Dense 20GB GPU GPU GPU GPU GPU GPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU
Qwen3.6-35B-A3B 35B MoE 24GB GPU GPU GPU GPU GPU GPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU
GLM-4.7-Flash 30B MoE 21GB GPU GPU GPU GPU GPU GPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU
DeepSeek-R1-8B 8B Dense 6GB GPU GPU GPU GPU GPU GPU GPU GPU GPU GPU GPU
DeepSeek-R1-14B 14B Dense 10GB GPU GPU GPU GPU GPU GPU GPU GPU GPU GPU GPU
DeepSeek-R1-32B 32B Dense 22GB GPU GPU GPU GPU GPU GPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU
DeepSeek-R1-70B 70B Dense 42GB GPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU
Llama 3.3-8B 8B Dense 6GB GPU GPU GPU GPU GPU GPU GPU GPU GPU GPU GPU
Llama 3.3-70B 70B Dense 42GB GPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU
Gemma 3-12B 12B Dense 9GB GPU GPU GPU GPU GPU GPU GPU GPU GPU GPU GPU
Gemma 3-27B 27B Dense 20GB GPU GPU GPU GPU GPU GPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU
Phi-4-14B 14B Dense 10GB GPU GPU GPU GPU GPU GPU GPU GPU GPU GPU GPU
GPT-OSS-20B 20B Dense 14GB GPU GPU GPU GPU GPU GPU GPU+CPU GPU GPU GPU+CPU GPU+CPU
GPT-OSS-120B 120B MoE 74GB GPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU GPU+CPU - - - - -
  • GPU:模型可基本完全驻留显存运行
  • GPU+CPU:需要 GPU + 系统内存协同(Offload)
  • -:显卡显存 + 系统内存不足,不建议运行

四、参考资料