Skip to content

GPU AI 部署参考

选购 GPU 跑 AI 时,硬件规格只是故事的一半——架构代际决定模型能否正确运行,软件生态决定实际体验。本文从架构要求、NVLink 互联、AMD 生态和魔改卡风险四个维度,提供面向 AI 部署的 GPU 选型参考。

GPU 架构硬性要求

显存容量只决定模型能否装下,架构代际决定模型能否正确运行。很多看似"显存够"的卡实际上跑不了现代 LLM。

BF16 支持是硬门槛。目前绝大多数开源大模型(Llama 3/4、Qwen 2.5/3.6、DeepSeek-V3)的预训练权重均为 BF16 格式。BF16 的数值动态范围与 FP32 相同(8 位指数),在 Attention 的 Softmax 阶段不会发生数值溢出。FP16 的指数位只有 5 位,动态范围窄,处理大模型的长序列 Attention 时极易出现 NaN 或乱码。NVIDIA 从 Ampere 架构(RTX 30 系列、A100)开始才硬件支持 BF16。

FlashAttention-2 是长上下文的基石。FA2 通过分块计算和重排内存访问模式,将注意力计算的显存带宽利用率从 20% 提升到 80%+。FA2 需要 sm_80(Ampere)及以上的 CUDA 算力。

架构代表显卡CUDA SMBF16FA2FP8LLM 可用性
VoltaV100sm_70靠 FP32 勉强跑,长上下文不可用
Turing2080 Ti, TITAN RTXsm_75部分量化模型勉强跑,FA2 缺失拖慢长序列
Ampere3090, A6000, A100sm_80/86部分本地部署的推荐底线
Ada Lovelace4090, RTX 6000 Adasm_89FP8 native,当前消费级最优
HopperH100sm_90是 (FA3)数据中心旗舰

结论:本地 LLM 部署的架构底线是 Ampere(3090 及以上)。2080 Ti 和 V100 虽然显存规格不低(改版可达 22GB/32GB),但缺少 BF16 和 FA2 支持使得实际可用性极差——能把模型加载起来但随时可能输出 NaN、长文本推理卡顿、量化工具兼容性差。

NVLink 是 NVIDIA 的卡间直连技术,提供远超 PCIe 的通信带宽,对张量并行的多卡推理至关重要。Ada Lovelace(RTX 40 系列)及之后的架构已在消费级和专业级卡上全面移除 NVLink 物理接口——支持 NVLink 的卡集中在 Ampere 及更早代际。

架构支持 NVLink 的型号桥接规格双向带宽
AmpereRTX 3090, 3090 Ti, RTX A6000, A5500, A5000, A45003 代桥接器 (3-Slot / 4-Slot)112.5 GB/s
TuringTITAN RTX, 2080 Ti, 2080 S, 2080, 2070 S; Quadro RTX 8000/6000/50002 代桥接器50-100 GB/s
VoltaQuadro GV1001/2 代桥接器

桥接器槽位间距必须与主板 PCIe 插槽物理间距匹配(3-Slot 或 4-Slot),且不可跨架构混用(3090 不能用 Turing 桥接器)。Linux 下对 NVLink P2P 显存共享支持最完善,NCCL 可直接识别;Windows 下部分消费级卡可能受软件层面的 P2P 限制。

不具备 NVLink 的卡多卡通信必须走 PCIe,可通过开启 PCIe P2P、优化 NCCL 参数(NCCL_P2P_DISABLE=0)、优先使用流水线并行替代张量并行来降低通信瓶颈。多卡并行的具体策略见多卡推理

AMD 显卡 AI 部署分析

AMD 消费级和专业级显卡在纸面硬件规格上对同价位 NVIDIA 卡有优势——7900 XTX 的显存带宽(960 GB/s)甚至略超 3090(936 GB/s),W7900 的 48GB 显存是单卡跑 70B 大模型的物理门票。但硬件规格只是故事的一半,软件生态决定实际体验。

维度RTX 3090 (24G)RX 7900 XTX (24G)W7800 (32G)W7900 (48G)
显存带宽936 GB/s960 GB/s576 GB/s864 GB/s
BF16/FP16 算力~142 TFLOPS~123 TFLOPS~90 TFLOPS~123 TFLOPS
CUDA/ROCm 生态原生完美支持ROCm 适配中ROCm 适配中ROCm 适配中
单卡跑 70B INT4装不下装不下勉强可以
多卡并行NCCL 稳定RCCL 不够成熟RCCL 不够成熟RCCL 不够成熟

ROCm 是 AMD 的 GPU 计算平台,对标 CUDA。ROCm 6.x 对 RDNA 3(gfx1100)的支持比早期版本好了很多,Linux 下已能运行 PyTorch 和 vLLM,但实际落地中存在几个痛点:

FlashAttention-2 的 ROCm 移植分支性能和稳定性不如 NVIDIA 原生 Tensor Core 实现,长文本 Prefill 阶段首字延迟会明显落后于 3090。AWQ/GPTQ 量化模型在 vLLM-ROCm 下经常因为量化 Kernel 未对 RDNA 3 优化,实际推理速度低于理论带宽应有的表现。多卡通信库 RCCL 在消费级 RDNA 3 卡上的 P2P 支持不够稳定,跨卡通信开销大于同级别 NVIDIA 平台。

AMD 的亮点在 llama.cpp。llama.cpp 的 HIP/ROCm 后端适配非常成熟——通过 cmake -DGGML_HIPBLAS=ON 编译后,在 RDNA 3 上的 GGUF 量化模型运行稳定性与 NVIDIA 卡几乎无异,高显存带宽能得到接近满额的发挥。如果你主要使用 GGUF 格式做本地推理,AMD 7000 系列的性价比会凸显。

选型建议:追求省心、最新算法(AWQ/FP8/FlashAttention-3)和稳定多卡并行时,3090 是无脑首选。需要单卡 48GB 显存跑 70B 模型(省去多卡 PCIe 通信和 PP/TP 调度开销)且能接受 ROCm 调优成本时,W7900 有不可替代的物理优势。7900 XTX 虽然价格有优势,但在同 24GB 显存级别下,软件生态的劣势抹平了硬件参数的优势,不如直接买二手 3090。

魔改卡风险

魔改卡(换显存颗粒扩容)不适合 AI 7×24 满载场景。以 3080 20G 魔改版为例:显存带宽仅 760 GB/s(3090 为 936 GB/s,慢 19%),大模型推理是 Memory-Bound 任务,这个差距直接体现在 Token 生成速度上。更致命的是手工 BGA 焊接 GDDR6X 颗粒——满载时显存温度极易突破 100°C 导致降频或掉卡(NVML Critical Error),且部分魔改卡需要定制驱动 INF 文件,新 CUDA 版本和 Docker 镜像可能不兼容。

3080 本身硬件不支持 NVLink,多卡通信只能走 PCIe。AI 节点最忌讳跑着跑着突然掉卡断流——魔改卡只适合个人 PC 单卡轻度折腾,不建议用于严肃的 AI 服务器。对于多卡 AI 服务器,优先选择正品 RTX 3090 24G(完整显存、更高带宽、官方驱动生态和 7×24 稳定性)。

常见魔改型号包括:4090 48G、4090D 48G、4080 32G、3080 20G、2080 Ti 22G。完整 GPU 型号参考见 GPU 硬件