型号解析:V100-32G-SXM2 — V100 是 Volta 架构首款数据中心 GPU,32G 表 32GB HBM2 显存,SXM2 为高带宽底座(需配套 DGX/HGX 服务器);16GB PCIe 版可插通用插槽。
核心要点提炼:第一代 Tensor Core 在此登场——FP16 张量算力 125 TFLOPS,约 P100 的 6.7 倍,定义「AI 训练专用算力」范式;2026 年公开市场仍在租,32GB 月卡 7377–8109 元、16GB 二手拆机 599–895 元;仍是7B/13B 微调与 CUDA 教学的预算之选。
一、2017:深度学习的奇点之年
读懂 V100,必须先回到它出生的那一年。2017 年前后三件事,共同把深度学习推向「需要专用算力」的临界点:
• 2016 年 3 月:AlphaGo 击败李世石,全球第一次直观感受到深度学习的威力,AI 从实验室项目升为战略级投入,训练算力需求暴涨;
• 2017 年 5 月:NVIDIA 在 GTC 发布 V100,此时距 Transformer 论文发表还有一个月,已预判到深度学习对算力的需求将远超通用 GPU 的承载能力;
• 2017 年 6 月:Google 发表 Transformer 论文《Attention Is All You Need》,BERT(2018)、GPT-2(2019)相继出现,模型参数从亿级向十亿、百亿级攀升。
算力危机:Transformer 的核心运算是矩阵乘法(QKV 投影、注意力分数、FFN 全连接),而上一代 P100(Pascal 架构)的 CUDA cores 走 FP32/FP16 通用流水线——矩阵乘法与其他任务一起排队,没有专用加速通道。模型越大,矩阵乘法占比越高,通用流水线效率越低。
V100 的回应:在 SM(流式多处理器)里塞进一组专用矩阵乘法单元——Tensor Core,让矩阵乘法走专用通道直接加速。这是 NVIDIA 第一次为深度学习专门设计芯片单元,从「通用算力」转向「专用算力」。这一决策的份量,后续九年的所有训练卡演进都在印证:A100 的第三代 Tensor Core、H100 的第四代加 FP8、B200 的第五代加 FP4——每一代训练卡的算力跃迁,本质都是 Tensor Core 的代际升级。读懂 V100,就读懂了这条演进链的第一环。
二、Tensor Core 的起点与当代价值
历史价值:Tensor Core 的起点。V100 时隔九年仍值得了解,不在于它今天还能跑多快,而在于它承载的历史价值——本系列后续每一张训练卡,算力跃迁的本质都是 Tensor Core 的代际演进:
注:第二代 Tensor Core 在消费级 Turing(RTX 20 系列)上,未进数据中心主线,故由第一代直跳第三代。V100 定下的两个基调延续至今:FP32 累加保训练稳定、专用矩阵单元剥离通用流水线——A100/H100/B200 全部沿用。从 V100 开始,NVIDIA 才把「深度学习训练」单独列为数据中心 GPU 的首要定位;在它之前,NVIDIA 数据中心卡叫「Tesla」(K80、P100 都是 Tesla 前缀),定位是「通用算力 + 大显存」。
当代价值:退役不退场。V100 已于 2022 年前后陆续停产,但本平台公开市场仍有 3–7 家供应商在租,卡月价 3900–8109 元区间。它的当代价值落在三类场景:
• 7B/13B 模型微调:FP16 张量算力 125 TFLOPS 仍可用,32GB 显存可装 13B FP16 权重(约 26GB),配 LoRA 微调可行;
• CUDA 教学与算法验证:支持 Tensor Core、支持 NVLink,是入门「专用算力」的最低门槛卡之一;
• 预算有限的中小训练:二手 SXM2 拆机卡买断 599–895 元;16GB PCIe 版卡月租比 A100-80G 低约 35%–55%,32GB SXM2 版卡月与 A100 区间重叠,优势在显存够用前提下入门门槛更低。
三、认知锚点:港口的「开荒者」
延续系列的货运港类比:如果 H100 是一座吞吐惊人的自动化超级货运港、A100 是这座港的「一代目」,那 V100 就是一代目之前的「开荒者」——它第一次在港口里铺了一条专用矩阵分拣线(Tensor Core),让大模型训练里最重的那批货物(矩阵乘法)不再走通用分拣线(CUDA cores FP32/FP16)排队,而是走专用通道直接加速。后续所有港口都跟进了这套专用线设计。

把数字变直觉:
• 显存 16/32GB HBM2(堆场大小):V100 有 16GB 与 32GB 两版,32GB 版是 2018 年追加。对比 A100/H100 80GB,堆场只有它们的 1/2 到 1/4——70B 模型 FP16 权重约 140GB,单卡 V100 装不下,必须多卡切分;
• 带宽 900 GB/s(传送带速率):每秒约搬运 191 张 DVD 的数据,是 P100(720 GB/s)的 1.25 倍,但只有 A100(2.0 TB/s)的 45%、H100(3.35 TB/s)的 27%——传送带偏慢是 V100 的第一处代差;
• FP16 张量算力 125 TFLOPS(专用分拣线速率):这是 V100 的核心身份标记。对比 P100 FP16 约 18.7 TFLOPS(无 Tensor Core),专用线快了约 6.7 倍;NVIDIA 官方宣传的「约 12 倍」是对比 P100 FP32 CUDA cores(9.3 TFLOPS)的深度学习峰值口径;
• NVLink 2 代 300 GB/s(港口间运河):是 P100(160 GB/s)的 1.875 倍,但只有 A100(600 GB/s)的一半、H100(900 GB/s)的三分之一。
三个常见误区:
1. V100 没有 FP8,所以不能跑大模型? 不完全。V100 支持 FP16 张量计算,跑 7B/13B 模型微调、推理完全可用;只是相对 A100/H100,算力与显存都偏小,跑 70B 级别模型不现实。
2. V100 已停产,不能用了? 错。本平台公开市场仍有 3–7 家供应商在租,二手 SXM2 拆机卡 599–895 元——存量市场仍有需求,预算有限的中小训练与教学场景仍在用。
3. V100 是 A100 的缩水版? 错。V100 是 Volta 架构(2017),A100 是 Ampere 架构(2020),中间隔了一代 Turing(消费级 RTX 20 系列);A100 是 V100 的代际继任者,不是缩水版。
四、Tensor Core 与关键参数
Tensor Core 是什么:核心是一个4×4×4 矩阵乘累加器——输入两个 4×4 矩阵(A、B)FP16 精度,输出一个 4×4 矩阵(C)FP32 精度累加,一个时钟周期内完成一次矩阵乘法 + 累加(D = A×B + C)。对比 CUDA cores 的「一次一个标量乘加」,Tensor Core 的「一次一组矩阵乘加」大幅拉高吞吐——NVIDIA 官方宣称 V100 深度学习峰值吞吐约为 P100 FP32 的 12 倍(125 vs 9.3 TFLOPS)。
从编程视角看,V100 的 Tensor Core 通过 CUDA 9 引入的 wmma(Warp Matrix Multiply Accumulate)API 暴露给开发者:一个 warp(32 线程)协作加载矩阵片段到寄存器,调用 mma.sync 指令触发一次张量运算。后续 cuBLAS、cuDNN 自动调用 Tensor Core,开发者无需手写 wmma 也能享受到加速——这是 NVIDIA「专用硬件 + 软件栈透明化」策略的起点,A100/H100 的 cuBLASLt、Transformer Engine 沿用同一思路。
关键设计取舍:输入 FP16(2017 年训练主流精度,FP32 太慢、INT8 精度不够)、累加 FP32(矩阵乘累加易溢出,必须 FP32 累加保证训练稳定性——这一设计延续至今,A100/H100/B200 全部沿用)、矩阵 4×4×4(张量核心的最小计算单元,后续 A100 升级为 16×8×16、H100 升级为 16×8×32,但底层思想不变)、不支持稀疏(2:4 结构化稀疏是 A100 第三代才引入的能力,V100 的 Tensor Core 是稠密计算)。
数据来源:NVIDIA V100 官方白皮书(WP-08608-001 v1.1,2017-08)。PCIe 版因插槽供电限制算力略降;V100 不支持 FP8/TF32/FP4 及结构化稀疏——这两项能力分别由 H100(2022)和 A100(2020)引入。V100 SXM2 与 PCIe 版的 CUDA/Tensor core 数量一致(5120/640),差异在频率。

五、九年后的甜区与避开区
V100 已是九年前发布的卡,本节按场景说清「今天还值不值得用」。估算口径:训练总算力按 Chinchilla 经验公式 C≈6×参数量×训练 token 数,GPU 实际利用率 MFU 按业界惯例 40% 折算(LoRA 微调可训练参数约占 1%,算力需求远低于此口径)。
甜区(预算有限时首选)
• ≤13B 中小规模训练:FP16 张量算力 125 TFLOPS,跑 BERT-Large(330M)、ResNet-50 训练,7B/13B 模型 LoRA 微调完全可用。以 LLaMA-7B 续训 1B tokens 估算:总算力需求 ≈ 4.2×10¹⁹ FLOPs,单卡 V100 有效算力约 5×10¹³ FLOPs/s,理想耗时约 9.7 天——可接受;单卡小 batch 微调实际 MFU 常落在 20%–30%,耗时需相应上浮。
• CUDA 教学与算法验证:V100 是入门「专用算力」的最低门槛之一——支持 Tensor Core、支持 NVLink、显存够装中小模型,二手 SXM2 拆机卡 599–895 元,是高校与个人入门的预算之选。
• 打折区(可用但非最优):30B 微调需 2 卡张量并行;中小推理服务吞吐上界偏低但并发不大仍可扛;FP64 科学计算不是甜区但也不算坑(V100 FP64 7.8 TFLOPS,比 P100 快 1.66 倍、比 A100 略低)。
避开区
• 70B+ 大模型训练:32GB 显存装不下 70B FP16 权重(约 140GB),需 5 卡以上张量并行;且 FP16 张量算力只有 A100 的 40%、H100 的 13%——大规模训练不要选 V100。
• 高吞吐推理服务:带宽只有 900 GB/s(A100 的 45%、H100 的 27%),推理读权重与 KV cache 的吞吐上界低;且不支持 FP8/INT8 张量加速(V100 的 INT8 走 CUDA cores,无 Tensor Core 加速)。
• FP8/INT8 量化推理:V100 不支持 FP8,INT8 走 CUDA cores 无专用加速——有量化需求的推理场景直接避开。
六、市场现状:退役不退场
口径:2026 年 8 月国内公开市场的单卡租赁/二手拆机买断流通行情;海外公有云、大批量企业集采价格存在明显差异,不在本节口径内。
数据由平台公开多源采集(2026-08-04)。V100 卡时价(17 元)看似与 A100/H100 接近,但卡月价下沿(16GB 版 3907 元起)显著低于 A100(6000 元起)——V100 的价格优势主要在 16GB PCIe 版与二手拆机卡。
价格特征解读:
• 卡时价偏高(17 元):V100 已停产,供给以存量为主,单卡时租零售价受稀缺性影响;但卡月价(长租)回落到合理区间,反映存量市场仍有竞争。
• 32GB 版比 16GB 版贵约 1.6 倍:32GB 显存对 13B/30B 模型训练更友好(单卡装得下),供需关系推高价格;32GB 版供应商更多(7 家 vs 16GB 版 3 家)。
• 二手 SXM2 拆机卡 599–895 元:IBM 拆机 V100 SXM2 16G 是个人入门的预算之选,但需自配 SXM2 转 PCIe 转接卡,散热与稳定性需自行保障。
竞争格局:同代对标 AMD MI50/MI60(Vega 20 架构,32GB HBM2,FP16 约 14.8 TFLOPS,无 Tensor Core 等效单元),V100 凭 Tensor Core 在训练场景显著领先;下一代替代 A100 在显存、带宽、算力、精度全面超越 V100;国产替代有寒武纪 MLU370-X4(48GB)、华为昇腾 910(32GB)。生态护城河方面,CUDA 仍是 V100 最大的护城河——Volta 架构的 CUDA 兼容性至今保持,PyTorch/TensorFlow 主流框架仍支持 V100(compute capability 7.0)。
选型定位:
• 7B/13B 模型微调 + 预算有限 → V100 32GB SXM2(卡月 7400–8100 元,与 A100 区间重叠但显存门槛更低;预算敏感可降选 16GB PCIe 版,比 A100 低 35%–55%)
• CUDA 教学/算法验证 + 个人入门 → V100 16GB PCIe 二手拆机卡(599–895 元,配转接卡)
• 70B+ 大模型训练/高吞吐推理 → 避开 V100,选 A100/H100 或国产替代
避坑提示:
• 显存墙是硬伤:32GB 装不下 70B FP16 权重(约 140GB),需 5 卡以上张量并行;
• 带宽偏低:900 GB/s 只有 A100 的 45%、H100 的 27%,推理吞吐上界低;
• 不支持 FP8/INT8 张量加速:INT8 走 CUDA cores 无专用加速,FP8 是 H100 才引入;
• NVLink 仅 SXM2 版支持:PCIe 版 V100 不支持 NVLink,多卡通信走 PCIe Gen3;
• 软件兼容性:Volta 架构 CC 7.0,PyTorch/TensorFlow 仍支持,但 FlashAttention 2 官方仅支持 Ampere 及以上(CC≥8.0),Volta 只能用社区 fork。
附录:统一速查卡
| 125 TFLOPS(SXM2)/ 112 TFLOPS(PCIe) | |
关注灵算云,选型不踩坑

相关阅读:
• 代际继任篇《读懂 A100:大模型元年的主力训练卡》
• 当代旗舰《读懂 H100:大模型时代的算力锚点》| 显存升级款《读懂 H200》
• 合规特供系列《读懂 H800 / H20 / A800:难兄难弟,同舟共济》
想看 V100 与 P100 的完整代际跃升数据、FlashAttention 兼容性分析与更多报价详情?点击左下角 「阅读原文」 查看博客完整版。
夜雨聆风