乐于分享
好东西不私藏

英伟达废矿卡一夜变“AI神卡”:超大显存解锁,二手价暴涨10倍

英伟达废矿卡一夜变“AI神卡”:超大显存解锁,二手价暴涨10倍

从8GB到64GB,开源社区如何把170HX带进AI市场

一夜之间暴涨10倍

几周前,NVIDIA CMP 170HX 在美国二手市场还能看到100至200美元的价格。突然间,eBay上的挂牌很快到了1200至2000美元。比如这张截图里,可以看到最低一张标1298美元,最高一张标2247美元。

一张矿潮结束后失去主要用途的卡,为什么会在几周内重新有人收?要知道这张卡是2021年发布的了。

原来只有8GB或10GB显存。现在,8GB版本可以解到64GB,10GB版本可以按40GB使用。原来被压低的计算性能,也被软件放了出来。

我朋友今天刚在线下测完170HX。他说自己越研究越觉得有意思。8GB版看设备ID 20C2,64GB稳定就收。10GB版看2082,目前10GB 的版本能解锁到40GB,理论上能够解锁到80GB。但不管怎么样,按照40GB 的价值计算,已经是非常非常划算的了。而一旦解锁到80GB,几乎可以说是跟中了彩票大奖一样。

170HX是什么

我也好奇,到底是什么卡?怎么突然之间火了起来?

CMP 170HX是NVIDIA在2021年矿潮期间推出的专用矿卡,也是CMP HX系列里规格最高的一张。它没有视频输出接口,不能接显示器。散热器里没有主动风扇,需要矿机或服务器机箱持续送风。整卡功耗约250W,挖以太坊时大约164MH/s。

它的核心是GA100,保留70个SM和4480个CUDA核心。显存用的是HBM,出厂有8GB和10GB两个版本,带宽接近1500GB/s。

GA100也是A100使用的芯片。常见A100版本有108个SM和6912个CUDA核心,170HX的核心数量少一些,但GA100的计算架构和HBM留了下来。矿工需要的是Ethash,NVIDIA就给它保留了挖矿需要的整数计算和显存带宽,同时把普通计算、可见显存和PCIe速度压住。

这张卡当年卖到过约5000美元。以太坊停止工作量证明挖矿以后,它原来的工作没了。没有显示接口,普通计算又慢,8GB或10GB显存也谈不上特别,二手价格一路掉下来。

2023年,有人花约500美元买了一张170HX,用来做PCB电磁仿真。他拆掉散热器以后发现,170HX的电路板和A100 40GB PCIe版非常接近,连元件编号都能对上A100的电路图。板上少了部分供电元件、NVLink元件和PCIe线路,但GA100和HBM就在中间。

那时候大家已经知道它里面有东西。问题是怎么用。

为什么是它

本地模型要先把参数放进显存。模型放不下,就要缩小模型、分到几张卡上,或者把一部分数据放回电脑内存。数据来回跑,速度会降下来。

24GB放不下的模型,64GB有机会单卡装进去。模型能放进去以后,长上下文、多个模型同时加载和更大的批处理才有空间。

170HX还有HBM。普通消费显卡多用GDDR显存,HBM直接放在GPU封装旁边,通过更宽的数据通道传输。170HX出厂带宽接近1.5TB/s,2023年的实测跑到约1355GB/s。

当年挖矿也需要不停读取一大块数据,所以NVIDIA保留了这条很宽的显存通道。到了本地AI这里,大模型同样需要反复读取权重。恐怕那个时候大家都没有意识到,在2066年能够重新把这张几乎没有价值的废卡给再次复活。

显卡市场这两年还在涨。普通用户想在本地跑更大的模型,最先碰到的经常就是显存价格。170HX原来卖不动,是因为系统只让大家看到8GB或10GB。只要这部分限制可以改,它的价格就不会继续按一张8GB矿卡来算了。

软件是怎么解锁的

最早的公开突破发生在2023年。

当时的测试发现,170HX做FP32计算时,一类常用的乘加指令被压到了约0.39TFLOPS。研究者把程序改成另一种写法,避开这类指令,性能可以跑到约6.25TFLOPS。他还改了两行FluidX3D代码,让这张卡在一个依赖显存带宽的流体仿真任务里,跑到A100 40GB PCIe版约90%的速度。

这个办法只能逐个改程序。

2025年4月,又有论文把这条路线系统整理了一遍。FP32提高超过15倍,部分大模型推理提高超过3倍。它证明了计算限制可以绕过去,但显卡每次启动时,仍然会按照原来的矿卡配置工作。

2026年6月25日,Jon Pry提交了一篇论文。第二天,Zenodo公开发布了它。

论文处理了三个限制,计算速度、显存容量和PCIe速度。方法全在软件里完成,不需要改电路板,也不需要NVIDIA的签名密钥。

170HX内部有一个叫Falcon的小型控制器。显卡开机时,它先读取芯片里的型号和熔丝状态,再把一组运行参数交给驱动。计算指令能跑多快、系统能看到多少显存、PCIe用什么速度,都会在这个过程中去处理。

Falcon的启动程序会放一个随机数字在内存里。程序结束前再对一次,数字变了就停止运行。这个数字就是stack canary,也叫栈金丝雀。

问题出在存放位置。需要保护的数据和用于核对的参考数字,都在同一片可以被写入的内存里。一次数据溢出可以同时改掉两边。

研究者通过这条路径进入Falcon的高权限运行模式,再改写显卡启动后的临时状态。物理熔丝没有被烧掉,卡的型号也没有改变。驱动后面读取的是一份运行时副本,解锁软件改的是这份副本。

2026年7月,社区把这些方法继续写进开源驱动。7月12日,计算限速被移除。7月18日,显存布局进入公开代码。7月21日,包含计算和显存解锁的cmpunlocker v0.1发布。月底,PCIe Gen2的方案也开始被复现。

软件可以把速度从Gen1提高到Gen2,宽度一般还是x4。板上缺少的线路不会被软件补出来,要做到x16需要焊接电容,那已经是硬件改造了。

8GB怎么变成64GB

GA100的HBM和普通显卡不太一样。显存堆栈就在GPU封装上,不是围着芯片焊一圈独立显存颗粒。NVIDIA会根据产品型号决定启用多少堆栈,也可能因为某一部分没有通过测试而把它关掉。

170HX出厂时,固件只给系统一套8GB或10GB的显存布局。解锁软件改掉这套布局以后,8GB版可以报告65536MiB,10GB版可以报告40960MiB。

当前公开工具的主线是8GB到64GB、10GB到40GB。

这张公开截图里,一张8GB卡已经显示65536MiB。OpenCL测试读到了70个计算单元、4480个核心,FP32约12.99TFLOPS,FP16约48.30TFLOPS,INT8约48.03TIOPS。合并读取带宽约1504GB/s。

算力的变化要看测试项目。FP32从约0.39TFLOPS恢复到12至13TFLOPS,大约是原来的30多倍。Jon Pry的论文测试了不同精度和路径,记录的是约31至62倍。

10GB版本可以提升到80GB,但现在还不能按80GB稳定卡来算。有的卡申请超过40GB以后会挂起或掉卡。提高HBM刷新频率可以让部分测试稳定下来,吞吐会下降约32%。所以当前工具给10GB版采用40GB配置,基本上很稳妥。

8GB版解到64GB的成功记录更多,也已经出现过64GB不稳、退回32GB才稳定的卡。被关闭的HBM可能只是产品分级,也可能真的有缺陷。

怎么验卡

卖家说的都可以先放一放。目前要玩,一定要具备技术基础,自己能够去测试。卡的性能,或者有专业的人士能够帮你去测试卡的性能(是的,我们可以,我们有自己的专门针对该卡的测试平台)

卖家说三星、海力士、极品体质、包开80GB,这些你都当耳旁风吧。

容量出来以后,我们会做接近全显存的write/read,把能看到的空间尽量写满再读回来。卡热起来以后再跑一轮,检查有没有silent corruption,也就是程序不报错,但读回来的数据已经变了。系统日志里的Xid也要看,它会记录GPU掉线、内存错误和驱动异常。

最后拿Qwen3.8 27B实际跑一遍。我们去矿老板那里收卡时,开机,下载,跑。通过再谈价,没通过就换下一张。

170HX值得买吗?答案是肯定的!

但是一定要有懂行的人帮你操盘!

能跑什么

解锁后的170HX已经有人拿来跑llama.cpp。一张64GB卡运行Llama 2 7B Q4,公开记录里的生成速度约为每秒129至156个token。这个模型不大,常见的CUDA推理软件已经能在卡上工作。

还有人用4张64GB的170HX运行DeepSeek-V4-Flash。4张卡合计256GB显存,没有P2P,PCIe是Gen2 x4。测试把模型拆到4张卡上,单流解码约每秒98个token,预填充约每秒5300个token。

科学计算也有现成记录。2023年的电磁仿真和流体仿真已经把1.5TB/s级的HBM用起来了。解锁以后,原来受限的FP32路径也能直接工作,不再要求每个程序单独改源码。

这张卡适合放在Linux算力机里。当前工具需要NVIDIA 610.43系列开放内核模块、root权限,并关闭Secure Boot。卡本身没有风扇,要有服务器风道或单独改散热,这一个我们也能做,目前在做适配准备,后续打包给我们的客户。

多卡部署要处理PCIe Gen2 x4和没有P2P的问题。单卡任务把模型装进64GB以后,数据不需要频繁经过CPU,影响会小一些。多张卡之间不断交换数据时,PCIe会直接限制速度。

所以现在的170HX,最明确的用途是大显存本地推理、长上下文和一些吃显存带宽的计算任务。

意义是什么

这算是在当前显卡内存价格居高不下,并且在未来可预见的时间内,仍然没有大概率暴跌的机会。大家转而去寻找过去 有没有哪些硬件可以通过解锁的方式重新利用?

这事情是值得思考的。

几年前,矿场退下来的170HX只能写Mining Card。

现在,eBay卖家已经在标题里写AI GPU。

未来算力、电力就是整个人类社会运行的底座。而硬件从头到尾都不可能被忽略。