一张曾经按斤卖的卡

2022 年以太坊转向权益证明(PoS),挖矿彻底没了生意。一大批矿卡涌进二手市场,其中有一类最惨——不是游戏卡改的矿卡,而是 NVIDIA 专门为挖矿造的 CMP 系列。

CMP 170HX 是这批卡里的旗舰。它没风扇、没视频输出口,插上显示器也不亮;DirectX、OpenGL、Vulkan 全被屏蔽,连 CUDA 都用不了。它唯一的用途就是挖以太坊,哈希率 164 MH/s。

矿难一来,它就成了废铁。最低谷的时候,三五百块一张,摆在那里没人要。

谁能想到,四年后它涨到了 1 万 4。三十多倍。

它为什么被判了死刑

要理解这场反转,得先看 NVIDIA 当年怎么锁它。

CMP 170HX 的芯片叫 GA100——和 A100 是同一颗。台积电 7nm,540 亿晶体管。这不是什么阉割版的边角料,这是数据中心旗舰的同款硅片。

NVIDIA 干的事很精明:芯片照给,但出厂锁三道。

第一道,锁显存。 GA100 是单体封装设计,HBM2e 显存直接坐在芯片旁边。物理上每张卡都有 5 到 6 个堆栈,每个堆栈 16GB。但出厂时通过 OTP 熔丝和固件,把每个堆栈限制到只有 2GB 可用——于是 8GB 版就是 8GB,10GB 版就是 10GB。显存一直都在,只是不让你看见。

第二道,锁算力。 流处理器的 FMA/IMLA 吞吐被两个寄存器压着,FP32 算力从应有的水平被摁到 0.39 TFLOPS。同时大量 SM 被关闭。

第三道,锁 PCIe。 接口被限制在 PCIe 1.0/1.1 x4,慢到只够传挖矿数据。

外加一条:屏蔽所有图形和通用计算 API。它连显卡都不算,只是块挖矿的板子。

这套锁的逻辑很清晰——不是做不到,是不给你。就像当年 AMD 把四核芯片关两个核心当双核卖。

图 1|三道限制对应的功能与配置位置。解除限速不代表完整恢复 A100。

有人把“锁”撬开了

2026 年 8 月,亚利桑那州立大学的研究员 Jon Pry 公开了一篇论文:《A Canary in the Crypto Mine: Defeating Stack Protection in a GPU Secure Coprocessor》。

翻译成人话就是:他找到了 NVIDIA 安全协处理器的漏洞。

具体路径很硬核。GPU 上有个叫 Falcon 的安全微处理器,负责在启动时校验固件签名。它加载 .fwsignature_ga100 这个 ELF 段进内存,但校验发生在加载之后——中间有个时间窗口。

研究者用一段 63KB 的 ROP(面向返回编程)链替换了这个段,于是拿到执行权,然后去写 BAR0 寄存器,把四个 PLM(平台锁管理器)寄存器同时打开:WPR_CFG、FBPA、WPR、FEAT。

关键点:这四个必须同时开。 少一个,GSP-RM 就认不出完整的显存几何结构。

然后逐项解锁:

显存:把 FBPA_CFG1(地址 0x009A0204)从出厂值改成 0x02779000,64GB 就出来了

算力:往 SS0(0x0082381C)写 0x88888888、往 SS1(0x00823820)写 0x00000008,人为限制消失

PCIe:恢复到 Gen2

这套方案被打包成了开源工具 CMPUnlocker。整个解锁过程不需要动烙铁、不需要拆机——纯软件。

当然有几个硬条件:Linux、root 权限、要编译安装打过补丁的 nvidia-open 内核模块、必须关掉 Secure Boot,而且必须冷启动(完全断电重启,软重启不生效)。

图 2|四组访问门依次打开后,再写入显存和计算配置。具体实现随分支变化。

解锁后,它变成了什么

先看带宽。实测写入 1747 GB/s、读取 1679 GB/s——这个数字基本就是贴着 RTX 5090 打的

再看算力。FP16 矩阵算力 220 TFLOPS,纸面上超过 3090 约 40%,实际表现大致相当于 4080 Super。

然后是显存。这是它真正的卖点:64GB HBM2e

但这里有个大坑,不同批次的卡完全不一样:

8GB 版本(海力士颗粒,设备 ID 0x20C2):解锁到 64GB 很稳

10GB 版本(三星颗粒):理论上能到 80GB,但实测经常不稳,社区推荐只解到 40GB

所以买之前必须认准版本。市面上还有编号 699 开头的工程板,有人试过解不开。

还有一层更深的隐患:这些卡本身就是从没通过 A100 严格筛选的 GA100 硅片里挑出来的。 那些被关掉的显存,到底是”市场分层”关的,还是”本身有缺陷”关的——从外面看不出来。

图 3|公开项目采用的容量配置。解锁目标不代表逐卡稳定性保证。

实测:跑视频生成和跑大模型

有 UP 主自费 6600 收了一张,做了完整实测。

ComfyUI 跑 MiniMax H3 视频生成:INT8 量化顺利跑通,但切到 FP8 反而倒退 20%。原因很直接——GA100 是 Ampere 架构,根本没有 FP8 硬件

vLLM 跑大模型:Qwen3.8-27B 单流 151 tok/s,Qwen3.6-35B-A3B 也跑了,128 并发下做了吞吐测试。解码速度反超 4090。

这两个结果其实很说明问题。大模型推理是访存受限的——瓶颈在显存带宽,不在算力。HBM2e 的带宽优势在这里被完全释放。而视频生成对低精度格式(FP8/NVFP4)的依赖越来越重,正好踩在这张卡的短板上。

价格是怎么被炒起来的

把它当成一条曲线看,特别有意思:

2022–2023 矿难后:三五百块,无人问津

2026 年初:1100–1500,开始有人讨论

2026 年 8 月 3 日:5400

现在:1 万 4

8 月 3 日这个节点是关键——MiniMax H3 在那天开源。

H3 是一个 33B 的全模态视频生成模型,未优化时权重 144GB,显存需求轻松突破 80GB。它一开源,本地创作者集体撞上显存墙。于是”便宜的 64GB 显存”从极客玩具变成了刚需。

有人说这是巧合。但看评论区那些人的自述:有人 5400 时买了两张想等涨价卖一张,一个月后涨到 1 万 4;有人 8600 买两张,已经坏了一张。

H3 开源不是唯一原因,但它是那根导火索。

别急着冲,先把风险看完

1. 没有 FP8。 GA100 是 Ampere,而整个视频生成生态正在往 FP8 / NVFP4 走。这是架构级短板,无解。

2. 没有 NVLink。 多卡互联能力缺失,扩展性受限。

3. 驱动锁版本。 要配特定的老驱动。如果你依赖新版 CUDA、新版 PyTorch、SageAttention 这类加速链路——大概率打架

4. HBM 颗粒坏一颗,整卡报废。 HBM 是封装在芯片旁的,坏了无法单独更换、无法维修。有人买四张坏一张,有人两张坏一张。

5. 有崩溃和输出异常的案例。 另有 UP 实测过:会崩、会掉卡、会输出乱码。毕竟是从没通过筛选的硅片里挑出来的。

6. 价格窗口已经关了。 6600 是捡漏,1 万 4 是接盘。同价位有质保的选择不少——5090、RTX Pro 系列,甚至国产的海光 K100 64GB HBM2 才 6000 价位。

所以它是谁的菜

适合的人:纯跑 LLM 推理、需要大显存和多并发、能接受折腾、能接受整卡报废当沉没成本。

不适合的人:做视频生成的、做长任务的、怕中途崩的、需要驱动跟着生态升级的、把这台机器当生产主力的。

有个评论说得挺到位:一张 3090 跑 Qwen3.8-27B,预填充 1000+、解码 90+,不要了还能打游戏。而这张卡除了算,什么都干不了。

最后

CMP 170HX 的故事,本质上不是一张矿卡翻身的故事。

它是一个关于**”被人为关掉的能力”**的故事——NVIDIA 为了产品分层,在硬件里埋了三道锁;四年后有人用一段 63KB 的 ROP 链把它们全打开了。

它也是一个关于需求如何重定价的故事——同一张卡,矿难后是垃圾,H3 开源后是刚需,中间隔着的不是技术进步,是场景变了。

至于值不值得买,答案取决于你是哪种人。但有一件事是确定的:

这种”软件解锁被锁硬件”的机会,窗口期从来都很短。 等它上了热搜,价格就已经不在你手里了。