AMD BC-250 矿卡魔改跑 FSR 4#

各位朋友好,我是紫星,这篇我拉上了无边一起聊。起因是开源社区最近干了一件很"离谱"又很漂亮的事:把一批本来是挖矿用的 AMD BC-250 显卡,硬是魔改跑通了 AMD 自家的招牌 AI 超分技术 FSR 4。图形处理耗时在 1440p 分辨率下从 11.51 毫秒压到了 5.92 毫秒,降幅超过了 50%。这批卡原本因为搭载的是 PS5 的"残次芯片"而被矿场当成白菜价甩卖,现在却被批量改造成了 Linux 游戏主机。

我负责硬件和性能指标那一摊,无边负责 AI 超分和开源生态那一摊。咱们把这件事拆开揉碎了讲。


一、BC-250 到底是什么来头#

1.1 一块"官改失败"的矿卡#

AMD BC-250 是一张很有意思的卡。它本来是 AMD 为加密货币挖矿市场推出的专用矿卡,核心代号「Navi 10」的衍生版本,本质上用的是和 PS5 同源的 RDNA 2 架构芯片。问题在于,这款芯片在出厂测试时没能达到 PS5 的良品标准——要么是部分计算单元被屏蔽,要么是频率体质不达标,要么是某些单元存在瑕疵,总之是被 Sony 挑剩下的残次芯片。

AMD 没有浪费这些芯片,把它们装进了 BC-250 这块矿卡上,主打一个"废物利用"。矿卡本身的定位就极其单一:没有视频输出接口(或者说接口残缺)、没有针对游戏的驱动优化、BIOS 被锁死、功耗和散热按挖矿长时间的 7×24 场景设计。价格一度被杀到极低,矿潮退去之后更是一堆一堆地躺在二手市场里吃灰。

项目 BC-250 矿卡 说明
核心架构 RDNA 2(Navi 10 衍生) 与 PS5、RX 5700 系列同源
芯片来源 PS5 残次芯片 计算单元或频率体质不达标被屏蔽
原生定位 加密货币挖矿专用 无完整视频输出、锁 BIOS
驱动支持 官方驱动基本不维护 游戏场景几乎被放弃
二手价格 极低(白菜价) 矿潮退去后大量积压
功耗设计 按 7×24 挖矿长时间运行 散热冗余较大

为什么它能跑 FSR 4 这么高级的功能?这就得从 FSR 4 的实现原理说起,这一块是无边的领域。


二、FSR 4 超分到底是怎么实现的(无边视角)#

2.1 从"手工算法"到"深度神经网络"#

无边的开场白是这么说的:FSR 之所以会进到 4.0 这个版本号,是因为它发生了代际的质变,而不是量变。

FSR 1.0 是纯空间放大的算法,靠边缘检测和锐化把低分辨率图像硬撑上去,快,但细节经不起细看。FSR 2.0 换成了时域累积(temporal upscaling),利用历史帧的运动向量把信息"攒"起来,质量明显上了一个台阶,但依然是手写算法、靠调参。

FSR 4.0 彻底换赛道了,它改成了基于深度神经网络的超分。核心是一个卷积神经网络或者类似 Transformer 的超分辨率模型,输入低分辨率当前帧、历史帧、运动向量和深度信息,输出高分辨率的图像。这个模型需要在大量高画质游戏截图和原生高分辨率帧上训练,才能在重建细节、处理边缘、抑制鬼影方面达到接近原生渲染的效果。

在算法层面,FSR 4 的工作流程大致可以拆成这样几块:

模块 作用 说明
输入准备 低分辨率帧 + 历史帧 + 运动向量 提供重建所需的时空信息
特征提取 神经网络卷积层提取图像特征 学习边缘、纹理、几何结构
时域融合 结合历史帧做运动补偿 抑制闪烁和鬼影(temporal 伪影)
上采样重建 神经网络生成高分辨率细节 输出目标分辨率的最终图像
锐化与后处理 抑制伪影、提升观感 处理不自然的高频噪声

无边特别强调:FSR 4 本质上是 AMD 用 AI 的方式去"猜"那些被丢弃的像素。分辨率从 1440p 渲染到 4K,等于每 9 个像素里有 4 个是 AI 猜出来的。猜得准不准,直接决定画质,也直接决定这张卡还有没有游戏价值。

2.2 为什么神经网络超分能吃 GPU 性能#

这也是 FSR 4 迟迟没有全面推开的根本原因:神经网络推理需要大量矩阵乘法和卷积运算,而这些运算恰好是 GPU 里「计算单元」最在行但也最吃资源的地方。

在 PS5 和 BC-250 这类 RDNA 2 架构上,AI 推理并没有专用的张量核心(Tensor Core)来加速。NVIDIA 的 DLSS 之所以强,是因为 RTX 20 系之后每张卡都有专门的 Tensor Core 负责矩阵运算,超分模型跑起来几乎是"顺路"的。而 AMD 这边,RX 7000 之前的 RDNA 2 并没有规划出独立的 AI 加速硬件,FSR 4 只能靠通用的着色器单元(Shader)用通用矩阵乘法把模型"硬啃"下来。

这就是为什么 FSR 4 在 AMD 自己的规划里,一开始只准备给拥有 AI 加速单元的 RX 7000(RDNA 3)和 RX 9000(RDNA 4)用。BC-250 这种 RDNA 2 的矿卡,理论上根本不在支持名单里。


三、PS5 残次芯片为什么能跑 FSR 4(紫星视角)#

无边讲完原理,紫星我得抛出更硬核的问题:既然 RDNA 2 没有 AI 加速单元,FSR 4 理论上是给 RDNA 3/4 用的,那 BC-250 到底是怎么跑起来的?

3.1 残次不等于阉割到不能用#

首先要厘清"残次芯片"这个概念。BC-250 用的 Navi 10 核心,被屏的通常是一部分计算单元(CU),或者频率体质偏弱,或者某个显示引擎/编码器有瑕疵。但核心的指令集、通用着色器、光栅化管线、以及底层通用的矩阵运算能力,大多是完整的。

换句话说,被屏蔽掉的那部分,可能恰恰不是跑 AI 推理最需要的通用算力。只要模型能跑通用着色器上的矩阵乘法,残次芯片照样能推理,只是速度慢一点而已。

这里的关键在于:FSR 4 模型的推理依赖的是通用矩阵乘法(GEMM)和卷积运算,这些在 RDNA 2 的着色器上是用通用指令完成的,不需要专门的 AI 单元。所以丢掉的如果是游戏渲染单元或者频率上限,对 FSR 4 的推理影响有限。

3.2 开源驱动的"硬适配"#

社区能跑通 FSR 4,靠的是一整套开源工具链的打通。BC-250 本来官方驱动几乎等于放弃,游戏场景更是没人管。但 Linux 生态里的开源驱动(Mesa + RADV)对 RDNA 2 架构的支持非常完善,社区把 FSR 4 的推理管线通过通用的计算着色器(类似 Vulkan 计算管线)跑了起来。

换句话说,社区做的事情本质上是:绕过官方驱动,用开源驱动把 RDNA 2 的通用算力释放出来,然后给 FSR 4 模型写了一条能被通用着色器执行的"翻译管线"。这条管线把原本需要 AI 加速单元才能高效运行的运算,摊到了大量通用着色器上并行处理。

3.3 为什么能作为"游戏主机"批量复活#

紫星认为它之所以被批量改造成 Linux 游戏主机,有几个硬件层面的天然优势:

优势 说明
架构完整度足够 光栅化、着色器、通用计算都还能用
散热冗余大 按挖矿 7×24 设计,游戏负载轻松
有开源驱动支持 Mesa/RADV 对 RDNA 2 很成熟
无完整视频输出 需要魔改接显示,但 Linux 下可行
成本极低 白菜价买入,改造容错率高

配合 FSR 4 把高分辨率压力降下来,这批卡就能在一个很低的分辨率下渲染、再由 AI 超分扛到目标分辨率,从而实现"低端硬件跑中高端画质"的魔幻效果。


四、性能优化:11.51ms → 5.92ms(紫星视角)#

4.1 数据怎么来的#

无边和我对这条数据的口径对了一下。这里的 11.51ms 和 5.92ms,指的是 FSR 4 超分整个图形处理管线在 1440p 目标分辨率下的单帧耗时。对象输出是 1440p,输入更低(可能是 1080p 甚至更低)。

阶段 优化前耗时 优化后耗时 降幅
FSR 4 超分推理 11.51 ms 5.92 ms -48.6%
折算帧率占用 约 87 fps 的耗时 约 169 fps 的耗时

降幅超过 50%,单看数字可能没感觉,但换算成帧率就很直观了:处理一帧花 11.51ms,意味着超分本身在 1440p 下就要吃掉大约 87 帧的量;压到 5.92ms 之后,超分对帧率的占用几乎减半,游戏本体就能把更多性能花在真实渲染上。

4.2 优化手段拆解#

社区能把耗时压掉一半以上,不是靠某种魔法,而是靠几个方向的持续迭代。紫星把这些手段归纳成四类:

优化方向 具体手段 效果
算子融合 把多个小卷积/矩阵乘合并成一次大计算 减少内核启动开销,提升并行效率
精度选择 用低精度数值(如 FP16/BF16)近似推理 降低计算量,显存带宽压力也下降
算子重排 优化卷积层的执行顺序和内存访问模式 提升缓存命中率,减少访存等待
工作组调优 调整计算分块(thread group)大小与布局 摊满着色器,减少空转

其中精度选择是最立竿见影的一条。神经网络超分对数值精度其实有一定容忍度,FP16 甚至更低的精度在很多层上不会带来肉眼可见的画质损失,却能成倍降低通用着色器上的计算压力和显存带宽需求。对残次芯片这种"算力和带宽都紧巴巴"的硬件来说,这几乎是最划算的一刀。

4.3 为什么是非线性的大幅下降#

11.51 压到 5.92,不是简单的"提速 2 倍换 2 倍快",而是因为这几项优化之间存在叠加效应。算子融合减少了内核调度开销,精度选择砍掉了大量浮点运算,工作组调优又让残余运算铺得更满。三者叠加,收益不是加法而是乘法,所以才会出现超过 50% 的幅度。


五、为什么 1440p 是实用上限(紫星 + 无边)#

5.1 算力与带宽的硬约束#

无边第一个跳出来说:1440p 是实用上限,这句话本质上是算力和带宽共同卡出来的。FSR 4 的目标分辨率越高,需要 AI"猜"出来的像素就越多,神经网络的推理成本就几乎成正比上升。从 1440p 到 4K,重建的像素量大概要翻一倍多(1440p 约 370 万像素,4K 约 830 万像素),推理耗时也就跟着水涨船高。

紫星补充硬件层面的第二个锁:BC-250 这种 RDNA 2 残次芯片,显存带宽是先天短板。高分辨率超分需要频繁读写高分辨率中间帧、历史帧和特征图,显存带宽一旦不够,就会变成严重的瓶颈。残次芯片如果带宽体质再被阉割,4K 下的数据搬运就会直接把性能压垮。

目标分辨率 重建像素量 FSR 4 推理压力 结论
1080p 约 207 万 轻松流畅
1440p 约 370 万 中等 优化后可接受,实用上限
4K 约 830 万 带宽+算力双瓶颈,不实用

5.2 残次芯片的体质天花板#

BC-250 的芯片本来就是被挑剩下的,频率体质、计算单元数量、显存控制器稳定性都打了折扣。即使魔改解锁了更多单元,也很难具备原生旗舰卡那种"抗造"的余量。4K 下的长期高负载运行,对体质偏弱的残次芯片来说,无论是发热还是稳定性都不友好。

5.3 经验结论#

所以把 1440p 定为实用上限,是一个非常务实的判断:在 1080p 下,BC-250 完全可以靠 FSR 4 玩得很舒服;在 1440p 下,经过社区优化后能跑出可接受的画质和帧率;但一到 4K,算力和带宽的双重天花板就会让体验直线下滑。 这批被改造成 Linux 游戏主机的矿卡,1440p 是一个"做得到且值得做"的甜蜜点。


六、AI/ML 超分技术的社区渗透与开源生态(无边视角)#

6.1 从"厂商专属"到"社区可改"#

无边说这一块是他最兴奋的部分。过去,DLSS、FSR、XeSS 这种 AI 超分技术,本质上是几家大厂关起门来做的"黑盒",支持哪些显卡、怎么优化,全由厂商说了算。FSR 前两代靠着开源在游戏层面铺得广,但 FSR 4 这次被社区直接"逆移植"到官方根本没规划的 RDNA 2 矿卡上,意义完全不同。

它证明了:当一项 AI 技术以模型+开源驱动的形式存在时,它的可能性边界就不再是由厂商划定的,而是由社区的能力划定的。

6.2 为什么开源生态在这件事上特别有活力#

无边把原因归结为几个层面的叠加:

层面 为什么让社区能"搞事"
驱动开源 Mesa/RADV 让 RDNA 2 硬件能被自由调优
模型可移植 AI 超分模型可用通用着色器跑,不绑死专用硬件
工具链成熟 Linux 下 VKD3D/Proton/Vulkan 让游戏能跑起来
硬件廉价 白菜价矿卡给了足够低的试错成本
社区文化 开源圈愿意为"冷门硬件"持续投入优化

6.3 这件事的行业意义#

无边认为,BC-250 跑 FSR 4 这件事,表面上看是"一群硬核玩家玩废卡",实质上牵出了 AI 超分技术的两个趋势:

其一,AI 超分正在从"旗舰独占"走向"通用算力普惠"。当超分模型不再依赖专用 AI 单元、而是能用通用着色器跑起来的时候,理论上任何一块算力够用的老卡、低端卡、甚至矿卡,都有机会获得"AI 画质"能力。这大大拉低了 AI 超分的硬件门槛。

其二,开源生态的渗透力被证明是极强的。只要模型可拿到、驱动可改写、工具链可打通,社区就能把一项"官方限定"的技术,移植到官方想都不敢想的硬件上。这种生态活力,某种程度上已经超过了厂商自己规划的路线图。

6.4 局限与风险#

但无边也没那么乐观,他同步泼了几盆冷水:

  • FSR 4 在通用着色器上跑,功耗和发热要比专用 AI 单元高不少,矿卡的散热冗余此时反而成了优势。
  • 残次芯片毕竟体质打折,长期高负载下的稳定性、寿命都存疑,更多是"玩票"而非"主力机"。
  • 这种魔改高度依赖社区维护,一旦某个关键开源组件停止维护,整条改造链就可能断掉。
  • AI 超分在低端硬件上的画质,和旗舰卡原生高分辨率渲染相比仍有差距,是一种"以性能换画质"的折中。

七、总结:一次关于"硬件价值重塑"的实验#

紫星最后收个尾。BC-250 跑 FSR 4 这件事,核心信息其实很朴素:一块因为被判定"残次"而沦落到矿场的芯片,并没有真的失去价值。 它只是缺少一个释放它的正确姿势。当开源社区把 FSR 4 这种 AI 超分技术移植上去之后,残次芯片的通用算力被重新激活,配合 1440p 这个务实的甜蜜点,这批近乎废弃的矿卡居然拥有了做一台 Linux 游戏主机的资格。

无边补充说,这背后真正的看点,是 AI 超分技术的开源渗透力。FSR 4 不只是一个画质功能,它已经成了一种可以被社区自由改写、逆向移植、甚至"降级适配"的通用能力。当一项 AI 技术在开源生态里扎根,它的生命力就不再由厂商定义的规格表说了算。

这台用 PS5 残次芯片搭起来的 Linux 游戏主机,或许永远跑不了 4K 旗舰画质,但它在 1440p 下的表现,已经足够证明一件事:在开源与 AI 的合力下,硬件的价值,永远比它的出厂定价更有想象力。

——紫星(硬件技术) & 无边(AI 视角),NTGame 编辑

内容最后验证于 2026-07