
9月3日,英伟达在《NBA 2K27》中首发仅面向RTX 50系列显卡的DLSS 5神经渲染技术,看似确立了严格的硬件门槛。然而不到四周,这一壁垒对AMD用户而言已名存实亡。由社区驱动的逆向工程项目在24小时内实现性能飞跃,将《赛博朋克2077》在AMD Radeon RX 9070 XT上的帧率从约11帧大幅提升至约50帧。
社区突破:24小时性能提升74%
这一突破源于开发者Daniel Blanco在GitHub发布的“DLSS-NR-on-AMD”项目。Alpha 0.3.3版本较前代提升23%,随后的Alpha 0.4.0版本再增42%,累计带来约74%的性能增益。配套的AMDNR Launcher实现了安装自动化,免去了手动复制DLL文件的繁琐。
测试显示,在3440×1440超宽分辨率下,《赛博朋克2077》开启神经渲染后帧率稳定在50 FPS左右,而此前仅为30 FPS。尽管仍低于未启用DLSS 5时的原生80 FPS,但其迭代速度惊人。事态发展之快,甚至超越了该技术本身的官方发布节奏。
Intel移植验证:架构非壁垒,算力是关键
AMD的进展并非孤例。早在9月18日,GitHub用户Uzbekunknown发布了针对Intel显卡的“dlss-nr-on-intel”项目。不同于简单的DLL封装,该项目从头重写了DLSS 5核心的71层U-Net神经网络,利用Vulkan API扩展VK_KHR_cooperative_matrix,使其能在Intel Xe2架构的矩阵加速单元上运行。
在搭载Intel Arc 140V集成显卡的Lunar Lake笔记本上,性能表现勉强:640×360低分辨率下《铁拳7》帧率约10.5 FPS;全高清分辨率下,仅推理阶段每帧耗时约412毫秒,理论输出上限约2.4 FPS。这证实了DLSS 5推理管线可在非英伟达硬件上运行,瓶颈在于吞吐量而非架构兼容性。
AI代理编程:氛围编程的现实案例
Intel移植版的开发过程极具代表性。开发者Uzbekunknown透露,兼容性层主要由AI代理完成,人类仅提供方向、二进制文件及决策。Anthropic的Claude和OpenAI的GPT-6 Astra是主要“编码者”,甚至连README文档也由AI生成。项目中曾出现因AI幻觉导致的错误驱动路径,历经三个开发阶段才被纠正。
这是前特斯拉AI负责人Andrej Karpathy于2025年2月提出的“氛围编程”(vibe coding)的典型应用:开发者设定高层意图,由AI处理具体实施。该方法成功应用于消费级图形领域最复杂的逆向工程之一,表明2026年的硬件移植技能天花板已被AI大幅推高。
FP8精度:英伟达的核心护城河
为何AMD实现版本慢于英伟达原生产品?关键在于浮点精度。DLSS 5在RTX 50系列上以FP8精度运行,其计算效率约为FP16的两倍。Intel Arc 140V不支持FP8,只能以FP16配合FP32累加运行,导致推理速度慢约一倍。
AMD RDNA 4架构(RX 9000系列)原生支持FP8,因此其早期Alpha版本性能显著优于Intel移植版。测试数据显示,随着内核优化,RX 7800 XT在1440p下的神经网络处理时间从73毫秒降至52毫秒。当Blanco的RDNA 4实现完全启用原生FP8路径时,剩余差距将仅反映原始AI计算带宽,而非精度妥协。
英伟达的“围墙花园”并未真正被打破
尽管模组生态证明了DLSS 5的可移植性,但英伟达的独占性本质上是暂时的。2026年9月4日,英伟达发言人确认DLSS 5将在稍后登陆RTX 40系列显卡。模组生态的真正价值在于证明:任何具备足够矩阵算力和Vulkan协作矩阵支持的GPU均可运行该模型,目前的限制仅是“跑得不够快”。
在《赛博朋克2077》中达到50 FPS,意味着AMD硬件已接近休闲使用的阈值。Blanco表示重大更新在即,性能有望进一步提升。
RDNA 3的困境与AMD的自研计划
目前项目主要面向RDNA 4,但在RX 7900 XTX等RDNA 3显卡上也有尝试。由于缺乏FP8支持,RDNA 3需使用降级精度路径,形成“FSR放大+英伟达神经渲染”的奇特管线,性能仍处于游戏可用性的边缘。
与此同时,爆料者Kepler_L2指出,AMD正在开发专用于下一代RDNA 5硬件的神经光照技术,因计算负载巨大,预计不会向下兼容。AMD已在GPUOpen平台发布两项相关开源研究:轻量级间接照明模型和时序稳定生成照明模型,这或许是官方神经渲染产品的前奏。
模组生态现状与购买建议
除AMD和Intel移植版外,社区还通过修补CUDA指令将DLSS 5带至RTX 30/20系列(高分辨率下性能严重下降),甚至通过WebGPU端口在浏览器中运行(每帧约2秒)。双GPU配置方案也可将神经渲染帧率提高高达127%。
对于普通用户:
- AMD RDNA 4用户:可尝试DLSS-NR-on-AMD项目,需Windows 11、Adrenalin 26.1.1+驱动及支持FSR的DX12游戏。处于Alpha阶段,效果因游戏而异。
- Intel Arc用户:dlss-nr-on-intel项目目前仅支持Linux(Arch Linux+Mesa ANV驱动),Windows移植版尚未实现。
- 其他硬件:RTX 30/20及更旧硬件虽有小众实现,但在真实分辨率下帧率多为个位数,不具备实用价值。
常见问题解答
AMD Radeon显卡能官方运行DLSS 5吗?
不能。截至2026年9月28日,DLSS 5仅在英伟达RTX 50系列及GeForce Now云服务上正式可用。AMD用户可通过非官方社区项目体验,但需满足特定软硬件条件。英伟达已确认RTX 40系列将获得支持,但未计划支持非英伟达硬件。
为什么DLSS 5在AMD上比RTX 50慢?
核心原因是浮点精度。英伟达原生实现使用FP8精度,数据量减半,吞吐量翻倍。AMD RDNA 4支持FP8,因此比不支持FP8的RDNA 3更快缩小差距。瓶颈在于计算带宽,而非架构不可兼容。
什么是氛围编程?
由Andrej Karpathy于2025年提出,指开发者用自然语言描述意图,由AI代理处理代码实施。Intel DLSS 5移植版即由此构建,展示了AI在低级GPU逆向工程中的应用潜力。
AMD有自研神经渲染技术吗?
是的。据爆料,AMD正在开发专用于RDNA 5的神经光照技术,并已在GPUOpen发布相关开源研究论文,预示官方产品即将到来。