英伟达DLSS 5神经渲染技术自DLL文件泄露后,迅速成为硬件优化社区的焦点。民间开发者通过混合精度计算探索性能提升路径,其中FP8与NVFP4的协同应用成为主要研究方向。尽管RTX 50系列显卡在Blackwell架构上原生支持NVFP4格式,但初步测试显示优化效果未达预期。
根据X平台用户SwurvGaming披露的实验数据,某Mod开发团队在RTX 50显卡上测试了混合精度方案。该方案将DLSS 5神经渲染模型的部分计算从FP8切换至NVFP4格式,试图利用Blackwell架构第五代Tensor Core的原生加速能力。然而在4K分辨率测试中,神经渲染阶段耗时仅降低1%-2%,开发者直言在Blackwell架构上的改进幅度"远低于预期"。
NVFP4作为英伟达专为神经网络推理设计的4位浮点格式,其核心优势在于减少内存占用并激活硬件原生加速。但实际应用中面临多重限制:OptiScaler-DLSSNR-PreSR-Multipass项目的0.7.1版本更新说明指出,当模型形状不支持时会自动回退至FP8计算,导致混合精度方案无法覆盖全部渲染流程。项目组在0.7.2版本中虽优化了精度切换路径,并将NVFP4列为Blackwell显卡推荐方案,但实测性能提升仍有限。
在《博德之门3》的120秒持续测试中,混合精度方案达成55.16 FPS的渲染帧率,较纯FP8方案的54.57 FPS仅提升1.08%。这种微弱优势与DLSS 5作为英伟达当前性能开销最高模型的定位形成鲜明对比。开发团队强调,1%-2%的耗时优化仅针对神经渲染阶段,并不直接等同于游戏整体帧率提升。
技术文档显示,NVFP4的有效应用需要配合量化优化技术,其4位数据精度对模型训练和推理流程提出更高要求。英伟达官方此前向Wccftech透露,DLSS 5的当前运行速度已达2026年GTC大会首秀时的5倍,但社区测试表明现有优化手段仍未突破模型结构与硬件驱动的双重瓶颈。随着RTX 40系列显卡即将获得官方支持,这场由民间发起的性能优化实验仍在持续演进。











