哈希网格为何能加速NeRF训练

传统 NeRF 把空间坐标和视角方向直接交给 MLP,由网络同时承担低频结构与高频纹理的拟合任务。训练时,每条光线都要进行多次采样、反复查询网络并参与可微体渲染;当场景细节增多,MLP 必须用更大的计算量去记忆局部变化,这正是原始方法训练缓慢的重要原因。

哈希网格改变了“由单一网络记住整个场景”的分工。它先将三维空间组织为多分辨率网格,再把坐标映射为一组可学习的特征向量;较粗的层级描述整体形状与密度分布,较细的层级补充边缘、纹理等高频细节。MLP 不再从坐标中艰难推导全部空间规律,而是读取已经具备位置层次信息的特征,再预测颜色和密度。

加速的核心在于表示效率。规则高分辨率网格若完整存储,内存开销会迅速扩大;哈希表只为被访问的位置建立紧凑索引,使大量局部特征能够以更低的存储成本参与训练。于是,模型可以在保留细节表达能力的同时,避免用庞大的网络参数覆盖整个连续空间。

这种结构也降低了优化难度。不同尺度的特征将场景信息拆开表达:全局轮廓不必等待纹理细节拟合完成,局部高频变化也无需迫使 MLP 增加过多容量。反向传播时,梯度能够直接更新对应空间区域及其层级特征,训练更容易集中于当前采样到的有效区域。

以 Müller 等人在 2022 年提出的 Instant-NGP 为代表的实现,正是借助哈希表加速的多分辨率编码,将 NeRF 的训练从原本常见的长时间迭代压缩到数分钟甚至数十秒的量级。它并未取消体渲染或多视角监督,而是把最耗费学习能力的空间表示环节改造成更紧凑、更适合并行查询的结构。

哈希网格因此不是单纯的“查表提速”。更准确地说,它以紧凑的分层特征表示替代了 MLP 对空间细节的低效记忆,让计算资源更多用于颜色、密度和视角相关外观的学习。这也是 NeRF 从离线高质量拟合走向可交互训练与渲染的重要工程基础。

参与讨论

0 条评论

延伸阅读