本文提出了一种名为ConsistNet的新方法,该方法能够给定一个3D物体的单张图像,生成多张同一物体的图像,就像它们是从不同视角拍摄而来的一样,同时有效地利用了这些多个生成图像之间的3D(多视图)一致性。我们方法的核心是一个多视图一致性模块,它基于底层的多视图几何原理,实现了在多个单视图扩散过程之间的信息交换。ConsistNet是标准潜在扩散模型的扩展,由两个子模块组成:(a)视图聚合模块,将多视图特征投影到全局3D体积中并推断一致性,以及(b)射线聚合模块,对一致性进行采样和聚合,并将3D一致性特征返回到每个视图以强制保持一致性。我们的方法与以往的多视图图像生成方法不同之处在于,它可以轻松地插入预训练的LDMs中,而无需显式的像素对应或深度预测。实验证明,我们的方法在一个单独的A100 GPU上可以在40秒内有效地学习3D一致性,并生成物体的16个周围视图。 arXiv:https://arxiv.org/abs/2310.10343 github:https://github.com/JiayuYANG/ConsistNet
项目介绍
本文提出了一种名为ConsistNet的新方法,该方法能够给定一个3D物体的单张图像,生成多张同一物体的图像,就像它们是从不同视角拍摄而来的一样,同时有效地利用了这些多个生成图像之间的3D(多视图)一致性。我们方法的核心是一个多视图一致性模块,它基于底层的多视图几何原理,实现了在多个单视图扩散过程之间的信息交换。ConsistNet是标准潜在扩散模型的扩展,由两个子模块组成:(a)视图聚合模块,将多视图特征投影到全局3D体积中并推断一致性,以及(b)射线聚合模块,对一致性进行采样和聚合,并将3D一致性特征返回到每个视图以强制保持一致性。我们的方法与以往的多视图图像生成方法不同之处在于,它可以轻松地插入预训练的LDMs中,而无需显式的像素对应或深度预测。实验证明,我们的方法在一个单独的A100 GPU上可以在40秒内有效地学习3D一致性,并生成物体的16个周围视图。 arXiv:https://arxiv.org/abs/2310.10343 github:https://github.com/JiayuYANG/ConsistNet
定制我的领域