众所周知,尽管训练数据中存在亮度差异较大的图像,但许多公开发布的基础扩散模型在生成与平均亮度显著不同的图像时仍存在困难。这是由于一个不一致性:虽然在推理过程中去噪从纯高斯噪声开始,但由于主流形式中的数值调节困难,训练噪声计划在最终时间步分布中保留残余数据,导致推理过程中出现意外偏差。为了缓解这个问题,某些ϵ-预测模型与一种特殊的偏移噪声方法相结合。与此同时,一些现代模型采用了零终端信噪比(SNR)噪声计划以及v-预测,这需要对预训练模型进行重大修改。然而,这样的改变可能会破坏大量基于这些预训练模型的社区驱动应用的稳定性。鉴于此,我们的调查重新审视了根本原因,并提出了一个创新和有原则的解决方案,称为“再走一步”(OMS)。通过集成一个紧凑的网络,并在推理过程中加入一个额外的简单而有效的步骤,OMS提高了图像保真度,并协调了训练和推理之间的矛盾,同时保留了原始模型参数。一旦训练完成,具有相同潜在域的各种预训练扩散模型可以共享同一个OMS模块。 arXiv:https://arxiv.org/abs/2311.15744 github:https://github.com/mhh0318/OneMoreStep
项目介绍
众所周知,尽管训练数据中存在亮度差异较大的图像,但许多公开发布的基础扩散模型在生成与平均亮度显著不同的图像时仍存在困难。这是由于一个不一致性:虽然在推理过程中去噪从纯高斯噪声开始,但由于主流形式中的数值调节困难,训练噪声计划在最终时间步分布中保留残余数据,导致推理过程中出现意外偏差。为了缓解这个问题,某些ϵ-预测模型与一种特殊的偏移噪声方法相结合。与此同时,一些现代模型采用了零终端信噪比(SNR)噪声计划以及v-预测,这需要对预训练模型进行重大修改。然而,这样的改变可能会破坏大量基于这些预训练模型的社区驱动应用的稳定性。鉴于此,我们的调查重新审视了根本原因,并提出了一个创新和有原则的解决方案,称为“再走一步”(OMS)。通过集成一个紧凑的网络,并在推理过程中加入一个额外的简单而有效的步骤,OMS提高了图像保真度,并协调了训练和推理之间的矛盾,同时保留了原始模型参数。一旦训练完成,具有相同潜在域的各种预训练扩散模型可以共享同一个OMS模块。 arXiv:https://arxiv.org/abs/2311.15744 github:https://github.com/mhh0318/OneMoreStep
定制我的领域