与近年来大规模视觉Transformer(ViTs)取得的巨大进展相比,基于卷积神经网络(CNNs)的大规模模型仍处于早期阶段。本文提出了一种新的大规模CNN基础模型,称为InternImage,可以像ViTs一样从增加参数和训练数据中获得收益。InternImage与最近关注大型密集核的CNNs不同,采用可变形卷积作为核心运算符,因此我们的模型不仅具有下游任务(如检测和分割)所需的大有效感受野,而且具有适应性的空间聚合,条件是输入和任务信息。因此,所提出的InternImage减少了传统CNNs的严格归纳偏差,并使其有可能从大规模数据中学习到更强大、更稳健的模式,就像ViTs一样。我们的模型在包括ImageNet、COCO和ADE20K在内的具有挑战性的基准测试中得到了验证。值得一提的是,InternImage-H在COCO test-dev上取得了新的记录,达到了65.4 mAP,在ADE20K上达到了62.9 mIoU,优于当前领先的CNNs和ViTs。 paper:https://openaccess.thecvf.com/content/CVPR2023/html/Wang_InternImage_Exploring_Large-Scale_Vision_Foundation_Models_With_Deformable_Convolutions_CVPR_2023_paper.html code:https://github.com/OpenGVLab/InternImage
项目介绍
与近年来大规模视觉Transformer(ViTs)取得的巨大进展相比,基于卷积神经网络(CNNs)的大规模模型仍处于早期阶段。本文提出了一种新的大规模CNN基础模型,称为InternImage,可以像ViTs一样从增加参数和训练数据中获得收益。InternImage与最近关注大型密集核的CNNs不同,采用可变形卷积作为核心运算符,因此我们的模型不仅具有下游任务(如检测和分割)所需的大有效感受野,而且具有适应性的空间聚合,条件是输入和任务信息。因此,所提出的InternImage减少了传统CNNs的严格归纳偏差,并使其有可能从大规模数据中学习到更强大、更稳健的模式,就像ViTs一样。我们的模型在包括ImageNet、COCO和ADE20K在内的具有挑战性的基准测试中得到了验证。值得一提的是,InternImage-H在COCO test-dev上取得了新的记录,达到了65.4 mAP,在ADE20K上达到了62.9 mIoU,优于当前领先的CNNs和ViTs。 paper:https://openaccess.thecvf.com/content/CVPR2023/html/Wang_InternImage_Exploring_Large-Scale_Vision_Foundation_Models_With_Deformable_Convolutions_CVPR_2023_paper.html code:https://github.com/OpenGVLab/InternImage
定制我的领域