DPT:基于视觉Transformer的密集预测:深度估计与语义分割实现

Dense Prediction Transformers

分支2Tags1
文件最后提交记录最后更新时间
5 年前
7 年前
5 年前
5 年前
5 年前
5 年前
5 年前
5 年前
5 年前
5 年前
5 年前
5 年前
5 年前
5 年前

视觉变压器用于密集预测

本仓库包含我们的论文相关代码和模型:

视觉变压器用于密集预测
René Ranftl, Alexey Bochkovskiy, Vladlen Koltun

更新日志

  • [2021年3月] 首次发布推理代码和模型。

环境搭建

  1. 下载模型权重并存放在weights文件夹中:

  2. 安装依赖项:

    pip install -r requirements.txt
    

    该代码已在Python 3.7、PyTorch 1.8.0、OpenCV 4.5.1和timm 0.4.5环境下测试。

使用方法

  1. 将一个或多个输入图像放入input文件夹中。

  2. 运行单目深度估计模型:

    python run_monodepth.py
    

    或运行语义分割模型:

    python run_segmentation.py
    
  3. 结果分别保存在output_monodepthoutput_semseg文件夹中。

使用-t标志可以在不同的模型之间切换。可能的选项包括dpt_hybrid(默认)和dpt_large

额外模型:

通过以下命令运行:

python run_monodepth.py -t [dpt_hybrid_kitti|dpt_hybrid_nyu]

评估

有关如何评估单目深度估计模型的提示,请参考:EVALUATION.md

引用

如果您使用此代码或其中的任何模型,请引用我们的论文。

@article{Ranftl2021,
    author    = {René Ranftl and Alexey Bochkovskiy and Vladlen Koltun},
    title     = {Vision Transformers for Dense Prediction},
    journal   = {ArXiv preprint},
    year      = {2021},
}

@article{Ranftl2020,
    author    = {René Ranftl and Katrin Lasinger and David Hafner and Konrad Schindler and Vladlen Koltun},
    title     = {Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer},
    journal   = {IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)},
    year      = {2020},
}

致谢

我们的工作建立在timmPyTorch-Encoding的基础之上,并使用了这些库的代码。我们感谢作者共享这些库。

许可证

此项目遵循MIT许可证。

项目介绍

稠密预测变换器【此简介由AI生成】

定制我的领域
12.33 K281访问 GitHub