ACoT-VLA:基于 Torch/NPU 的具身智能视觉-语言-动作模型项目

可用于驱动 LIBERO 仿真环境中 Franka 单臂完成操作任务。项目重写官方 JAX/GPU 代码适配 NPU,复现 ACoT-VLA 训练推理链路,采用 SigLIP 和 Gemma 构建视觉语言主干,增加两级动作建模及 flow-matching 训练目标。【此简介由AI生成】

Branch1Tags0

Introduction

可用于驱动 LIBERO 仿真环境中 Franka 单臂完成操作任务。项目重写官方 JAX/GPU 代码适配 NPU,复现 ACoT-VLA 训练推理链路,采用 SigLIP 和 Gemma 构建视觉语言主干,增加两级动作建模及 flow-matching 训练目标。【此简介由AI生成】

Customize your domain