可用于测试和提升大推理模型在复杂多步骤推理场景下的性能,通过查询组合将孤立问题转化为多步推理任务,提供包含数学、代码生成等领域的R-HORIZON基准及训练数据,支持强化学习训练以改善长程推理能力。【此简介由AI生成】