可用于评估大语言模型智能体在现实应用中的工具使用能力,提供多场景交互任务和灵活评估框架,包含100个跨场景任务及66种工具,采用基于评分标准的滑动窗口评估器,助力提升AI智能体实际应用表现。【此简介由AI生成】