simple-evals:轻量级语言模型评估库,提供基准测试与透明结果

开源轻量级语言模型评估工具,支持MMLU、GPQA等主流基准测试,提供零样本思维链评估,含多模型基准结果对比,助力模型性能透明化分析。【此简介由AI生成】

分支3Tags0

项目介绍

开源轻量级语言模型评估工具,支持MMLU、GPQA等主流基准测试,提供零样本思维链评估,含多模型基准结果对比,助力模型性能透明化分析。【此简介由AI生成】

定制我的领域
514.58 K499访问 GitHub