A benchmark for LLMs on complicated tasks in the terminal
| Files | Last commit | Last update |
|---|---|---|
| 10 months ago | ||
| 10 months ago | ||
| 11 months ago | ||
| 9 months ago | ||
| 11 months ago | ||
| 1 year ago | ||
| 1 year ago | ||
| 7 months ago | ||
| 1 year ago | ||
| 10 months ago | ||
| 11 months ago | ||
| 10 months ago | ||
| 11 months ago | ||
| 1 year ago | ||
| 1 year ago | ||
| 11 months ago | ||
| 1 year ago | ||
| 1 year ago | ||
| 1 year ago | ||
| 1 year ago | ||
| 2 months ago | ||
| 1 year ago | ||
| 10 months ago | ||
| 11 months ago | ||
| 10 months ago |
terminal-bench
#####################################################################
# _____ _ _ ______________ #
# |_ _|__ _ __ _ __ ___ (_)_ __ __ _| | || || #
# | |/ _ \ '__| '_ ` _ \| | '_ \ / _` | | || > || #
# | | __/ | | | | | | | | | | | (_| | | || || #
# |_|\___|_| |_| |_| |_|_|_| |_|\__,_|_| ||____________|| #
# ____ _ |______________| #
# | __ ) ___ _ __ ___| |__ \\############\\ #
# | _ \ / _ \ '_ \ / __| '_ \ \\############\\ #
# | |_) | __/ | | | (__| | | | \ ____ \ #
# |____/ \___|_| |_|\___|_| |_| \_____\___\____\ #
# #
#####################################################################
📢 公告:新用户请查看 harbor,这是我们用于运行 Terminal-Bench 2.0 的全新框架!
Terminal-Bench 是一款用于在真实终端环境中测试 AI 智能体的基准测试工具。从代码编译、模型训练到服务器搭建,Terminal-Bench 能够评估智能体自主处理现实世界端到端任务的能力。
无论您是在构建 LLM 智能体、基准测试框架,还是对系统级推理进行压力测试,Terminal-Bench 都能为您提供一套可复现的任务套件和执行工具,专门用于实际、真实场景下的评估。
Terminal-Bench 包含两部分:任务数据集和执行工具,后者负责将语言模型与我们的终端沙箱连接起来。
Terminal-Bench 目前处于测试版阶段,包含约 100 项任务。在未来几个月,我们计划将 Terminal-Bench 扩展为文本环境下 AI 智能体的综合测试平台。欢迎任何形式的贡献,尤其是新的具有挑战性的任务!
快速入门
Terminal-Bench 以 pip 包形式分发,可通过 Terminal-Bench 命令行界面 tb 运行。
uv tool install terminal-bench
或
pip install terminal-bench
进一步的文档
核心组件
任务数据集
Terminal-Bench 中的每个任务都包含:
- 英文指令,
- 用于验证语言模型/智能体是否成功完成任务的测试脚本,
- 用于解决该任务的参考(“基准”)解决方案。
任务位于仓库的 tasks 文件夹中,上述当前任务列表提供了易于浏览的概览。
执行测试框架
该框架将语言模型连接到沙箱终端环境。在安装 terminal-bench 包(以及依赖项 uv 和 Docker)后,您可以使用以下命令查看如何运行该框架:
tb run --help
有关运行测试工具及其选项的详细信息,请参见文档。
提交至我们的排行榜
Terminal-Bench-Core v0.1.1 是 Terminal-Bench 测试版发布的任务集,对应当前的排行榜。要在该数据集上进行评估,请在测试工具中传入 --dataset-name terminal-bench-core 和 --dataset-version 0.1.1。例如:
tb run \
--agent terminus \
--model anthropic/claude-3-7-latest \
--dataset-name terminal-bench-core
--dataset-version 0.1.1
--n-concurrent 8
有关提交到排行榜的详细说明,请查看我们的排行榜提交指南。
有关Terminal-Bench数据集和版本控制的更多信息,请查看我们的注册表概述。
贡献
创建新任务
请查看我们的任务贡献快速入门来创建新任务。
创建新适配器
请查看如何为新基准创建新适配器以贡献新适配器。
引用我们
如果您觉得Terminal-Bench对您有所帮助,请按以下方式引用我们:
@inproceedings{merrill2026terminalbench,
title={Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces},
author={Mike A Merrill and Alexander Glenn Shaw and Nicholas Carlini and Boxuan Li and Harsh Raj and Ivan Bercovich and Lin Shi and Jeong Yeon Shin and Thomas Walshe and E. Kelly Buchanan and Junhong Shen and Guanghao Ye and Haowei Lin and Jason Poulos and Maoyu Wang and Jenia Jitsev and Marianna Nezhurina and Di Lu and Orfeas Menis Mastromichalakis and Zhiwei Xu and Zizhao Chen and Yue Liu and Robert Zhang and Leon Liangyu Chen and Anurag Kashyap and Jan-Lucas Uslu and Jeffrey Li and Jianbo Wu and Minghao Yan and Song Bian and Vedang Sharma and Ke Sun and Steven Dillmann and Akshay Anand and Andrew Lanpouthakoun and Bardia Koopah and Changran Hu and Etash Kumar Guha and Gabriel H. S. Dreiman and Jiacheng Zhu and Karl Krauth and Li Zhong and Niklas Muennighoff and Robert Kwesi Amanfu and Shangyin Tan and Shreyas Pimpalgaonkar and Tushar Aggarwal and Xiangning Lin and Xin Lan and Xuandong Zhao and Yiqing Liang and Yuanli Wang and Zilong Wang and Changzhi Zhou and David Heineman and Hange Liu and Harsh Trivedi and John Yang and Junhong Lin and Manish Shetty and Michael Yang and Nabil Omi and Negin Raoof and Shanda Li and Terry Yue Zhuo and Wuwei Lin and Yiwei Dai and Yuxin Wang and Wenhao Chai and Shang Zhou and Dariush Wahdany and Ziyu She and Jiaming Hu and Zhikang Dong and Yuxuan Zhu and Sasha Cui and Ahson Saiyed and Arinbj{\"o}rn Kolbeinsson and Christopher Michael Rytting and Ryan Marten and Yixin Wang and Alex Dimakis and Andy Konwinski and Ludwig Schmidt},
booktitle={The Fourteenth International Conference on Learning Representations},
year={2026},
url={https://openreview.net/forum?id=a7Qa4CcHak}
}