可用于评估不同代码探索模式的效果与成本,提供89条Rust/Python/C/C++代码评测子集,支持纯Claude Code和强制subagent两种评估模式,记录token消耗并生成多维度指标对比。【此简介由AI生成】