文件最后提交记录最后更新时间
17 天前
17 天前
3 天前
README

评测实验化 · 设计资料

「评测执行」升级为「实验」的设计与交互定稿资料。

文件

  • eval-experiment-hifi.html —— 交互高保真原型(自包含单文件,浏览器直接打开)。经三轮团队评审迭代定稿,含四个页面:
    1. 实验列表 —— 状态/类型/Case 数/评估器数,分页
    2. 四步向导 —— ① 待评测 Agent → ② 关联 Trace(含监听模式)→ ③ 预期答案标注(可跳过,与数据集互通)→ ④ 评估器选择(按 case 元数据硬门控)
    3. 单组实验详情 —— 整体表现 + 评估器分解 + Case 明细表
    4. Trace 评测详情 —— 结果/轨迹两类目,统一评估器卡片(卡面 → 评分点表 → 证据折叠)

核心设计结论

  • 实验 = 同一批任务 × 一个变量 × 多组 trace 对比;单组模式退化兼容原「评测执行」。
  • 数据集从前置门槛改为可跳过的标注步:③ 步预填实际输出,可存为数据集副产品;也可从已有数据集按输入匹配回填参考答案。
  • 评估器硬门控:④ 步按所选 case 的元数据(是否已标注参考答案)判定可选性,不满足即置灰,无「部分覆盖」态。
  • 评估器输出契约{score?, points?, evidence?} 全可选;有分计入均分、无分不计入,不设「不适用」状态。

相关文档