| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 17 天前 | ||
| 17 天前 | ||
| 3 天前 |
评测实验化 · 设计资料
「评测执行」升级为「实验」的设计与交互定稿资料。
文件
- eval-experiment-hifi.html —— 交互高保真原型(自包含单文件,浏览器直接打开)。经三轮团队评审迭代定稿,含四个页面:
- 实验列表 —— 状态/类型/Case 数/评估器数,分页
- 四步向导 —— ① 待评测 Agent → ② 关联 Trace(含监听模式)→ ③ 预期答案标注(可跳过,与数据集互通)→ ④ 评估器选择(按 case 元数据硬门控)
- 单组实验详情 —— 整体表现 + 评估器分解 + Case 明细表
- Trace 评测详情 —— 结果/轨迹两类目,统一评估器卡片(卡面 → 评分点表 → 证据折叠)
核心设计结论
- 实验 = 同一批任务 × 一个变量 × 多组 trace 对比;单组模式退化兼容原「评测执行」。
- 数据集从前置门槛改为可跳过的标注步:③ 步预填实际输出,可存为数据集副产品;也可从已有数据集按输入匹配回填参考答案。
- 评估器硬门控:④ 步按所选 case 的元数据(是否已标注参考答案)判定可选性,不满足即置灰,无「部分覆盖」态。
- 评估器输出契约:
{score?, points?, evidence?}全可选;有分计入均分、无分不计入,不设「不适用」状态。
相关文档
- 评估器怎么开发(打分方法论 + 工程接入):../../developer-guide/10-evaluator-development.md
- 上游跟踪 issue:openeuler/agent-insight#243(评测流程实验化重构)、#244(评估器体系重构)