| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
docs: 保留完整内容,重写中文实验 README 的教学流程 (#1145) * docs: teach from full experiment READMEs while preserving details * docs: keep existing anchors beside their teaching sections --------- Co-authored-by: Bojie Li <i@01.me> | 11 天前 | |
docs: 保留完整内容,重写中文实验 README 的教学流程 (#1145) * docs: teach from full experiment READMEs while preserving details * docs: keep existing anchors beside their teaching sections --------- Co-authored-by: Bojie Li <i@01.me> | 11 天前 | |
docs: 保留完整内容,重写中文实验 README 的教学流程 (#1145) * docs: teach from full experiment READMEs while preserving details * docs: keep existing anchors beside their teaching sections --------- Co-authored-by: Bojie Li <i@01.me> | 11 天前 | |
docs: 保留完整内容,重写中文实验 README 的教学流程 (#1145) * docs: teach from full experiment READMEs while preserving details * docs: keep existing anchors beside their teaching sections --------- Co-authored-by: Bojie Li <i@01.me> | 11 天前 | |
docs: 保留完整内容,重写中文实验 README 的教学流程 (#1145) * docs: teach from full experiment READMEs while preserving details * docs: keep existing anchors beside their teaching sections --------- Co-authored-by: Bojie Li <i@01.me> | 11 天前 | |
docs: 保留完整内容,重写中文实验 README 的教学流程 (#1145) * docs: teach from full experiment READMEs while preserving details * docs: keep existing anchors beside their teaching sections --------- Co-authored-by: Bojie Li <i@01.me> | 11 天前 | |
docs: 保留完整内容,重写中文实验 README 的教学流程 (#1145) * docs: teach from full experiment READMEs while preserving details * docs: keep existing anchors beside their teaching sections --------- Co-authored-by: Bojie Li <i@01.me> | 11 天前 | |
docs: 保留完整内容,重写中文实验 README 的教学流程 (#1145) * docs: teach from full experiment READMEs while preserving details * docs: keep existing anchors beside their teaching sections --------- Co-authored-by: Bojie Li <i@01.me> | 11 天前 | |
docs: 保留完整内容,重写中文实验 README 的教学流程 (#1145) * docs: teach from full experiment READMEs while preserving details * docs: keep existing anchors beside their teaching sections --------- Co-authored-by: Bojie Li <i@01.me> | 11 天前 | |
docs: 保留完整内容,重写中文实验 README 的教学流程 (#1145) * docs: teach from full experiment READMEs while preserving details * docs: keep existing anchors beside their teaching sections --------- Co-authored-by: Bojie Li <i@01.me> | 11 天前 | |
docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 (#1028) * exp(ch9): 用 τ²-bench 失败轨迹提炼转人工与工具使用规则,替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实测结果无法支撑正文主张:跨轨迹知识文档 的迁移成功率 25%,低于单轨迹摘要与不使用经验的 50%,负迁移率 25%;生成的 经验文档仅 1094 字节,「推荐策略」只有一条常识,「例外条件」为空。本实验 换用第七章已经解剖过的 τ²-bench telecom 环境重做。 设计: - 提炼集 telecom_small(20 条)与迁移集 telecom(114 条)在上游仓库中互不 相交,划分非事后选取 - 被测 Agent 用弱模型 doubao-seed-1-6-flash-250615(提炼集基线 1/20), 用户模拟器 doubao-seed-1-6-250615 三臂固定 - 规则由模型从 19 条失败轨迹提炼,非人工撰写;保存完整请求与回复回执 - 三臂只换 main_policy.md,每臂记录 sha256,运行后恢复原文件 迁移集 114 条结果: | 臂 | 通过率 | 转人工率 | 误调用户侧工具 | 空参调用 | 工具报错 | |---|---|---|---|---|---| | A 原始策略 | 12.3% | 91.2% | 1056 | 904 | 1392 | | B +v1 规则 | 17.5% | 100.0% | 221 | 256 | 303 | | C +v2 规则 | 19.3% | 97.4% | 293 | 174 | 254 | 配对比较(McNemar 精确检验,零回归):A→B 修好 6 条 p=0.031;A→C 修好 8 条 p=0.008;B→C 修好 2 条 p=0.50(不显著)。 v1 与 v2 的唯一差别是提炼时是否提供 Agent 与用户各自的工具清单。只看报错 文本时,提炼器学到的是「不要重试」;看到工具清单后,它学到「设备侧工具属于 用户,应引导用户执行」。 已知局限(写入 evidence.json):单次运行未做多种子重复;改进集中在 service_issue 一族(14/29 → 21/29),mms_issue 三臂均为 0/49;样本量仅 百余条,只够判断是否值得扩大测试。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实现有问题:生成的经验文档只有一条常识性 "推荐策略"、例外条件为空,迁移对照因此得出知识文档组 25%、两个对照组各 50% 的负结果。GAIA 上的经验学习本身是有效做法,该结果反映的是实验实现缺陷,不 是方法失效,故整体替换。 新的实验 9-2 复用第七章已经解剖过的 τ²-bench telecom 环境: - 提炼集与迁移集在上游仓库中互不相交,提炼过程未见过迁移集任务 - 由模型(非人工)从 19 条失败轨迹归纳规则,追加到原始政策末尾 - 迁移集 114 条上通过率 12.3% → 19.3%,零回归 正文只在原则层面陈述做法与结果,并保留三点发现:提炼器学到什么取决于给它 看什么;模型总结的第一版规则可能把错误固化;被修好的往往是"该问用户却把 话说给了工具"这类朴素问题。 例子一改用 telecom,与第七章现在的解剖对象一致;航空客服作为同一做法的另 一个领域保留,实验 9-3 及其后编号不变。13 个译本的章节 README 同步更新。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 删除 GAIA 实验目录,修正调用方判定 bug,重写例子一文风 三处改动: 一、删除 chapter9/gaia-experience(含 vendored 的 AWorld,919 个文件、46 MB)。 该实验的实现有缺陷,产出的经验文档只有一条常识性策略、例外条件为空,据此 得到的负结果不能代表 GAIA 经验学习本身;正文与 13 个译本 README 已不再引用。 二、修正统计脚本的调用方判定。原先用 requestor 字段区分工具调用是 Agent 还是用户发出的,但 τ²-bench 的消息里该字段恒为 None,导致用户在自己设备上 的合法调用被计成 Agent 越界。改用 role 判定后: | 臂 | 误调用户侧工具(修正前 → 后) | |---|---| | A 原始策略 | 1056 → 1049 | | B +v1 规则 | 221 → 205 | | C +v2 规则 | 293 → 163 | C 臂受影响最大,因为它成功委派给用户的次数最多。修正后 v2 在该指标上明显 优于 v1,与它学到了工具归属这一点一致。通过率与配对结论不受影响。 analyze.py 的工具清单改为与 build_evidence.py 共用 tool_inventory.txt, 避免两份硬编码分叉;顺带删除一段死代码。 三、重写例子一,去掉翻译腔与列举式脚手架(“关于……只有两句话”“比这个数字 更值得记住的是三点”“第一/第二/第三”),改为从具体现象起笔的写法;引号统一 为全书通用的中文双引号。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 例子一改用书面语体例 上一版为消除翻译腔而过度口语化(规矩、没辙、了事、丢给、搞清楚、任务过了 等)。本次按第七章确立的体例改回书面语:小标题用名词短语,正文用完整书面 句式,同时不恢复被删除的翻译腔与列举式脚手架。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX --------- Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com> | 1 个月前 | |
docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 (#1028) * exp(ch9): 用 τ²-bench 失败轨迹提炼转人工与工具使用规则,替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实测结果无法支撑正文主张:跨轨迹知识文档 的迁移成功率 25%,低于单轨迹摘要与不使用经验的 50%,负迁移率 25%;生成的 经验文档仅 1094 字节,「推荐策略」只有一条常识,「例外条件」为空。本实验 换用第七章已经解剖过的 τ²-bench telecom 环境重做。 设计: - 提炼集 telecom_small(20 条)与迁移集 telecom(114 条)在上游仓库中互不 相交,划分非事后选取 - 被测 Agent 用弱模型 doubao-seed-1-6-flash-250615(提炼集基线 1/20), 用户模拟器 doubao-seed-1-6-250615 三臂固定 - 规则由模型从 19 条失败轨迹提炼,非人工撰写;保存完整请求与回复回执 - 三臂只换 main_policy.md,每臂记录 sha256,运行后恢复原文件 迁移集 114 条结果: | 臂 | 通过率 | 转人工率 | 误调用户侧工具 | 空参调用 | 工具报错 | |---|---|---|---|---|---| | A 原始策略 | 12.3% | 91.2% | 1056 | 904 | 1392 | | B +v1 规则 | 17.5% | 100.0% | 221 | 256 | 303 | | C +v2 规则 | 19.3% | 97.4% | 293 | 174 | 254 | 配对比较(McNemar 精确检验,零回归):A→B 修好 6 条 p=0.031;A→C 修好 8 条 p=0.008;B→C 修好 2 条 p=0.50(不显著)。 v1 与 v2 的唯一差别是提炼时是否提供 Agent 与用户各自的工具清单。只看报错 文本时,提炼器学到的是「不要重试」;看到工具清单后,它学到「设备侧工具属于 用户,应引导用户执行」。 已知局限(写入 evidence.json):单次运行未做多种子重复;改进集中在 service_issue 一族(14/29 → 21/29),mms_issue 三臂均为 0/49;样本量仅 百余条,只够判断是否值得扩大测试。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实现有问题:生成的经验文档只有一条常识性 "推荐策略"、例外条件为空,迁移对照因此得出知识文档组 25%、两个对照组各 50% 的负结果。GAIA 上的经验学习本身是有效做法,该结果反映的是实验实现缺陷,不 是方法失效,故整体替换。 新的实验 9-2 复用第七章已经解剖过的 τ²-bench telecom 环境: - 提炼集与迁移集在上游仓库中互不相交,提炼过程未见过迁移集任务 - 由模型(非人工)从 19 条失败轨迹归纳规则,追加到原始政策末尾 - 迁移集 114 条上通过率 12.3% → 19.3%,零回归 正文只在原则层面陈述做法与结果,并保留三点发现:提炼器学到什么取决于给它 看什么;模型总结的第一版规则可能把错误固化;被修好的往往是"该问用户却把 话说给了工具"这类朴素问题。 例子一改用 telecom,与第七章现在的解剖对象一致;航空客服作为同一做法的另 一个领域保留,实验 9-3 及其后编号不变。13 个译本的章节 README 同步更新。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 删除 GAIA 实验目录,修正调用方判定 bug,重写例子一文风 三处改动: 一、删除 chapter9/gaia-experience(含 vendored 的 AWorld,919 个文件、46 MB)。 该实验的实现有缺陷,产出的经验文档只有一条常识性策略、例外条件为空,据此 得到的负结果不能代表 GAIA 经验学习本身;正文与 13 个译本 README 已不再引用。 二、修正统计脚本的调用方判定。原先用 requestor 字段区分工具调用是 Agent 还是用户发出的,但 τ²-bench 的消息里该字段恒为 None,导致用户在自己设备上 的合法调用被计成 Agent 越界。改用 role 判定后: | 臂 | 误调用户侧工具(修正前 → 后) | |---|---| | A 原始策略 | 1056 → 1049 | | B +v1 规则 | 221 → 205 | | C +v2 规则 | 293 → 163 | C 臂受影响最大,因为它成功委派给用户的次数最多。修正后 v2 在该指标上明显 优于 v1,与它学到了工具归属这一点一致。通过率与配对结论不受影响。 analyze.py 的工具清单改为与 build_evidence.py 共用 tool_inventory.txt, 避免两份硬编码分叉;顺带删除一段死代码。 三、重写例子一,去掉翻译腔与列举式脚手架(“关于……只有两句话”“比这个数字 更值得记住的是三点”“第一/第二/第三”),改为从具体现象起笔的写法;引号统一 为全书通用的中文双引号。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 例子一改用书面语体例 上一版为消除翻译腔而过度口语化(规矩、没辙、了事、丢给、搞清楚、任务过了 等)。本次按第七章确立的体例改回书面语:小标题用名词短语,正文用完整书面 句式,同时不恢复被删除的翻译腔与列举式脚手架。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX --------- Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com> | 1 个月前 | |
docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 (#1028) * exp(ch9): 用 τ²-bench 失败轨迹提炼转人工与工具使用规则,替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实测结果无法支撑正文主张:跨轨迹知识文档 的迁移成功率 25%,低于单轨迹摘要与不使用经验的 50%,负迁移率 25%;生成的 经验文档仅 1094 字节,「推荐策略」只有一条常识,「例外条件」为空。本实验 换用第七章已经解剖过的 τ²-bench telecom 环境重做。 设计: - 提炼集 telecom_small(20 条)与迁移集 telecom(114 条)在上游仓库中互不 相交,划分非事后选取 - 被测 Agent 用弱模型 doubao-seed-1-6-flash-250615(提炼集基线 1/20), 用户模拟器 doubao-seed-1-6-250615 三臂固定 - 规则由模型从 19 条失败轨迹提炼,非人工撰写;保存完整请求与回复回执 - 三臂只换 main_policy.md,每臂记录 sha256,运行后恢复原文件 迁移集 114 条结果: | 臂 | 通过率 | 转人工率 | 误调用户侧工具 | 空参调用 | 工具报错 | |---|---|---|---|---|---| | A 原始策略 | 12.3% | 91.2% | 1056 | 904 | 1392 | | B +v1 规则 | 17.5% | 100.0% | 221 | 256 | 303 | | C +v2 规则 | 19.3% | 97.4% | 293 | 174 | 254 | 配对比较(McNemar 精确检验,零回归):A→B 修好 6 条 p=0.031;A→C 修好 8 条 p=0.008;B→C 修好 2 条 p=0.50(不显著)。 v1 与 v2 的唯一差别是提炼时是否提供 Agent 与用户各自的工具清单。只看报错 文本时,提炼器学到的是「不要重试」;看到工具清单后,它学到「设备侧工具属于 用户,应引导用户执行」。 已知局限(写入 evidence.json):单次运行未做多种子重复;改进集中在 service_issue 一族(14/29 → 21/29),mms_issue 三臂均为 0/49;样本量仅 百余条,只够判断是否值得扩大测试。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实现有问题:生成的经验文档只有一条常识性 "推荐策略"、例外条件为空,迁移对照因此得出知识文档组 25%、两个对照组各 50% 的负结果。GAIA 上的经验学习本身是有效做法,该结果反映的是实验实现缺陷,不 是方法失效,故整体替换。 新的实验 9-2 复用第七章已经解剖过的 τ²-bench telecom 环境: - 提炼集与迁移集在上游仓库中互不相交,提炼过程未见过迁移集任务 - 由模型(非人工)从 19 条失败轨迹归纳规则,追加到原始政策末尾 - 迁移集 114 条上通过率 12.3% → 19.3%,零回归 正文只在原则层面陈述做法与结果,并保留三点发现:提炼器学到什么取决于给它 看什么;模型总结的第一版规则可能把错误固化;被修好的往往是"该问用户却把 话说给了工具"这类朴素问题。 例子一改用 telecom,与第七章现在的解剖对象一致;航空客服作为同一做法的另 一个领域保留,实验 9-3 及其后编号不变。13 个译本的章节 README 同步更新。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 删除 GAIA 实验目录,修正调用方判定 bug,重写例子一文风 三处改动: 一、删除 chapter9/gaia-experience(含 vendored 的 AWorld,919 个文件、46 MB)。 该实验的实现有缺陷,产出的经验文档只有一条常识性策略、例外条件为空,据此 得到的负结果不能代表 GAIA 经验学习本身;正文与 13 个译本 README 已不再引用。 二、修正统计脚本的调用方判定。原先用 requestor 字段区分工具调用是 Agent 还是用户发出的,但 τ²-bench 的消息里该字段恒为 None,导致用户在自己设备上 的合法调用被计成 Agent 越界。改用 role 判定后: | 臂 | 误调用户侧工具(修正前 → 后) | |---|---| | A 原始策略 | 1056 → 1049 | | B +v1 规则 | 221 → 205 | | C +v2 规则 | 293 → 163 | C 臂受影响最大,因为它成功委派给用户的次数最多。修正后 v2 在该指标上明显 优于 v1,与它学到了工具归属这一点一致。通过率与配对结论不受影响。 analyze.py 的工具清单改为与 build_evidence.py 共用 tool_inventory.txt, 避免两份硬编码分叉;顺带删除一段死代码。 三、重写例子一,去掉翻译腔与列举式脚手架(“关于……只有两句话”“比这个数字 更值得记住的是三点”“第一/第二/第三”),改为从具体现象起笔的写法;引号统一 为全书通用的中文双引号。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 例子一改用书面语体例 上一版为消除翻译腔而过度口语化(规矩、没辙、了事、丢给、搞清楚、任务过了 等)。本次按第七章确立的体例改回书面语:小标题用名词短语,正文用完整书面 句式,同时不恢复被删除的翻译腔与列举式脚手架。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX --------- Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com> | 1 个月前 | |
docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 (#1028) * exp(ch9): 用 τ²-bench 失败轨迹提炼转人工与工具使用规则,替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实测结果无法支撑正文主张:跨轨迹知识文档 的迁移成功率 25%,低于单轨迹摘要与不使用经验的 50%,负迁移率 25%;生成的 经验文档仅 1094 字节,「推荐策略」只有一条常识,「例外条件」为空。本实验 换用第七章已经解剖过的 τ²-bench telecom 环境重做。 设计: - 提炼集 telecom_small(20 条)与迁移集 telecom(114 条)在上游仓库中互不 相交,划分非事后选取 - 被测 Agent 用弱模型 doubao-seed-1-6-flash-250615(提炼集基线 1/20), 用户模拟器 doubao-seed-1-6-250615 三臂固定 - 规则由模型从 19 条失败轨迹提炼,非人工撰写;保存完整请求与回复回执 - 三臂只换 main_policy.md,每臂记录 sha256,运行后恢复原文件 迁移集 114 条结果: | 臂 | 通过率 | 转人工率 | 误调用户侧工具 | 空参调用 | 工具报错 | |---|---|---|---|---|---| | A 原始策略 | 12.3% | 91.2% | 1056 | 904 | 1392 | | B +v1 规则 | 17.5% | 100.0% | 221 | 256 | 303 | | C +v2 规则 | 19.3% | 97.4% | 293 | 174 | 254 | 配对比较(McNemar 精确检验,零回归):A→B 修好 6 条 p=0.031;A→C 修好 8 条 p=0.008;B→C 修好 2 条 p=0.50(不显著)。 v1 与 v2 的唯一差别是提炼时是否提供 Agent 与用户各自的工具清单。只看报错 文本时,提炼器学到的是「不要重试」;看到工具清单后,它学到「设备侧工具属于 用户,应引导用户执行」。 已知局限(写入 evidence.json):单次运行未做多种子重复;改进集中在 service_issue 一族(14/29 → 21/29),mms_issue 三臂均为 0/49;样本量仅 百余条,只够判断是否值得扩大测试。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实现有问题:生成的经验文档只有一条常识性 "推荐策略"、例外条件为空,迁移对照因此得出知识文档组 25%、两个对照组各 50% 的负结果。GAIA 上的经验学习本身是有效做法,该结果反映的是实验实现缺陷,不 是方法失效,故整体替换。 新的实验 9-2 复用第七章已经解剖过的 τ²-bench telecom 环境: - 提炼集与迁移集在上游仓库中互不相交,提炼过程未见过迁移集任务 - 由模型(非人工)从 19 条失败轨迹归纳规则,追加到原始政策末尾 - 迁移集 114 条上通过率 12.3% → 19.3%,零回归 正文只在原则层面陈述做法与结果,并保留三点发现:提炼器学到什么取决于给它 看什么;模型总结的第一版规则可能把错误固化;被修好的往往是"该问用户却把 话说给了工具"这类朴素问题。 例子一改用 telecom,与第七章现在的解剖对象一致;航空客服作为同一做法的另 一个领域保留,实验 9-3 及其后编号不变。13 个译本的章节 README 同步更新。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 删除 GAIA 实验目录,修正调用方判定 bug,重写例子一文风 三处改动: 一、删除 chapter9/gaia-experience(含 vendored 的 AWorld,919 个文件、46 MB)。 该实验的实现有缺陷,产出的经验文档只有一条常识性策略、例外条件为空,据此 得到的负结果不能代表 GAIA 经验学习本身;正文与 13 个译本 README 已不再引用。 二、修正统计脚本的调用方判定。原先用 requestor 字段区分工具调用是 Agent 还是用户发出的,但 τ²-bench 的消息里该字段恒为 None,导致用户在自己设备上 的合法调用被计成 Agent 越界。改用 role 判定后: | 臂 | 误调用户侧工具(修正前 → 后) | |---|---| | A 原始策略 | 1056 → 1049 | | B +v1 规则 | 221 → 205 | | C +v2 规则 | 293 → 163 | C 臂受影响最大,因为它成功委派给用户的次数最多。修正后 v2 在该指标上明显 优于 v1,与它学到了工具归属这一点一致。通过率与配对结论不受影响。 analyze.py 的工具清单改为与 build_evidence.py 共用 tool_inventory.txt, 避免两份硬编码分叉;顺带删除一段死代码。 三、重写例子一,去掉翻译腔与列举式脚手架(“关于……只有两句话”“比这个数字 更值得记住的是三点”“第一/第二/第三”),改为从具体现象起笔的写法;引号统一 为全书通用的中文双引号。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 例子一改用书面语体例 上一版为消除翻译腔而过度口语化(规矩、没辙、了事、丢给、搞清楚、任务过了 等)。本次按第七章确立的体例改回书面语:小标题用名词短语,正文用完整书面 句式,同时不恢复被删除的翻译腔与列举式脚手架。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX --------- Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com> | 1 个月前 | |
docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 (#1028) * exp(ch9): 用 τ²-bench 失败轨迹提炼转人工与工具使用规则,替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实测结果无法支撑正文主张:跨轨迹知识文档 的迁移成功率 25%,低于单轨迹摘要与不使用经验的 50%,负迁移率 25%;生成的 经验文档仅 1094 字节,「推荐策略」只有一条常识,「例外条件」为空。本实验 换用第七章已经解剖过的 τ²-bench telecom 环境重做。 设计: - 提炼集 telecom_small(20 条)与迁移集 telecom(114 条)在上游仓库中互不 相交,划分非事后选取 - 被测 Agent 用弱模型 doubao-seed-1-6-flash-250615(提炼集基线 1/20), 用户模拟器 doubao-seed-1-6-250615 三臂固定 - 规则由模型从 19 条失败轨迹提炼,非人工撰写;保存完整请求与回复回执 - 三臂只换 main_policy.md,每臂记录 sha256,运行后恢复原文件 迁移集 114 条结果: | 臂 | 通过率 | 转人工率 | 误调用户侧工具 | 空参调用 | 工具报错 | |---|---|---|---|---|---| | A 原始策略 | 12.3% | 91.2% | 1056 | 904 | 1392 | | B +v1 规则 | 17.5% | 100.0% | 221 | 256 | 303 | | C +v2 规则 | 19.3% | 97.4% | 293 | 174 | 254 | 配对比较(McNemar 精确检验,零回归):A→B 修好 6 条 p=0.031;A→C 修好 8 条 p=0.008;B→C 修好 2 条 p=0.50(不显著)。 v1 与 v2 的唯一差别是提炼时是否提供 Agent 与用户各自的工具清单。只看报错 文本时,提炼器学到的是「不要重试」;看到工具清单后,它学到「设备侧工具属于 用户,应引导用户执行」。 已知局限(写入 evidence.json):单次运行未做多种子重复;改进集中在 service_issue 一族(14/29 → 21/29),mms_issue 三臂均为 0/49;样本量仅 百余条,只够判断是否值得扩大测试。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实现有问题:生成的经验文档只有一条常识性 "推荐策略"、例外条件为空,迁移对照因此得出知识文档组 25%、两个对照组各 50% 的负结果。GAIA 上的经验学习本身是有效做法,该结果反映的是实验实现缺陷,不 是方法失效,故整体替换。 新的实验 9-2 复用第七章已经解剖过的 τ²-bench telecom 环境: - 提炼集与迁移集在上游仓库中互不相交,提炼过程未见过迁移集任务 - 由模型(非人工)从 19 条失败轨迹归纳规则,追加到原始政策末尾 - 迁移集 114 条上通过率 12.3% → 19.3%,零回归 正文只在原则层面陈述做法与结果,并保留三点发现:提炼器学到什么取决于给它 看什么;模型总结的第一版规则可能把错误固化;被修好的往往是"该问用户却把 话说给了工具"这类朴素问题。 例子一改用 telecom,与第七章现在的解剖对象一致;航空客服作为同一做法的另 一个领域保留,实验 9-3 及其后编号不变。13 个译本的章节 README 同步更新。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 删除 GAIA 实验目录,修正调用方判定 bug,重写例子一文风 三处改动: 一、删除 chapter9/gaia-experience(含 vendored 的 AWorld,919 个文件、46 MB)。 该实验的实现有缺陷,产出的经验文档只有一条常识性策略、例外条件为空,据此 得到的负结果不能代表 GAIA 经验学习本身;正文与 13 个译本 README 已不再引用。 二、修正统计脚本的调用方判定。原先用 requestor 字段区分工具调用是 Agent 还是用户发出的,但 τ²-bench 的消息里该字段恒为 None,导致用户在自己设备上 的合法调用被计成 Agent 越界。改用 role 判定后: | 臂 | 误调用户侧工具(修正前 → 后) | |---|---| | A 原始策略 | 1056 → 1049 | | B +v1 规则 | 221 → 205 | | C +v2 规则 | 293 → 163 | C 臂受影响最大,因为它成功委派给用户的次数最多。修正后 v2 在该指标上明显 优于 v1,与它学到了工具归属这一点一致。通过率与配对结论不受影响。 analyze.py 的工具清单改为与 build_evidence.py 共用 tool_inventory.txt, 避免两份硬编码分叉;顺带删除一段死代码。 三、重写例子一,去掉翻译腔与列举式脚手架(“关于……只有两句话”“比这个数字 更值得记住的是三点”“第一/第二/第三”),改为从具体现象起笔的写法;引号统一 为全书通用的中文双引号。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 例子一改用书面语体例 上一版为消除翻译腔而过度口语化(规矩、没辙、了事、丢给、搞清楚、任务过了 等)。本次按第七章确立的体例改回书面语:小标题用名词短语,正文用完整书面 句式,同时不恢复被删除的翻译腔与列举式脚手架。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX --------- Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com> | 1 个月前 | |
docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 (#1028) * exp(ch9): 用 τ²-bench 失败轨迹提炼转人工与工具使用规则,替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实测结果无法支撑正文主张:跨轨迹知识文档 的迁移成功率 25%,低于单轨迹摘要与不使用经验的 50%,负迁移率 25%;生成的 经验文档仅 1094 字节,「推荐策略」只有一条常识,「例外条件」为空。本实验 换用第七章已经解剖过的 τ²-bench telecom 环境重做。 设计: - 提炼集 telecom_small(20 条)与迁移集 telecom(114 条)在上游仓库中互不 相交,划分非事后选取 - 被测 Agent 用弱模型 doubao-seed-1-6-flash-250615(提炼集基线 1/20), 用户模拟器 doubao-seed-1-6-250615 三臂固定 - 规则由模型从 19 条失败轨迹提炼,非人工撰写;保存完整请求与回复回执 - 三臂只换 main_policy.md,每臂记录 sha256,运行后恢复原文件 迁移集 114 条结果: | 臂 | 通过率 | 转人工率 | 误调用户侧工具 | 空参调用 | 工具报错 | |---|---|---|---|---|---| | A 原始策略 | 12.3% | 91.2% | 1056 | 904 | 1392 | | B +v1 规则 | 17.5% | 100.0% | 221 | 256 | 303 | | C +v2 规则 | 19.3% | 97.4% | 293 | 174 | 254 | 配对比较(McNemar 精确检验,零回归):A→B 修好 6 条 p=0.031;A→C 修好 8 条 p=0.008;B→C 修好 2 条 p=0.50(不显著)。 v1 与 v2 的唯一差别是提炼时是否提供 Agent 与用户各自的工具清单。只看报错 文本时,提炼器学到的是「不要重试」;看到工具清单后,它学到「设备侧工具属于 用户,应引导用户执行」。 已知局限(写入 evidence.json):单次运行未做多种子重复;改进集中在 service_issue 一族(14/29 → 21/29),mms_issue 三臂均为 0/49;样本量仅 百余条,只够判断是否值得扩大测试。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实现有问题:生成的经验文档只有一条常识性 "推荐策略"、例外条件为空,迁移对照因此得出知识文档组 25%、两个对照组各 50% 的负结果。GAIA 上的经验学习本身是有效做法,该结果反映的是实验实现缺陷,不 是方法失效,故整体替换。 新的实验 9-2 复用第七章已经解剖过的 τ²-bench telecom 环境: - 提炼集与迁移集在上游仓库中互不相交,提炼过程未见过迁移集任务 - 由模型(非人工)从 19 条失败轨迹归纳规则,追加到原始政策末尾 - 迁移集 114 条上通过率 12.3% → 19.3%,零回归 正文只在原则层面陈述做法与结果,并保留三点发现:提炼器学到什么取决于给它 看什么;模型总结的第一版规则可能把错误固化;被修好的往往是"该问用户却把 话说给了工具"这类朴素问题。 例子一改用 telecom,与第七章现在的解剖对象一致;航空客服作为同一做法的另 一个领域保留,实验 9-3 及其后编号不变。13 个译本的章节 README 同步更新。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 删除 GAIA 实验目录,修正调用方判定 bug,重写例子一文风 三处改动: 一、删除 chapter9/gaia-experience(含 vendored 的 AWorld,919 个文件、46 MB)。 该实验的实现有缺陷,产出的经验文档只有一条常识性策略、例外条件为空,据此 得到的负结果不能代表 GAIA 经验学习本身;正文与 13 个译本 README 已不再引用。 二、修正统计脚本的调用方判定。原先用 requestor 字段区分工具调用是 Agent 还是用户发出的,但 τ²-bench 的消息里该字段恒为 None,导致用户在自己设备上 的合法调用被计成 Agent 越界。改用 role 判定后: | 臂 | 误调用户侧工具(修正前 → 后) | |---|---| | A 原始策略 | 1056 → 1049 | | B +v1 规则 | 221 → 205 | | C +v2 规则 | 293 → 163 | C 臂受影响最大,因为它成功委派给用户的次数最多。修正后 v2 在该指标上明显 优于 v1,与它学到了工具归属这一点一致。通过率与配对结论不受影响。 analyze.py 的工具清单改为与 build_evidence.py 共用 tool_inventory.txt, 避免两份硬编码分叉;顺带删除一段死代码。 三、重写例子一,去掉翻译腔与列举式脚手架(“关于……只有两句话”“比这个数字 更值得记住的是三点”“第一/第二/第三”),改为从具体现象起笔的写法;引号统一 为全书通用的中文双引号。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 例子一改用书面语体例 上一版为消除翻译腔而过度口语化(规矩、没辙、了事、丢给、搞清楚、任务过了 等)。本次按第七章确立的体例改回书面语:小标题用名词短语,正文用完整书面 句式,同时不恢复被删除的翻译腔与列举式脚手架。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX --------- Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com> | 1 个月前 | |
docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 (#1028) * exp(ch9): 用 τ²-bench 失败轨迹提炼转人工与工具使用规则,替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实测结果无法支撑正文主张:跨轨迹知识文档 的迁移成功率 25%,低于单轨迹摘要与不使用经验的 50%,负迁移率 25%;生成的 经验文档仅 1094 字节,「推荐策略」只有一条常识,「例外条件」为空。本实验 换用第七章已经解剖过的 τ²-bench telecom 环境重做。 设计: - 提炼集 telecom_small(20 条)与迁移集 telecom(114 条)在上游仓库中互不 相交,划分非事后选取 - 被测 Agent 用弱模型 doubao-seed-1-6-flash-250615(提炼集基线 1/20), 用户模拟器 doubao-seed-1-6-250615 三臂固定 - 规则由模型从 19 条失败轨迹提炼,非人工撰写;保存完整请求与回复回执 - 三臂只换 main_policy.md,每臂记录 sha256,运行后恢复原文件 迁移集 114 条结果: | 臂 | 通过率 | 转人工率 | 误调用户侧工具 | 空参调用 | 工具报错 | |---|---|---|---|---|---| | A 原始策略 | 12.3% | 91.2% | 1056 | 904 | 1392 | | B +v1 规则 | 17.5% | 100.0% | 221 | 256 | 303 | | C +v2 规则 | 19.3% | 97.4% | 293 | 174 | 254 | 配对比较(McNemar 精确检验,零回归):A→B 修好 6 条 p=0.031;A→C 修好 8 条 p=0.008;B→C 修好 2 条 p=0.50(不显著)。 v1 与 v2 的唯一差别是提炼时是否提供 Agent 与用户各自的工具清单。只看报错 文本时,提炼器学到的是「不要重试」;看到工具清单后,它学到「设备侧工具属于 用户,应引导用户执行」。 已知局限(写入 evidence.json):单次运行未做多种子重复;改进集中在 service_issue 一族(14/29 → 21/29),mms_issue 三臂均为 0/49;样本量仅 百余条,只够判断是否值得扩大测试。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实现有问题:生成的经验文档只有一条常识性 "推荐策略"、例外条件为空,迁移对照因此得出知识文档组 25%、两个对照组各 50% 的负结果。GAIA 上的经验学习本身是有效做法,该结果反映的是实验实现缺陷,不 是方法失效,故整体替换。 新的实验 9-2 复用第七章已经解剖过的 τ²-bench telecom 环境: - 提炼集与迁移集在上游仓库中互不相交,提炼过程未见过迁移集任务 - 由模型(非人工)从 19 条失败轨迹归纳规则,追加到原始政策末尾 - 迁移集 114 条上通过率 12.3% → 19.3%,零回归 正文只在原则层面陈述做法与结果,并保留三点发现:提炼器学到什么取决于给它 看什么;模型总结的第一版规则可能把错误固化;被修好的往往是"该问用户却把 话说给了工具"这类朴素问题。 例子一改用 telecom,与第七章现在的解剖对象一致;航空客服作为同一做法的另 一个领域保留,实验 9-3 及其后编号不变。13 个译本的章节 README 同步更新。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 删除 GAIA 实验目录,修正调用方判定 bug,重写例子一文风 三处改动: 一、删除 chapter9/gaia-experience(含 vendored 的 AWorld,919 个文件、46 MB)。 该实验的实现有缺陷,产出的经验文档只有一条常识性策略、例外条件为空,据此 得到的负结果不能代表 GAIA 经验学习本身;正文与 13 个译本 README 已不再引用。 二、修正统计脚本的调用方判定。原先用 requestor 字段区分工具调用是 Agent 还是用户发出的,但 τ²-bench 的消息里该字段恒为 None,导致用户在自己设备上 的合法调用被计成 Agent 越界。改用 role 判定后: | 臂 | 误调用户侧工具(修正前 → 后) | |---|---| | A 原始策略 | 1056 → 1049 | | B +v1 规则 | 221 → 205 | | C +v2 规则 | 293 → 163 | C 臂受影响最大,因为它成功委派给用户的次数最多。修正后 v2 在该指标上明显 优于 v1,与它学到了工具归属这一点一致。通过率与配对结论不受影响。 analyze.py 的工具清单改为与 build_evidence.py 共用 tool_inventory.txt, 避免两份硬编码分叉;顺带删除一段死代码。 三、重写例子一,去掉翻译腔与列举式脚手架(“关于……只有两句话”“比这个数字 更值得记住的是三点”“第一/第二/第三”),改为从具体现象起笔的写法;引号统一 为全书通用的中文双引号。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 例子一改用书面语体例 上一版为消除翻译腔而过度口语化(规矩、没辙、了事、丢给、搞清楚、任务过了 等)。本次按第七章确立的体例改回书面语:小标题用名词短语,正文用完整书面 句式,同时不恢复被删除的翻译腔与列举式脚手架。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX --------- Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com> | 1 个月前 | |
docs: 保留完整内容,重写中文实验 README 的教学流程 (#1145) * docs: teach from full experiment READMEs while preserving details * docs: keep existing anchors beside their teaching sections --------- Co-authored-by: Bojie Li <i@01.me> | 11 天前 | |
docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 (#1028) * exp(ch9): 用 τ²-bench 失败轨迹提炼转人工与工具使用规则,替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实测结果无法支撑正文主张:跨轨迹知识文档 的迁移成功率 25%,低于单轨迹摘要与不使用经验的 50%,负迁移率 25%;生成的 经验文档仅 1094 字节,「推荐策略」只有一条常识,「例外条件」为空。本实验 换用第七章已经解剖过的 τ²-bench telecom 环境重做。 设计: - 提炼集 telecom_small(20 条)与迁移集 telecom(114 条)在上游仓库中互不 相交,划分非事后选取 - 被测 Agent 用弱模型 doubao-seed-1-6-flash-250615(提炼集基线 1/20), 用户模拟器 doubao-seed-1-6-250615 三臂固定 - 规则由模型从 19 条失败轨迹提炼,非人工撰写;保存完整请求与回复回执 - 三臂只换 main_policy.md,每臂记录 sha256,运行后恢复原文件 迁移集 114 条结果: | 臂 | 通过率 | 转人工率 | 误调用户侧工具 | 空参调用 | 工具报错 | |---|---|---|---|---|---| | A 原始策略 | 12.3% | 91.2% | 1056 | 904 | 1392 | | B +v1 规则 | 17.5% | 100.0% | 221 | 256 | 303 | | C +v2 规则 | 19.3% | 97.4% | 293 | 174 | 254 | 配对比较(McNemar 精确检验,零回归):A→B 修好 6 条 p=0.031;A→C 修好 8 条 p=0.008;B→C 修好 2 条 p=0.50(不显著)。 v1 与 v2 的唯一差别是提炼时是否提供 Agent 与用户各自的工具清单。只看报错 文本时,提炼器学到的是「不要重试」;看到工具清单后,它学到「设备侧工具属于 用户,应引导用户执行」。 已知局限(写入 evidence.json):单次运行未做多种子重复;改进集中在 service_issue 一族(14/29 → 21/29),mms_issue 三臂均为 0/49;样本量仅 百余条,只够判断是否值得扩大测试。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实现有问题:生成的经验文档只有一条常识性 "推荐策略"、例外条件为空,迁移对照因此得出知识文档组 25%、两个对照组各 50% 的负结果。GAIA 上的经验学习本身是有效做法,该结果反映的是实验实现缺陷,不 是方法失效,故整体替换。 新的实验 9-2 复用第七章已经解剖过的 τ²-bench telecom 环境: - 提炼集与迁移集在上游仓库中互不相交,提炼过程未见过迁移集任务 - 由模型(非人工)从 19 条失败轨迹归纳规则,追加到原始政策末尾 - 迁移集 114 条上通过率 12.3% → 19.3%,零回归 正文只在原则层面陈述做法与结果,并保留三点发现:提炼器学到什么取决于给它 看什么;模型总结的第一版规则可能把错误固化;被修好的往往是"该问用户却把 话说给了工具"这类朴素问题。 例子一改用 telecom,与第七章现在的解剖对象一致;航空客服作为同一做法的另 一个领域保留,实验 9-3 及其后编号不变。13 个译本的章节 README 同步更新。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 删除 GAIA 实验目录,修正调用方判定 bug,重写例子一文风 三处改动: 一、删除 chapter9/gaia-experience(含 vendored 的 AWorld,919 个文件、46 MB)。 该实验的实现有缺陷,产出的经验文档只有一条常识性策略、例外条件为空,据此 得到的负结果不能代表 GAIA 经验学习本身;正文与 13 个译本 README 已不再引用。 二、修正统计脚本的调用方判定。原先用 requestor 字段区分工具调用是 Agent 还是用户发出的,但 τ²-bench 的消息里该字段恒为 None,导致用户在自己设备上 的合法调用被计成 Agent 越界。改用 role 判定后: | 臂 | 误调用户侧工具(修正前 → 后) | |---|---| | A 原始策略 | 1056 → 1049 | | B +v1 规则 | 221 → 205 | | C +v2 规则 | 293 → 163 | C 臂受影响最大,因为它成功委派给用户的次数最多。修正后 v2 在该指标上明显 优于 v1,与它学到了工具归属这一点一致。通过率与配对结论不受影响。 analyze.py 的工具清单改为与 build_evidence.py 共用 tool_inventory.txt, 避免两份硬编码分叉;顺带删除一段死代码。 三、重写例子一,去掉翻译腔与列举式脚手架(“关于……只有两句话”“比这个数字 更值得记住的是三点”“第一/第二/第三”),改为从具体现象起笔的写法;引号统一 为全书通用的中文双引号。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 例子一改用书面语体例 上一版为消除翻译腔而过度口语化(规矩、没辙、了事、丢给、搞清楚、任务过了 等)。本次按第七章确立的体例改回书面语:小标题用名词短语,正文用完整书面 句式,同时不恢复被删除的翻译腔与列举式脚手架。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX --------- Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com> | 1 个月前 | |
docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 (#1028) * exp(ch9): 用 τ²-bench 失败轨迹提炼转人工与工具使用规则,替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实测结果无法支撑正文主张:跨轨迹知识文档 的迁移成功率 25%,低于单轨迹摘要与不使用经验的 50%,负迁移率 25%;生成的 经验文档仅 1094 字节,「推荐策略」只有一条常识,「例外条件」为空。本实验 换用第七章已经解剖过的 τ²-bench telecom 环境重做。 设计: - 提炼集 telecom_small(20 条)与迁移集 telecom(114 条)在上游仓库中互不 相交,划分非事后选取 - 被测 Agent 用弱模型 doubao-seed-1-6-flash-250615(提炼集基线 1/20), 用户模拟器 doubao-seed-1-6-250615 三臂固定 - 规则由模型从 19 条失败轨迹提炼,非人工撰写;保存完整请求与回复回执 - 三臂只换 main_policy.md,每臂记录 sha256,运行后恢复原文件 迁移集 114 条结果: | 臂 | 通过率 | 转人工率 | 误调用户侧工具 | 空参调用 | 工具报错 | |---|---|---|---|---|---| | A 原始策略 | 12.3% | 91.2% | 1056 | 904 | 1392 | | B +v1 规则 | 17.5% | 100.0% | 221 | 256 | 303 | | C +v2 规则 | 19.3% | 97.4% | 293 | 174 | 254 | 配对比较(McNemar 精确检验,零回归):A→B 修好 6 条 p=0.031;A→C 修好 8 条 p=0.008;B→C 修好 2 条 p=0.50(不显著)。 v1 与 v2 的唯一差别是提炼时是否提供 Agent 与用户各自的工具清单。只看报错 文本时,提炼器学到的是「不要重试」;看到工具清单后,它学到「设备侧工具属于 用户,应引导用户执行」。 已知局限(写入 evidence.json):单次运行未做多种子重复;改进集中在 service_issue 一族(14/29 → 21/29),mms_issue 三臂均为 0/49;样本量仅 百余条,只够判断是否值得扩大测试。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实现有问题:生成的经验文档只有一条常识性 "推荐策略"、例外条件为空,迁移对照因此得出知识文档组 25%、两个对照组各 50% 的负结果。GAIA 上的经验学习本身是有效做法,该结果反映的是实验实现缺陷,不 是方法失效,故整体替换。 新的实验 9-2 复用第七章已经解剖过的 τ²-bench telecom 环境: - 提炼集与迁移集在上游仓库中互不相交,提炼过程未见过迁移集任务 - 由模型(非人工)从 19 条失败轨迹归纳规则,追加到原始政策末尾 - 迁移集 114 条上通过率 12.3% → 19.3%,零回归 正文只在原则层面陈述做法与结果,并保留三点发现:提炼器学到什么取决于给它 看什么;模型总结的第一版规则可能把错误固化;被修好的往往是"该问用户却把 话说给了工具"这类朴素问题。 例子一改用 telecom,与第七章现在的解剖对象一致;航空客服作为同一做法的另 一个领域保留,实验 9-3 及其后编号不变。13 个译本的章节 README 同步更新。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 删除 GAIA 实验目录,修正调用方判定 bug,重写例子一文风 三处改动: 一、删除 chapter9/gaia-experience(含 vendored 的 AWorld,919 个文件、46 MB)。 该实验的实现有缺陷,产出的经验文档只有一条常识性策略、例外条件为空,据此 得到的负结果不能代表 GAIA 经验学习本身;正文与 13 个译本 README 已不再引用。 二、修正统计脚本的调用方判定。原先用 requestor 字段区分工具调用是 Agent 还是用户发出的,但 τ²-bench 的消息里该字段恒为 None,导致用户在自己设备上 的合法调用被计成 Agent 越界。改用 role 判定后: | 臂 | 误调用户侧工具(修正前 → 后) | |---|---| | A 原始策略 | 1056 → 1049 | | B +v1 规则 | 221 → 205 | | C +v2 规则 | 293 → 163 | C 臂受影响最大,因为它成功委派给用户的次数最多。修正后 v2 在该指标上明显 优于 v1,与它学到了工具归属这一点一致。通过率与配对结论不受影响。 analyze.py 的工具清单改为与 build_evidence.py 共用 tool_inventory.txt, 避免两份硬编码分叉;顺带删除一段死代码。 三、重写例子一,去掉翻译腔与列举式脚手架(“关于……只有两句话”“比这个数字 更值得记住的是三点”“第一/第二/第三”),改为从具体现象起笔的写法;引号统一 为全书通用的中文双引号。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 例子一改用书面语体例 上一版为消除翻译腔而过度口语化(规矩、没辙、了事、丢给、搞清楚、任务过了 等)。本次按第七章确立的体例改回书面语:小标题用名词短语,正文用完整书面 句式,同时不恢复被删除的翻译腔与列举式脚手架。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX --------- Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com> | 1 个月前 | |
docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 (#1028) * exp(ch9): 用 τ²-bench 失败轨迹提炼转人工与工具使用规则,替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实测结果无法支撑正文主张:跨轨迹知识文档 的迁移成功率 25%,低于单轨迹摘要与不使用经验的 50%,负迁移率 25%;生成的 经验文档仅 1094 字节,「推荐策略」只有一条常识,「例外条件」为空。本实验 换用第七章已经解剖过的 τ²-bench telecom 环境重做。 设计: - 提炼集 telecom_small(20 条)与迁移集 telecom(114 条)在上游仓库中互不 相交,划分非事后选取 - 被测 Agent 用弱模型 doubao-seed-1-6-flash-250615(提炼集基线 1/20), 用户模拟器 doubao-seed-1-6-250615 三臂固定 - 规则由模型从 19 条失败轨迹提炼,非人工撰写;保存完整请求与回复回执 - 三臂只换 main_policy.md,每臂记录 sha256,运行后恢复原文件 迁移集 114 条结果: | 臂 | 通过率 | 转人工率 | 误调用户侧工具 | 空参调用 | 工具报错 | |---|---|---|---|---|---| | A 原始策略 | 12.3% | 91.2% | 1056 | 904 | 1392 | | B +v1 规则 | 17.5% | 100.0% | 221 | 256 | 303 | | C +v2 规则 | 19.3% | 97.4% | 293 | 174 | 254 | 配对比较(McNemar 精确检验,零回归):A→B 修好 6 条 p=0.031;A→C 修好 8 条 p=0.008;B→C 修好 2 条 p=0.50(不显著)。 v1 与 v2 的唯一差别是提炼时是否提供 Agent 与用户各自的工具清单。只看报错 文本时,提炼器学到的是「不要重试」;看到工具清单后,它学到「设备侧工具属于 用户,应引导用户执行」。 已知局限(写入 evidence.json):单次运行未做多种子重复;改进集中在 service_issue 一族(14/29 → 21/29),mms_issue 三臂均为 0/49;样本量仅 百余条,只够判断是否值得扩大测试。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实现有问题:生成的经验文档只有一条常识性 "推荐策略"、例外条件为空,迁移对照因此得出知识文档组 25%、两个对照组各 50% 的负结果。GAIA 上的经验学习本身是有效做法,该结果反映的是实验实现缺陷,不 是方法失效,故整体替换。 新的实验 9-2 复用第七章已经解剖过的 τ²-bench telecom 环境: - 提炼集与迁移集在上游仓库中互不相交,提炼过程未见过迁移集任务 - 由模型(非人工)从 19 条失败轨迹归纳规则,追加到原始政策末尾 - 迁移集 114 条上通过率 12.3% → 19.3%,零回归 正文只在原则层面陈述做法与结果,并保留三点发现:提炼器学到什么取决于给它 看什么;模型总结的第一版规则可能把错误固化;被修好的往往是"该问用户却把 话说给了工具"这类朴素问题。 例子一改用 telecom,与第七章现在的解剖对象一致;航空客服作为同一做法的另 一个领域保留,实验 9-3 及其后编号不变。13 个译本的章节 README 同步更新。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 删除 GAIA 实验目录,修正调用方判定 bug,重写例子一文风 三处改动: 一、删除 chapter9/gaia-experience(含 vendored 的 AWorld,919 个文件、46 MB)。 该实验的实现有缺陷,产出的经验文档只有一条常识性策略、例外条件为空,据此 得到的负结果不能代表 GAIA 经验学习本身;正文与 13 个译本 README 已不再引用。 二、修正统计脚本的调用方判定。原先用 requestor 字段区分工具调用是 Agent 还是用户发出的,但 τ²-bench 的消息里该字段恒为 None,导致用户在自己设备上 的合法调用被计成 Agent 越界。改用 role 判定后: | 臂 | 误调用户侧工具(修正前 → 后) | |---|---| | A 原始策略 | 1056 → 1049 | | B +v1 规则 | 221 → 205 | | C +v2 规则 | 293 → 163 | C 臂受影响最大,因为它成功委派给用户的次数最多。修正后 v2 在该指标上明显 优于 v1,与它学到了工具归属这一点一致。通过率与配对结论不受影响。 analyze.py 的工具清单改为与 build_evidence.py 共用 tool_inventory.txt, 避免两份硬编码分叉;顺带删除一段死代码。 三、重写例子一,去掉翻译腔与列举式脚手架(“关于……只有两句话”“比这个数字 更值得记住的是三点”“第一/第二/第三”),改为从具体现象起笔的写法;引号统一 为全书通用的中文双引号。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 例子一改用书面语体例 上一版为消除翻译腔而过度口语化(规矩、没辙、了事、丢给、搞清楚、任务过了 等)。本次按第七章确立的体例改回书面语:小标题用名词短语,正文用完整书面 句式,同时不恢复被删除的翻译腔与列举式脚手架。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX --------- Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com> | 1 个月前 | |
docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 (#1028) * exp(ch9): 用 τ²-bench 失败轨迹提炼转人工与工具使用规则,替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实测结果无法支撑正文主张:跨轨迹知识文档 的迁移成功率 25%,低于单轨迹摘要与不使用经验的 50%,负迁移率 25%;生成的 经验文档仅 1094 字节,「推荐策略」只有一条常识,「例外条件」为空。本实验 换用第七章已经解剖过的 τ²-bench telecom 环境重做。 设计: - 提炼集 telecom_small(20 条)与迁移集 telecom(114 条)在上游仓库中互不 相交,划分非事后选取 - 被测 Agent 用弱模型 doubao-seed-1-6-flash-250615(提炼集基线 1/20), 用户模拟器 doubao-seed-1-6-250615 三臂固定 - 规则由模型从 19 条失败轨迹提炼,非人工撰写;保存完整请求与回复回执 - 三臂只换 main_policy.md,每臂记录 sha256,运行后恢复原文件 迁移集 114 条结果: | 臂 | 通过率 | 转人工率 | 误调用户侧工具 | 空参调用 | 工具报错 | |---|---|---|---|---|---| | A 原始策略 | 12.3% | 91.2% | 1056 | 904 | 1392 | | B +v1 规则 | 17.5% | 100.0% | 221 | 256 | 303 | | C +v2 规则 | 19.3% | 97.4% | 293 | 174 | 254 | 配对比较(McNemar 精确检验,零回归):A→B 修好 6 条 p=0.031;A→C 修好 8 条 p=0.008;B→C 修好 2 条 p=0.50(不显著)。 v1 与 v2 的唯一差别是提炼时是否提供 Agent 与用户各自的工具清单。只看报错 文本时,提炼器学到的是「不要重试」;看到工具清单后,它学到「设备侧工具属于 用户,应引导用户执行」。 已知局限(写入 evidence.json):单次运行未做多种子重复;改进集中在 service_issue 一族(14/29 → 21/29),mms_issue 三臂均为 0/49;样本量仅 百余条,只够判断是否值得扩大测试。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实现有问题:生成的经验文档只有一条常识性 "推荐策略"、例外条件为空,迁移对照因此得出知识文档组 25%、两个对照组各 50% 的负结果。GAIA 上的经验学习本身是有效做法,该结果反映的是实验实现缺陷,不 是方法失效,故整体替换。 新的实验 9-2 复用第七章已经解剖过的 τ²-bench telecom 环境: - 提炼集与迁移集在上游仓库中互不相交,提炼过程未见过迁移集任务 - 由模型(非人工)从 19 条失败轨迹归纳规则,追加到原始政策末尾 - 迁移集 114 条上通过率 12.3% → 19.3%,零回归 正文只在原则层面陈述做法与结果,并保留三点发现:提炼器学到什么取决于给它 看什么;模型总结的第一版规则可能把错误固化;被修好的往往是"该问用户却把 话说给了工具"这类朴素问题。 例子一改用 telecom,与第七章现在的解剖对象一致;航空客服作为同一做法的另 一个领域保留,实验 9-3 及其后编号不变。13 个译本的章节 README 同步更新。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 删除 GAIA 实验目录,修正调用方判定 bug,重写例子一文风 三处改动: 一、删除 chapter9/gaia-experience(含 vendored 的 AWorld,919 个文件、46 MB)。 该实验的实现有缺陷,产出的经验文档只有一条常识性策略、例外条件为空,据此 得到的负结果不能代表 GAIA 经验学习本身;正文与 13 个译本 README 已不再引用。 二、修正统计脚本的调用方判定。原先用 requestor 字段区分工具调用是 Agent 还是用户发出的,但 τ²-bench 的消息里该字段恒为 None,导致用户在自己设备上 的合法调用被计成 Agent 越界。改用 role 判定后: | 臂 | 误调用户侧工具(修正前 → 后) | |---|---| | A 原始策略 | 1056 → 1049 | | B +v1 规则 | 221 → 205 | | C +v2 规则 | 293 → 163 | C 臂受影响最大,因为它成功委派给用户的次数最多。修正后 v2 在该指标上明显 优于 v1,与它学到了工具归属这一点一致。通过率与配对结论不受影响。 analyze.py 的工具清单改为与 build_evidence.py 共用 tool_inventory.txt, 避免两份硬编码分叉;顺带删除一段死代码。 三、重写例子一,去掉翻译腔与列举式脚手架(“关于……只有两句话”“比这个数字 更值得记住的是三点”“第一/第二/第三”),改为从具体现象起笔的写法;引号统一 为全书通用的中文双引号。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 例子一改用书面语体例 上一版为消除翻译腔而过度口语化(规矩、没辙、了事、丢给、搞清楚、任务过了 等)。本次按第七章确立的体例改回书面语:小标题用名词短语,正文用完整书面 句式,同时不恢复被删除的翻译腔与列举式脚手架。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX --------- Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com> | 1 个月前 | |
docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 (#1028) * exp(ch9): 用 τ²-bench 失败轨迹提炼转人工与工具使用规则,替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实测结果无法支撑正文主张:跨轨迹知识文档 的迁移成功率 25%,低于单轨迹摘要与不使用经验的 50%,负迁移率 25%;生成的 经验文档仅 1094 字节,「推荐策略」只有一条常识,「例外条件」为空。本实验 换用第七章已经解剖过的 τ²-bench telecom 环境重做。 设计: - 提炼集 telecom_small(20 条)与迁移集 telecom(114 条)在上游仓库中互不 相交,划分非事后选取 - 被测 Agent 用弱模型 doubao-seed-1-6-flash-250615(提炼集基线 1/20), 用户模拟器 doubao-seed-1-6-250615 三臂固定 - 规则由模型从 19 条失败轨迹提炼,非人工撰写;保存完整请求与回复回执 - 三臂只换 main_policy.md,每臂记录 sha256,运行后恢复原文件 迁移集 114 条结果: | 臂 | 通过率 | 转人工率 | 误调用户侧工具 | 空参调用 | 工具报错 | |---|---|---|---|---|---| | A 原始策略 | 12.3% | 91.2% | 1056 | 904 | 1392 | | B +v1 规则 | 17.5% | 100.0% | 221 | 256 | 303 | | C +v2 规则 | 19.3% | 97.4% | 293 | 174 | 254 | 配对比较(McNemar 精确检验,零回归):A→B 修好 6 条 p=0.031;A→C 修好 8 条 p=0.008;B→C 修好 2 条 p=0.50(不显著)。 v1 与 v2 的唯一差别是提炼时是否提供 Agent 与用户各自的工具清单。只看报错 文本时,提炼器学到的是「不要重试」;看到工具清单后,它学到「设备侧工具属于 用户,应引导用户执行」。 已知局限(写入 evidence.json):单次运行未做多种子重复;改进集中在 service_issue 一族(14/29 → 21/29),mms_issue 三臂均为 0/49;样本量仅 百余条,只够判断是否值得扩大测试。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 用 τ²-bench 实测替换 GAIA 经验迁移实验 原实验 9-2(GAIA 经验文档迁移)的实现有问题:生成的经验文档只有一条常识性 "推荐策略"、例外条件为空,迁移对照因此得出知识文档组 25%、两个对照组各 50% 的负结果。GAIA 上的经验学习本身是有效做法,该结果反映的是实验实现缺陷,不 是方法失效,故整体替换。 新的实验 9-2 复用第七章已经解剖过的 τ²-bench telecom 环境: - 提炼集与迁移集在上游仓库中互不相交,提炼过程未见过迁移集任务 - 由模型(非人工)从 19 条失败轨迹归纳规则,追加到原始政策末尾 - 迁移集 114 条上通过率 12.3% → 19.3%,零回归 正文只在原则层面陈述做法与结果,并保留三点发现:提炼器学到什么取决于给它 看什么;模型总结的第一版规则可能把错误固化;被修好的往往是"该问用户却把 话说给了工具"这类朴素问题。 例子一改用 telecom,与第七章现在的解剖对象一致;航空客服作为同一做法的另 一个领域保留,实验 9-3 及其后编号不变。13 个译本的章节 README 同步更新。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 删除 GAIA 实验目录,修正调用方判定 bug,重写例子一文风 三处改动: 一、删除 chapter9/gaia-experience(含 vendored 的 AWorld,919 个文件、46 MB)。 该实验的实现有缺陷,产出的经验文档只有一条常识性策略、例外条件为空,据此 得到的负结果不能代表 GAIA 经验学习本身;正文与 13 个译本 README 已不再引用。 二、修正统计脚本的调用方判定。原先用 requestor 字段区分工具调用是 Agent 还是用户发出的,但 τ²-bench 的消息里该字段恒为 None,导致用户在自己设备上 的合法调用被计成 Agent 越界。改用 role 判定后: | 臂 | 误调用户侧工具(修正前 → 后) | |---|---| | A 原始策略 | 1056 → 1049 | | B +v1 规则 | 221 → 205 | | C +v2 规则 | 293 → 163 | C 臂受影响最大,因为它成功委派给用户的次数最多。修正后 v2 在该指标上明显 优于 v1,与它学到了工具归属这一点一致。通过率与配对结论不受影响。 analyze.py 的工具清单改为与 build_evidence.py 共用 tool_inventory.txt, 避免两份硬编码分叉;顺带删除一段死代码。 三、重写例子一,去掉翻译腔与列举式脚手架(“关于……只有两句话”“比这个数字 更值得记住的是三点”“第一/第二/第三”),改为从具体现象起笔的写法;引号统一 为全书通用的中文双引号。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX * docs(ch9): 例子一改用书面语体例 上一版为消除翻译腔而过度口语化(规矩、没辙、了事、丢给、搞清楚、任务过了 等)。本次按第七章确立的体例改回书面语:小标题用名词短语,正文用完整书面 句式,同时不恢复被删除的翻译腔与列举式脚手架。 Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Mw1Dd4Xnmuk7aW6WMYtDZX --------- Co-authored-by: Claude Opus 5 (1M context) <noreply@anthropic.com> | 1 个月前 |
第 9 章 · Agent 的持续进化
本章把评估接到更新过程。经验可以成为规则、提示词、工作流或代码,但每次更新都应有来源、独立验证和适用范围。
第一次阅读的顺序
读懂一个完整例子后,再查阅下面的全部项目与配置。比较实验时,把输入、模型、运行条件和结果放在一起记录;遇到历史输出,先确认它对应的版本与任务范围。
从运行轨迹中获得可靠信号,把经验转化为可验证、可回滚的能力更新
如何阅读实验
正文用 skeleton 说明验证、载体选择、候选发布/回滚和睡眠学习;项目代码按三层阅读:
- Starter:从 trajectory-verifier 运行离线样例,先看三层 verifier 和证据输出;
- Builder:再看 self-modifying-agent 的提案—回归—灰度—回滚循环,以及 prompt-auto-optimization 的最小 diff;
- Maintainer:检查安全可信根、边界/保留/安全集、版本淘汰和 validation/latest.json。首次可跳过 provider 与 UI 适配。
配套实验
| 编号 | 项目 | 类型 | 一句话说明 |
|---|---|---|---|
| 9-1 | trajectory-verifier | ✅ | 实验 9-1:28 条真实客服调用、8 次 Judge 调用与 8 条专家标注样本已通过验收;证据同时记录关键违规稳定性主张未复现 |
| 9-2 | tau2-escalation-experience | ✅ | 实验 9-2:τ²-bench telecom 上由模型从 19 条失败轨迹提炼转接与工具使用规则;迁移集 114 条通过率 12.3% → 19.3%,零回归;证据保留提炼回执、三臂策略哈希与行为指标 |
| 9-3 | prompt-auto-optimization | ✅ | 实验 9-3:真实任务 Agent、LLM Judge 与 Coding Agent 跑完初始/自动/人工三组完整保留集和边界集;原始回执与发布门槛已保存 |
| 9-4 | 正文对照实验 | 🚧 | 从用户反馈中进化“需求澄清 + Spec 确认”Skill;正文给出三臂 A/B 设计、指标和发布门槛,配套实现待补充 |
| 9-5 | browser-use-rpa | ✅ | 实验 9-5:真实 ARK Agent + Chromium 在可重置本地消息站完成探索、独立验证、参数化回放、假成功对照与页面变化失效 |
| 9-6 | self-modifying-agent | ✅ | 实验 9-6:真实 Coding Agent 从重复故障生成补丁,并与确定性提案、故意过宽的反例通过同一回归/灰度/回滚发布门;证据保留接受与拒绝历史 |
| 9-7 | harness-safety-gate | ✅ | 实验 9-7:用户纠正/点踩/事后审计触发“高风险调用确认门禁”提案,经 AST 静态检查、未完成任务回放和正常操作回放;确定性提案通过,真实 gpt-4o-mini 提案因检查失败被安全拒绝,整体验收通过 |
| 9-8 | hermes-self-evolution | 📖 | 实验 9-8:把整本书和源码交给 Hermes;它读完后选择一项改进,亲手修改自己,并把每次 Reviewer 的退回变成下一轮学习,直到通过 |
| 9-9 | self-evolution-eval | ✅ | 实验 9-9:static、append-only、evolving 三臂 × 3 seeds × 14 任务共 126 次真实调用;证据保留迁移、规则替换、保持与配对统计 |
带项目链接的实验都保留无需 API Key 的离线入口和单元测试用于预检。
补充案例
| 编号 | 项目 | 关系 |
|---|---|---|
| 8-8 | prompt-distillation | Prompt 蒸馏与参数化学习的跨章项目;训练方法归入第八章 |
| — | self-evolving-tools | Alita 式工具发现、封装与复用,是“将经验写成程序”的补充案例 |
| — | ai-style-skill | 写作型 Skill 的补充实验:把“去 AI 味”反馈提炼为可检查规则;正文示例移至第二章,自动更新管道和验收数据保留在项目 README |
项目类型说明
| 图标 | 类型 | 含义 |
|---|---|---|
| ✅ | 可独立运行 | 本仓库自带完整代码,配置好 API Key 即可运行 |
| 📖 | 复现指南 | 依赖需自行 git clone 的外部仓库(训练框架、评测基准等) |
| 🚧 | 进行中 | 已有实现,但真实数据、真实环境或纵向验收证据尚未完整 |