从1个种子任务出发,AI自动长成37,484个递进难度训练题
arXiv 2608.05466论文验证:递归合成方法让任务难度从"能做"到"能做对"平滑过渡。15轮递归后,Agent成功率从90%降到2.5%——这些任务就是最好的训练数据。
1
准备种子任务:一个简单但完整的Agent任务——含指令·环境·参考解法·验证器
2
递归扩展:每轮给参考解法加一阶段——重写验证器→沙箱验证→存活则成为种子
3
质量筛选:验证每轮产出——参考解法可执行·验证器正确·指令准确
锚点 · 为什么Agent需要更好的训练数据
当前Agent评测benchmark有个通病:任务太简单,区分度不够。大部分模型在标准数据集上表现接近,看不出真实能力差距。这篇论文的方法不靠人工写题——从1个种子任务出发,递归扩展参考解法→重写验证器和指令→沙箱验证→存活即成为新种子。关键洞察:任务变难不是因为指令变长,而是每一步都要正确处理更多的状态和边缘情况。15轮后,种子任务从67行解法扩展到374行,模型成功率从90%跌到2.5%。
流程 · 递归合成三步
① 准备种子任务:选一个简单但结构完整的Agent任务(如"读取配置文件→运行JSON对比工具→输出结果")→ ② 递归扩展:AI在参考解法上加一个额外阶段(如"修复不匹配的配置项")→重写验证器以覆盖新阶段→在沙箱中执行验证→如果参考解法通过所有断言,任务进入下一轮→ ③ 质量筛选:检查每条产出的任务是否四个组件一致(指令·环境·参考解法·验证器)
安全 · 沙箱必须隔离
递归合成的任务可能产生不可预期的Shell命令。所有任务验证必须在隔离沙箱中执行——Docker容器或虚拟机。不要让Agent直接在本地文件系统上跑合成任务。论文数据:5美分/任务,37,484任务总成本约$1,874。
# AI任务工厂:递归合成Agent训练任务
角色: AI任务工厂设计师——帮用户设计一个递归合成的Agent任务生成流水线,从种子任务出发逐步扩展为递进难度的训练任务集。
任务: 基于用户提供的种子任务,设计递归扩展策略、验证器规范和沙箱执行方案。输出可被执行的完整任务生成流程。
输入:
- 种子任务描述:[一个简单但完整的Agent任务·包含目标·输入·预期输出]
- 目标难度上限:[希望任务最多扩展到什么复杂度]
- 可用的沙箱环境:[Docker·虚拟机·本地隔离目录]
- 任务领域:[代码分析·数据处理·文本处理·自动化测试·其他]
执行步骤:
1. 种子任务标准化
- 将用户描述转化为标准四元组:指令(instruction)·环境(environment)·参考解法(reference solution)·验证器(verifier)
- 确认四组件一致:指令描述的任务=参考解法执行的操作=验证器检查的结果
2. 递归扩展策略
- 分析种子任务的参考解法,识别可扩展的"下一阶段"
- 扩展方向示例:
· 数据层:增加输入数据的变异(格式变化·缺失字段·编码错误)
· 逻辑层:增加额外的处理步骤(先修复数据→再对比→再生成报告)
· 验证层:增加更多的断言条件(不仅检查结果·还要检查中间状态)
- 每轮扩展后:重写验证器以覆盖新增阶段→沙箱执行→确认参考解法通过所有断言
3. 难度递增设计
- 第1-5轮:单阶段扩展(每次只加一个简单步骤)
- 第6-10轮:多阶段复合(一次加2-3个关联步骤)
- 第11-15轮:边缘情况注入(错误输入·不完整数据·资源限制)
4. 产出整理
- 每个存活的任务按难度分级(初级/中级/高级/极限)
- 标注每个任务的核心考察能力
- 输出任务清单:ID·难度·指令摘要·预期行数·核心能力
输出格式:
━━━ 任务工厂设计方案 ━━━
种子任务四元组(指令·环境·解法·验证器)
扩展树状图(根=种子→每轮扩展方向→存活/淘汰标记)
任务清单(ID·难度·指令摘要·预期解法行数·核心能力)
沙箱配置建议
约束:
- 所有任务验证必须在隔离沙箱中执行——不商量
- 每轮扩展后必须验证四组件一致性——不一致则丢弃该轮
- 推荐的递归轮数上限: 10轮(成本可控)
技术来源:Recursive Synthesis for Long-Horizon Terminal Tasks(arXiv 2608.05466)
核心原理:不从头写任务——从已验证的种子任务出发,递归扩展参考解法→重写验证器→沙箱验证→存活即成为新种子
目标能力:用极低成本(5美分/任务)批量生成Agent长时任务的递进难度训练数据