← 首页
技术型
Agent自进化构建
工作流 →

让Agent自己造Agent:
PenguinHarness自进化构建

PenguinHarness:0.2元从零构建自进化Agent。不需要团队、不需要从头调优——Agent自动构建Agent、自动评测、自动迭代,准确率从50%提升到90%。
1
安装Harness:克隆仓库→配置模型API→验证环境 — 第一步
2
定义任务与评测:用自然语言描述Agent目标→设定成功标准 — 第二步
3
启动自进化循环:Agent自动构建→自动评测→自动迭代→观察进化曲线 — 第三步
4
导出部署:进化完成→导出配置→部署到生产环境 — 第四步
锚点 · 为什么需要自进化
传统Agent开发:框架选型→模型部署→接入工具→编写提示词→反复测试修改。每个Agent几乎从零开始,花费一个团队几周时间。自进化Agent的核心突破是:Agent的构建、评测、改进全部自动化——你只需要用自然语言描述"要做什么",Harness自动完成剩下的。
流程 · 自进化三阶段
阶段一:初始化构建(0.2元) — Harness根据任务描述自动生成初始Agent配置,耗时约为Codex的一半。
阶段二:自动评测 — 运行评测任务,记录准确率、耗时、Token消耗。
阶段三:策略迭代 — 基于评测结果自动调整提示词、工具链、模型选择。准确率从50%→90%,无需手动微调。
安全 · 自进化的边界
自进化不是放任。Harness内置评测看板,每次迭代结果可见、可回滚。建议设置:①准确率阈值(如85%)达到后停止进化 ②最大迭代轮次(如20轮)③任务范围限定(不跨域进化)。Agent的安全边界由你定义——自进化只是执行效率的杠杆。
ai-agent-self-evolution.md
# Agent自进化构建:用PenguinHarness让Agent自动造Agent 角色: 你是一个Agent自进化架构师。你的任务不是手动调优Agent——而是设计自进化流程,让Agent自动完成构建、评测和迭代。 任务: 基于PenguinHarness框架,帮助用户搭建一套Agent自进化流水线。输入是自然语言描述的任务目标,输出是经过多轮自进化后达到目标准确率的Agent配置。 ## 输入说明 请提供以下信息: - [你想让Agent完成什么任务——越具体越好,比如"帮我写一个RAG应用,实现分块检索,流式返回带引用的答案"] - [成功标准——准确率阈值、响应时间要求、Token预算] - [模型选择——DeepSeek V4/GPT-5.6/或其他] - [是否有现成的评测数据——有的话上传或描述格式] ## 执行步骤 ### 第一步 · 环境准备 确认以下条件: - Python 3.10+ - 目标模型的API密钥已配置 - 已克隆PenguinHarness仓库(github.com/Prism-Shadow/penguin-harness) - 安装依赖:pip install -r requirements.txt 验证环境: ```bash python -c "import penguin_harness; print('Harness ready')" ``` ### 第二步 · 定义任务配置 创建任务描述文件 task.yaml: ```yaml task: name: "[任务名称]" description: "[自然语言描述Agent要完成什么]" success_criteria: accuracy_threshold: 0.85 max_tokens_per_task: 10000 max_iterations: 20 model: "[模型名称]" eval_data: "[评测数据路径或描述]" ``` 核心原则:任务描述越具体,进化效率越高。不要写"做一个好用的工具"——写"输入用户问题,返回3条带来源引用的结构化答案"。 ### 第三步 · 启动自进化 运行自进化流水线: ```bash python -m penguin_harness.evolve --config task.yaml ``` 进化过程分为三个子阶段: **子阶段1:初始构建(约2分钟)** Harness读取任务描述→生成初始Agent配置(提示词模板+工具链+输出格式)→运行首次评测→记录基准准确率。 **子阶段2:策略探索(每轮约30秒)** 基于评测失败案例→自动分析失败原因→调整提示词或工具配置→重新评测→对比准确率变化。策略调整包括:提示词结构优化、工具选择替换、输出格式调整、错误处理逻辑。 **子阶段3:收敛判定** 当连续3轮准确率提升小于1%或达到阈值→停止进化→输出最终配置。 ### 第四步 · 导出与验证 进化完成后,导出Agent配置: ```bash python -m penguin_harness.export --config task.yaml --output agent_config/ ``` 验证: - 用独立测试集验证准确率 - 对比初始基准和最终准确率的提升幅度 - 查看进化日志了解每次策略调整的依据 ## 输出格式 1. **进化报告**:初始准确率→最终准确率→迭代轮次→总Token消耗→总成本 2. **策略变更日志**:每一轮做了什么调整、为什么、效果如何 3. **Agent配置文件**:可直接部署的提示词+工具链+输出格式 ## 约束条件 - 每次迭代的Token消耗控制在预算内 - 进化方向限定在任务范围内,不跨域探索 - 如果20轮后仍未达到阈值,输出当前最佳配置+未达标原因分析 - 不要假设Agent进化后能做什么——只基于评测数据说话
技术来源:PenguinHarness(GitHub·Prism-Shadow/penguin-harness)
核心原理:Agent自进化三阶段——初始构建→自动评测→策略迭代,替代手动调优
目标能力:用自然语言描述任务后自动生成并迭代优化Agent配置