自我进化智能体(Self-Evolving Agents)的分类体系:Model、Harness 与 Artifact
本文提出了一个关于“自我进化智能体”(Self-Evolving Agents)的系统性分类框架:将智能体分解为 Model(模型)、Harness(外壳/框架) 与 Artifact(产物) 三个组成部分,并据此归纳了当前该领域研究的三大方向——优化产物、优化自身结构与优化模型参数,并指出各方向正逐渐走向融合,未来的核心挑战在于真实世界环境中的落地应用。
核心要点
- Self-Evolving 概念泛滥但定义模糊:当前大量工作都自称“自我进化”(self-evolving / self-improving),但不同工作所指的含义完全不同,缺乏统一清晰的定义。
- 提出三分类框架:将智能体拆解为 Model、Harness、Artifact 三部分,一切自我进化工作都可归入其中一类或几类的组合。
- 三类进化的核心区别:
- Artifact 进化:优化智能体产生的产物(代码、论文、策略等)。
- Harness 进化:智能体在部署阶段修改自身结构(Prompt、Memory、工具等),不调整模型参数。
- Model 进化:在无监督/弱监督信号下更新模型权重本身。
- 关键判断:凡是可被快速自动验证(verifiable)的任务,都可被自我进化智能体做得比人更好。
- 未来趋势:三个类别的边界逐渐模糊,走向统一优化;下一个主战场是从虚拟世界走向真实世界。
详细解析
1. 背景与动机
1.1 四个典型案例
| 案例 | 机构/关联 | 核心主张 |
|---|---|---|
| Reflection AI(Recursive Self-Improving Superintelligence) | 田渊栋离开 Meta 后联合创立 | 用递归自我改进实现超级智能,自动化知识发现 |
| Ada(Skill Discovery for Robotics) | Ada 组 | 将自我改进概念用于机器人技能发现 |
| 自我进化具身 AI 实验系统 | 普林斯顿物理系吴三峰组合作 | 用机器人做物理实验以进行科学发现 |
| Claude Agent(爱马仕智能体) | 近期热门 | 宣称是“会成长的智能体”,部分指标超过 OpenAI 产品 |
要点:Self-evolving 已广泛应用于多个领域(创业公司、机器人、科学研究、通用智能体),但“self-evolving”指代的具体内容各不相同,需要厘清。
1.2 相关术语辨析
文中列举了以下容易混淆的术语:
- Self-evolving
- Self-improving
- Continual Learning
- Recursive Self-Improvement
- Test-Time Training
- Automated Discovery
核心问题:这些词有些指同一概念、有些互有区别,需要明确各自含义、区别与联系。
2. 智能体的三部分构成
核心公式:Agent = Model + Harness
| 组成部分 | 定义 | 示例 |
|---|---|---|
| Model | 所调用的底层大语言模型(LLM)本身 | 具体的预训练模型 |
| Harness | 模型周围的一系列增强组件,包括 Prompt、Memory、Tools、Loops 等 | 提示词工程、记忆系统、工具调用框架、Agent 循环 |
| Artifact | 通过 Model 与 Harness 结合所生产出的产物 | 代码、论文、机器人 Policy、科学发现(Findings)等 |
推论:自我进化可发生在三个层面——模型参数提升、Harness 结构改进、Artifact 质量优化。
3. 第一类:Artifact 进化(优化产生的产物)
3.1 核心思想
“不断优化产物本身”(Optimize what we produce)。Artifact 可以是任何 Agent 产出的东西——代码、论文、数据、策略等,通过循环迭代使产物达到更好的指标或结果。
3.2 人 vs. Agent 的流程对比
人类科研流程(传统循环):
人提出 idea → 人设计实验设置 → 人跑实验 → 人得出结论 → 结论反馈优化 idea → 循环
Agent 自动化流程:
Agent 提出优化目标 → Agent 设计实验方案 → Agent 执行实验 → Agent 校验结果 → Agent 提出下一步方向 → 构成完全自动化闭环
关键变化:LLM 出现后,原先由人承担的一系列工作可被智能体完全取代,带来更高的搜索效率、更大的搜索空间与更优的搜索算法。
3.3 典型案例
AlphaEvolve(矩阵乘法优化):
- 人定义任务 → 交由 Agent 分步骤迭代 → 找到更优的矩阵乘法算法
- 核心逻辑:Agent 通过 Self-Improving 持续提升产物(算法)的优化目标
FORCE 系统(全自动科研系统,日行记公司):
- 2024 年初发布,Fully Automated Research System
- 运行 400+ 小时,消耗约 20 万美元,产出 166 篇论文
- 核心论点:论文本身可被视为一种 Artifact;如果研究者的 idea 不够新、实验过程平庸,则其大部分工作可被 AI 完全替代
3.4 支撑 Artifact 进化的两大因素
- 文本模态统一:论文、代码等产物以文本为模态,LLM 将所有文本模态任务统一——一个模型可以做所有事,使 Loop 可流畅运行。
- 模型长程任务能力提升:随着模型能力增强,可执行从几分钟到几小时乃至几天不间断运行的任务。
3.5 关键原则
凡是可被容易验证的问题,都容易被 AI 所取代。凡是只需在虚拟空间中执行的任务,基本都可被 AI 取代。
3.6 从虚拟世界走向真实世界
Lab OS 工作:希望 AI 从写代码/写论文转向执行真实物理实验甚至生物实验。
真实世界面临的难点:
- 验证(Verification)非常困难——生物实验结果好坏难以快速判断,往往需要很长时间
- 真实动作的执行对当前模型有很大挑战
总结:Artifact 优化偏向产业界,大量创业公司和大厂在做。当前模型在虚拟世界已能出色执行,但真实世界仍是最具挑战的场景。引用莎士比亚改写:“The world is agents”(世界是智能体的舞台)。
4. 第二类:Harness 进化(改进智能体自身结构)
4.1 核心概念
定义:Agent 在不需要重新训练模型的情况下,通过修改自身的部分组件(Memory、Prompt、工具等)在部署(Inference)阶段不断自我提升。
与 Artifact 的区别:Artifact 控制的是外部产物;Harness 修改的是 Agent 本身的部分。
4.2 两种子类别
| 子类别 | 含义 | 对象 |
|---|---|---|
| Test-time Knowledge(文本知识) | 模型修改自己的 Prompt、Playbook、Memory | 本质上最终都会转化为模型的 Context |
| Actionable Knowledge(可操作知识) | 模型自我修改 Tools、Skills | 行为层面的工具 |
关键理解:Prompt、Playbook、Memory 三者本质上是一类东西——都最终变成模型的 Context,因为决定模型输出的真正关键是其接收到的上下文。
4.3 Text Knowledge 方向代表工作
Agent Context Engineering(ACE):
- 核心思路:模型接收查询后,在其系统提示之上叠加 Context Playbook;模型不断总结自身经验写入 Playbook;运行时从 Playbook 检索相关知识辅助决策
- 该方向同期有大量类似工作,但此篇关注度最高。原因:① 题目好,提出新名词“Context Engineering”;② Stanford 的单位背书
Jarvis(Jaa):
- 与 ACE 的区别:无额外 Playbook,直接修改自身 Prompt
- 类比理解:梯度下降是优化模型参数;Jarvis 是在无梯度(Gradient-free)情况下优化自己的 Prompt,类似非梯度优化手段
- 机制:模型产生一系列 Prompt → 优中选优 → 通过杂交(crossover)获得更好的 Prompt
Memory 工作(以 MemoryOS 为例):
- 涵盖数据库,将历史对话内容做结构化处理并存入数据库,在有需要时检索并取出 Memory 优化模型输出
- 大部分 Memory 工作本质相似,差异在抽象层与具体实现
总结:三者本质上都是 Context 管理——通过将额外知识注入 Context 提升模型对下游任务的适应能力。
4.4 Actionable Knowledge 方向代表工作
LITA(工具创建):
- 背景:传统 Agent 预定义大量通用工具,但工具过多会占据模型 Context,且预定义工具与下游任务往往不一致(misaligned)
- 核心转变:从“Tool Use”变为“Tool Creation”
- 实现方式:不预先定义过多工具,仅保留少量必要原子工具;需要时再现场创建工具
- 流程:Manager Agent → Brainstorming(头脑风暴)→ Search(搜索)→ Coding(编码生成工具)→ 组合成 Pipeline
- 结果:在多个任务上超过 Mind 和 OpenAI Agent
Skills 机制:如 Claude Skills 或 OpenAI Skills,已事实成为 Agent 的默认配置,可视为 Tool Creation 的延伸。
4.5 统一视角:一切皆 Context Management
关键洞察:Skills 本质上也是一种 Context 管理手段——
- 一个 Agent 不可能同时容纳上千个工具到内存
- Skills 如同构建了一个索引(Index):告诉模型“需要时找它,不需要时忽略它”
- 这在有限 Context Window 条件下减轻了 memory 负担
因此:Test-time Knowledge、Memory、Skills、甚至 Multi-Agent System 都指向同一件事情——Context Matters。
4.6 Harness 进化的问题与挑战
核心问题:天下没有免费的午餐
- 当 Memory 越来越长、Context 越来越满、Skill 库越来越多时,模型性能会逐渐下降
- 原因是模型的 Context Window 被占满
- 单一 Agent 在一个数据集上做 Self-Improving 往往会影响其他数据集能力(灾难性遗忘的类似表现)
4.7 趋势:Multi-Agent System(多智能体系统)
类比:现实世界中,有人擅长做饭、有人擅长炒股、有人擅长研究——世界由各种领域专家组成。Agent 领域也应如此——用多智能体系统管理各自独立的 Context,避免单个 Agent 的 Context 爆炸。
核心工作:Lite(多领域专家系统)
- 动机:模拟真实场景——真实场景中问题差异往往极大
- 实验设计:选取 4 个差异极大的数据集,让模型同时做 Self-Improving
- 发现:随着任务数量增多(4 个任务时),ACE 和 Jarvis 出现显著性能下降
- 机制:Roter(也是 Agent)决定哪个 Target Model 最适合回答当前问题
- 结果:虽然未告知任务归属,模型能很好地将问题分类并带来明显的性能提升
Lisa(从通用工具到专家 Agent):
- 针对技能过多影响模型性能的问题
- 流程:遇到问题 → 生成一系列 Tools → 通过结构化操作抽象出 MCP 包 → 为问题装配最合适的工具包 → 生成一个定制化 Agent 解决问题
- 核心思想:从 Single-Agent 转化为 Multi-Agent 问题
- 结果:性能提升且效率显著改善
- 引用:*“We shape our tools, and thereafter our tools shape us.”*——通过赋予工具创建新的智能体,可以为特定任务定制化专家。
4.8 Routing(任务路由)的挑战
核心发现:Routing 并不简单
- 将任务分配给合适的专家,对人类来说是容易的,但对模型并不自然
- 自建 Benchmark(RoBench Score)进行测试,发现所有模型得分差距很大
关键实验数据:仅是一个二分类任务(判断任务应分配给 LLM 还是 Agent),GPT-5 和 Claude 3.5 Sonnet 都未取得令人满意的准确率。
结论:Routing 对模型而言仍是有挑战的任务。人类的优势恰在于作为一个“巨大的 Router”——将任务分配给最合适的人。这可能正是人类的价值所在。
5. 第三类:Model 进化(提升模型参数)
5.1 核心问题
在没有 Ground Truth(金标准/监督信号) 的情况下,如何让模型更新自身权重?
传统的监督微调需要 Ground Truth 作为监督信号进行梯度下降,而 Self-Evolving 希望突破这一约束。
5.2 四种子方向
| 子方向 | 核心思想 | 代表机制/工作 |
|---|---|---|
| 1. 自生成替代信号(Proxy Signals) | 无 Ground Truth 时,模型自身估计也包含额外信息 | Majority Voting → 伪 Ground Truth |
| 2. 自对弈/环境信号(Self-play / Weak Signals from Environment) | 从外部环境获取弱监督信号 | RLVR、Zero 对抗训练 |
| 3. Test-Time Training(TTT) | 将 Inference 过程等同于梯度下降 | DeltaNet、TTT 架构 |
| 4. Continual Learning(持续学习) | 学新任务同时不遗忘旧任务 | Memory Replay |
5.3 替代信号(Ground Truth → Proxy Signals)
核心直觉:
- 例如问模型“桌上有几个苹果”,模型不知道正确答案但会说“4/5/6 的概率更大”,那么这个估计本身就提供了有用信息
- 可以惩罚模型输出 1/2/3,鼓励输出 4/5/6
- 即使没有外部 Ground Truth,模型内部信号仍有学习价值
经典统计学例证(Semi-Supervised Learning):
- 只有标注数据时,分类线取决于标注点
- 加入未标注数据点后,决策边界可被画得更精确、更接近真实分布
- 结论:未标注数据依然有用——这是该方向的根本动机
近期代表:Test-Time Reinforcement Learning(TT-RL)
- 通过 Majority Voting 获得伪 Ground Truth
- 基于这些伪标签构造 Reward 来训练模型
5.4 自对弈与环境信号(Self-play & Weak Signals)
核心机制:信号从环境/对手中获得,而非模型内部。
| 代表 | 机制 |
|---|---|
| 标准 RLVR(可验证奖励强化学习) | 用可验证的 Reward(如代码运行结果)校验回答,监督训练 |
| Zero(对抗训练) | 两个模型互相博弈、互为“环境”,在对抗中交替提升 |
本质:当一个智能体的外部监督信号越来越弱时,它从环境(包括对手)获取信息来训练自身——这也是一种“无 Ground Truth”的学习。
5.5 Test-Time Training(TTT)
核心阐述:TTT 本质上是一种 架构(Architecture),而非学习算法。
数学关键:TTT 的 Inference 过程在数学上完全等价于做梯度下降:
推理时每预测一个 next token,就是在对知识空间做一次梯度下降。预测次数足够长时,就相当于在朝真实目标做优化。
代表工作:
- DeltaNet(更重要):第一个将“推理等价于梯度下降”引入该领域的工作;是 Linear Attention 的一种变体
- TTT:DeltaNet 的扩展——引入非线性信息
推荐资源:Young Kim 的 Slides、Santra 的 Block-G 有很好的讲解。
5.6 Continual Learning(持续学习)
传统定义:
- Task 0 → 训练好猫分类模型
- Task A → 学习狗分类
- Task B → 学习车分类
- 核心要求:获得新能力的同时不遗忘旧能力
现状判断:
- 唯一被验证有效的方法是 Memory Replay(训练狗时加入部分猫的数据;训练车时重放猫狗的数据)
- 架构类方法在大规模数据下效果有限
- 传统意义下的 Continual Learning 工作已越来越少、声音越来越小
重要演变:LLM 时代,Continual Learning 的含义已发生迁移——越来越接近 Self-Improving、Artifact Improvement、Harness Improvement。词还在,但含义已变。
5.7 术语演变的元观察
“Mechanics are more durable than names.”(机制比名称更持久)
- Multimodal 一词:2017 年指 Caption/CLIP → 2023 年指 VLM(如 GPT-4V)→ 现在指 Unified Model 或 Real Generation
- Continual Learning:从 Spatio-Temporal 到 Online Adaptation,再到 Self-Evolving Agents
- 结论:我们一边发明新名词,一边赋予旧名词新含义。讨论时应明确所指含义,这是必要的。
6. 三者统一:反馈循环与趋势
6.1 完整循环
更好的模型 → 更好的 Harness → 更好的 Artifacts
↑ ↓
(优化反馈) ← 产物/轨迹作为奖励信号- 更好的模型能产生更好的 Harness
- Harness 改进后产生更好的 Artifacts
- Artifacts 产生的结果作为奖励/轨迹反馈给模型,提升模型
6.2 边界融合
这三个类别的边界正在模糊化(Blurring),趋势是统一优化三者。
代表工作:SA(Self-Adapting)——同时优化 Harness 与权重,是最早尝试打破分类边界的工作之一。
6.3 抽象层级的提升
人类不断在提高自己的抽象层级:
Coding(单词级)→ 代码片段 → Function → Project
从微观层到越来越宏观的抽象控制,人只关心更高层级的决定。 下一个好的抽象:模型 + Harness + Artifact 的三者联合优化,而非单独某一类。
7. 总结与未来预测
- 分类框架:Self-Evolving Agents 分为 Model、Harness、Artifact 三类
- 边界模糊:词与词、类别与类别之间的界限逐渐模糊,趋向统一优化
- 虚拟世界已成熟:凡是可验证的任务,模型可以比人优化得更快
- 下一个主战场:真实世界——将 Agent 应用于真实世界的 Pipeline,因为 Real World 是现在最困难的环境
8. 问答与讨论精选
Q1:Jarvis 与文本梯度下降(Text Gradient)的区别?
- Text Gradient 有多个流派:
- 偏向参数/数值流派:模拟梯度下降方向的文本方法,置于标准梯度下降框架下
- 偏向启发式流派:更像早期遗传算法/演化学习,不属于标准梯度框架
- Jarvis 更像启发式方法(Heuristic),是一种无梯度优化;Text Gradient 的某些工作更接近模拟数字梯度的标准框架
- 两者在更高层都是设定目标、进行优化的通用优化方法
Q2:AI 评审给出拒绝意见时,智能体会缩窄研究范围而非创造性改变设计,这一观察是否成立?
- 主持人观察确认:AI 写 Rebuttal 时倾向于承认所有错误并最小化 Claim 范围,产出的回复往往“不能用”
- 刘世龙解释:这种现象可能存在,原因有二:
- 保守策略:缩小 Scope 更容易“中”,人类面对 Reviewer 时也会如此做——Agent 模仿了人类行为
- 目标定义问题:Agent 的目标是“产出一篇论文”,过程中“价值”不是最高优先级
- Reward 偏差:Review 文本本身是一种约束性 Reward;人类希望模型同时“论文更强”和“解决 Rebuttal 问题”,但这部分 Reward 不包含在 Review 评论中——存在隐含的 Reward Function 未外化
Q3:Evaluator(评价器)在整个 Self-Evolving 中处于什么地位?
- Evaluator 是最重要的事情:在自我进化系统中,评价器(Verifier)是产生 Evaluation Function 的组件
- 核心观点:对模型而言,优化本身并不难;难点在于设定正确的目标
- 做好 Evaluation、好的 Benchmark、提出好的问题——这些才是最难最有价值的部分
- 这也是为什么近期 LLM Benchmark 文章特别多——合理现象
Q4:Self-Evolving 在目前路径下的天花板是什么?
回答:环境(Environment)是最大的瓶颈。
- Model 与 Harness 的能力可以预期持续提升(外界公司也在推动)
- 但限制整体系统的核心因素在环境:
- 虚拟世界中:是否有可扩展的标准化环境
- 真实世界中:是否能获得及时反馈,校验是否足够快,以及数据效率问题
- Evaluator 和环境共同构成一个 Benchmark——Benchmark 的定义本身就是终极难题
追问:Benchmark 满分是否合理?
- 满分是过于苛刻的要求;更有意义的目标是比较结果(例如比人更好或更快)
- Benchmark 本身也有偏差——Ground Truth 往往由人类定义
- 多数领域没有严格 Ground Truth,只能以人为对照
- “天花板就是人的注意力时间”——人类无法完整逐字审核 AI 生成的论文和代码
Q5:对 Harness 与 Model Weight 联合进化有什么看法?
- 目前工作仍非常早期,代表如 SA(同时优化 Harness 与权重)
- 技术上存在困难:Model 用梯度优化,Harness 是非梯度优化——结合有挑战
- 从抽象层级看,联合优化是值得探索的方向
关于最优 Harness 是否存在的问题:
- “最优”需与 Benchmark 绑定;给定 Benchmark 后,就可以像学习一样找到一个更好的 Harness
- 全局最优极难达到,但可以持续寻找更优的 Harness
- 实验经验:同一模型下,Harness 带来的知识上限受 Model 本身能力限制——Harness 优化更多是对任务格式、说话方式的适应,无法超越 Model 的知识天花板
- 关键问题:如何激励模型去探索——Harness 优化容易很快固定在一个方向;需要鼓励模型在 Exploitation 前多探索(类似 RL 中的 Exploration vs. Exploitation),从而进一步提升
Q6:研究 Self-Evolving 是否有领域/任务/数据集的限定?
- 学术研究(Harness/Model 方向):使用相对传统的知识密集型 Benchmark;可从已有论文中找到一脉相承的 Benchmark 体系
- Artifact 方向:面向实际场景,不同场景有不同 Benchmark(如 Kernel Optimization 有自己的标准)
- 核心原则:Self-Evolving 一定要优化“什么”,所以必须有对应的验证基准
- 建议:如果某一领域缺乏好 Benchmark,提出 Benchmark 本身就是极有意义的工作
Q7:现有的 Benchmark 是否能充分衡量 Self-Evolving 能力?
- 可以衡量演化效率(例如模型在 Benchmark 上提升的速度/Delta),而非仅看 Benchmark 绝对分数
- 真实世界中的大量任务未被现有 Benchmark 覆盖——但目前 Self-Evolving 研究的核心目标是解决真实任务本身
关于模型自身的品味(Taste):
- 好研究者的关键能力是能自我判断(“我写的东西好不好”)
- 这不完全依赖外部 Reward Function——内在的 Reward Function 可能更强
- 类比:人的写作能力提升常始于 Review 别人的论文——先建立好的 Reviewer 能力,再提升生成能力
- 即:可能要先训练好 Discriminator,再训练 Generator;先做好 Benchmark/Evaluator 再提升模型
Q8:Harness 是否是过渡性产物?
是,但并非完全被替代。
- 能被吸收进模型的(“被吃掉”的):Rubric、规则、“Let's think step by step”等提示词技巧——已逐步融入模型能力
- 不能被吸收的:Memory 设计(模型 Context 有限)、Tools(网络搜索需工具执行)、Context 管理、外部环境接口
- 规律:越 specific(针对该模型定制设计)的东西越容易被吸收进模型;但模型始终不能做到所有事情——外层 Harness 将永远有效
- 演进模式:Harness 不断被吸收为模型能力 → 产生新的更高级 Harness → 再被吸收——这本身就是一种自我进化
Q9:模型自身 Knowledge 是否很小?RAG 是否提供了大部分知识?
- 模型 Knowledge 绝不小——现代模型的参数量决定了其知识远超任何个人
- RAG 从业者说模型 Knowledge 小,有其推广 RAG 的动机
- 但模型 Knowledge 确实不完整:仅限于训练截止时间之前的知识,之后的新知识没有
- 这正是 Harness 存在的意义——需要一种机制提供新信息
- 重要区分:Harness 提供的不一定是“知识”,但信息是重要的——其核心价值在于与外界交互的方式
行动清单
- [ ] 区分 Self-Evolving 工作中的具体类别:是 Model、Harness 还是 Artifact 优化?
- [ ] 判断任务是否满足“可快速验证”条件——满足则可考虑用自我进化智能体解决
- [ ] 评估单 Agent 的 Context 管理极限,必要时转向 Multi-Agent 架构
- [ ] 重视 Evaluator 设计——好的评价体系比优化本身更重要
- [ ] 关注从虚拟世界到真实世界的迁移挑战(验证困难、反馈延迟、数据效率)