返回
查看原链接原链接
Bilibili1小时11分55秒 · —

自我进化智能体(Self-Evolving Agents)的分类体系:Model、Harness 与 Artifact

自我进化智能体(Self-Evolving Agents)的分类体系:Model、Harness 与 Artifact

本文提出了一个关于“自我进化智能体”(Self-Evolving Agents)的系统性分类框架:将智能体分解为 Model(模型)Harness(外壳/框架)Artifact(产物) 三个组成部分,并据此归纳了当前该领域研究的三大方向——优化产物、优化自身结构与优化模型参数,并指出各方向正逐渐走向融合,未来的核心挑战在于真实世界环境中的落地应用。

核心要点

  • Self-Evolving 概念泛滥但定义模糊:当前大量工作都自称“自我进化”(self-evolving / self-improving),但不同工作所指的含义完全不同,缺乏统一清晰的定义。
  • 提出三分类框架:将智能体拆解为 Model、Harness、Artifact 三部分,一切自我进化工作都可归入其中一类或几类的组合。
  • 三类进化的核心区别
  • Artifact 进化:优化智能体产生的产物(代码、论文、策略等)。
  • Harness 进化:智能体在部署阶段修改自身结构(Prompt、Memory、工具等),不调整模型参数。
  • Model 进化:在无监督/弱监督信号下更新模型权重本身。
  • 关键判断:凡是可被快速自动验证(verifiable)的任务,都可被自我进化智能体做得比人更好。
  • 未来趋势:三个类别的边界逐渐模糊,走向统一优化;下一个主战场是从虚拟世界走向真实世界。

详细解析

1. 背景与动机

1.1 四个典型案例
案例机构/关联核心主张
Reflection AI(Recursive Self-Improving Superintelligence)田渊栋离开 Meta 后联合创立用递归自我改进实现超级智能,自动化知识发现
Ada(Skill Discovery for Robotics)Ada 组将自我改进概念用于机器人技能发现
自我进化具身 AI 实验系统普林斯顿物理系吴三峰组合作用机器人做物理实验以进行科学发现
Claude Agent(爱马仕智能体)近期热门宣称是“会成长的智能体”,部分指标超过 OpenAI 产品

要点:Self-evolving 已广泛应用于多个领域(创业公司、机器人、科学研究、通用智能体),但“self-evolving”指代的具体内容各不相同,需要厘清。

1.2 相关术语辨析

文中列举了以下容易混淆的术语:

  • Self-evolving
  • Self-improving
  • Continual Learning
  • Recursive Self-Improvement
  • Test-Time Training
  • Automated Discovery

核心问题:这些词有些指同一概念、有些互有区别,需要明确各自含义、区别与联系。

2. 智能体的三部分构成

核心公式Agent = Model + Harness

组成部分定义示例
Model所调用的底层大语言模型(LLM)本身具体的预训练模型
Harness模型周围的一系列增强组件,包括 Prompt、Memory、Tools、Loops 等提示词工程、记忆系统、工具调用框架、Agent 循环
Artifact通过 Model 与 Harness 结合所生产出的产物代码、论文、机器人 Policy、科学发现(Findings)等

推论:自我进化可发生在三个层面——模型参数提升、Harness 结构改进、Artifact 质量优化。

3. 第一类:Artifact 进化(优化产生的产物)

3.1 核心思想

“不断优化产物本身”(Optimize what we produce)。Artifact 可以是任何 Agent 产出的东西——代码、论文、数据、策略等,通过循环迭代使产物达到更好的指标或结果。

3.2 人 vs. Agent 的流程对比

人类科研流程(传统循环):

人提出 idea → 人设计实验设置 → 人跑实验 → 人得出结论 → 结论反馈优化 idea → 循环

Agent 自动化流程

Agent 提出优化目标 → Agent 设计实验方案 → Agent 执行实验 → Agent 校验结果 → Agent 提出下一步方向 → 构成完全自动化闭环

关键变化:LLM 出现后,原先由人承担的一系列工作可被智能体完全取代,带来更高的搜索效率、更大的搜索空间与更优的搜索算法。

3.3 典型案例

AlphaEvolve(矩阵乘法优化)

  • 人定义任务 → 交由 Agent 分步骤迭代 → 找到更优的矩阵乘法算法
  • 核心逻辑:Agent 通过 Self-Improving 持续提升产物(算法)的优化目标

FORCE 系统(全自动科研系统,日行记公司)

  • 2024 年初发布,Fully Automated Research System
  • 运行 400+ 小时,消耗约 20 万美元,产出 166 篇论文
  • 核心论点:论文本身可被视为一种 Artifact;如果研究者的 idea 不够新、实验过程平庸,则其大部分工作可被 AI 完全替代
3.4 支撑 Artifact 进化的两大因素
  1. 文本模态统一:论文、代码等产物以文本为模态,LLM 将所有文本模态任务统一——一个模型可以做所有事,使 Loop 可流畅运行。
  2. 模型长程任务能力提升:随着模型能力增强,可执行从几分钟到几小时乃至几天不间断运行的任务。
3.5 关键原则

凡是可被容易验证的问题,都容易被 AI 所取代。凡是只需在虚拟空间中执行的任务,基本都可被 AI 取代。

3.6 从虚拟世界走向真实世界

Lab OS 工作:希望 AI 从写代码/写论文转向执行真实物理实验甚至生物实验。

真实世界面临的难点

  • 验证(Verification)非常困难——生物实验结果好坏难以快速判断,往往需要很长时间
  • 真实动作的执行对当前模型有很大挑战

总结:Artifact 优化偏向产业界,大量创业公司和大厂在做。当前模型在虚拟世界已能出色执行,但真实世界仍是最具挑战的场景。引用莎士比亚改写:“The world is agents”(世界是智能体的舞台)。

4. 第二类:Harness 进化(改进智能体自身结构)

4.1 核心概念

定义:Agent 在不需要重新训练模型的情况下,通过修改自身的部分组件(Memory、Prompt、工具等)在部署(Inference)阶段不断自我提升。

与 Artifact 的区别:Artifact 控制的是外部产物;Harness 修改的是 Agent 本身的部分。

4.2 两种子类别
子类别含义对象
Test-time Knowledge(文本知识)模型修改自己的 Prompt、Playbook、Memory本质上最终都会转化为模型的 Context
Actionable Knowledge(可操作知识)模型自我修改 Tools、Skills行为层面的工具

关键理解:Prompt、Playbook、Memory 三者本质上是一类东西——都最终变成模型的 Context,因为决定模型输出的真正关键是其接收到的上下文。

4.3 Text Knowledge 方向代表工作

Agent Context Engineering(ACE)

  • 核心思路:模型接收查询后,在其系统提示之上叠加 Context Playbook;模型不断总结自身经验写入 Playbook;运行时从 Playbook 检索相关知识辅助决策
  • 该方向同期有大量类似工作,但此篇关注度最高。原因:① 题目好,提出新名词“Context Engineering”;② Stanford 的单位背书

Jarvis(Jaa)

  • 与 ACE 的区别:无额外 Playbook,直接修改自身 Prompt
  • 类比理解:梯度下降是优化模型参数;Jarvis 是在无梯度(Gradient-free)情况下优化自己的 Prompt,类似非梯度优化手段
  • 机制:模型产生一系列 Prompt → 优中选优 → 通过杂交(crossover)获得更好的 Prompt

Memory 工作(以 MemoryOS 为例)

  • 涵盖数据库,将历史对话内容做结构化处理并存入数据库,在有需要时检索并取出 Memory 优化模型输出
  • 大部分 Memory 工作本质相似,差异在抽象层与具体实现

总结:三者本质上都是 Context 管理——通过将额外知识注入 Context 提升模型对下游任务的适应能力。

4.4 Actionable Knowledge 方向代表工作

LITA(工具创建)

  • 背景:传统 Agent 预定义大量通用工具,但工具过多会占据模型 Context,且预定义工具与下游任务往往不一致(misaligned)
  • 核心转变:从“Tool Use”变为“Tool Creation
  • 实现方式:不预先定义过多工具,仅保留少量必要原子工具;需要时再现场创建工具
  • 流程:Manager Agent → Brainstorming(头脑风暴)→ Search(搜索)→ Coding(编码生成工具)→ 组合成 Pipeline
  • 结果:在多个任务上超过 Mind 和 OpenAI Agent

Skills 机制:如 Claude Skills 或 OpenAI Skills,已事实成为 Agent 的默认配置,可视为 Tool Creation 的延伸。

4.5 统一视角:一切皆 Context Management

关键洞察:Skills 本质上也是一种 Context 管理手段——

  • 一个 Agent 不可能同时容纳上千个工具到内存
  • Skills 如同构建了一个索引(Index):告诉模型“需要时找它,不需要时忽略它”
  • 这在有限 Context Window 条件下减轻了 memory 负担

因此:Test-time Knowledge、Memory、Skills、甚至 Multi-Agent System 都指向同一件事情——Context Matters

4.6 Harness 进化的问题与挑战

核心问题:天下没有免费的午餐

  • 当 Memory 越来越长、Context 越来越满、Skill 库越来越多时,模型性能会逐渐下降
  • 原因是模型的 Context Window 被占满
  • 单一 Agent 在一个数据集上做 Self-Improving 往往会影响其他数据集能力(灾难性遗忘的类似表现)
4.7 趋势:Multi-Agent System(多智能体系统)

类比:现实世界中,有人擅长做饭、有人擅长炒股、有人擅长研究——世界由各种领域专家组成。Agent 领域也应如此——用多智能体系统管理各自独立的 Context,避免单个 Agent 的 Context 爆炸。

核心工作:Lite(多领域专家系统)

  • 动机:模拟真实场景——真实场景中问题差异往往极大
  • 实验设计:选取 4 个差异极大的数据集,让模型同时做 Self-Improving
  • 发现:随着任务数量增多(4 个任务时),ACE 和 Jarvis 出现显著性能下降
  • 机制:Roter(也是 Agent)决定哪个 Target Model 最适合回答当前问题
  • 结果:虽然未告知任务归属,模型能很好地将问题分类并带来明显的性能提升

Lisa(从通用工具到专家 Agent)

  • 针对技能过多影响模型性能的问题
  • 流程:遇到问题 → 生成一系列 Tools → 通过结构化操作抽象出 MCP 包 → 为问题装配最合适的工具包 → 生成一个定制化 Agent 解决问题
  • 核心思想:从 Single-Agent 转化为 Multi-Agent 问题
  • 结果:性能提升且效率显著改善
  • 引用:*“We shape our tools, and thereafter our tools shape us.”*——通过赋予工具创建新的智能体,可以为特定任务定制化专家。
4.8 Routing(任务路由)的挑战

核心发现:Routing 并不简单

  • 将任务分配给合适的专家,对人类来说是容易的,但对模型并不自然
  • 自建 Benchmark(RoBench Score)进行测试,发现所有模型得分差距很大

关键实验数据:仅是一个二分类任务(判断任务应分配给 LLM 还是 Agent),GPT-5 和 Claude 3.5 Sonnet 都未取得令人满意的准确率。

结论:Routing 对模型而言仍是有挑战的任务。人类的优势恰在于作为一个“巨大的 Router”——将任务分配给最合适的人。这可能正是人类的价值所在。

5. 第三类:Model 进化(提升模型参数)

5.1 核心问题

没有 Ground Truth(金标准/监督信号) 的情况下,如何让模型更新自身权重?

传统的监督微调需要 Ground Truth 作为监督信号进行梯度下降,而 Self-Evolving 希望突破这一约束。

5.2 四种子方向
子方向核心思想代表机制/工作
1. 自生成替代信号(Proxy Signals)无 Ground Truth 时,模型自身估计也包含额外信息Majority Voting → 伪 Ground Truth
2. 自对弈/环境信号(Self-play / Weak Signals from Environment)从外部环境获取弱监督信号RLVR、Zero 对抗训练
3. Test-Time Training(TTT)将 Inference 过程等同于梯度下降DeltaNet、TTT 架构
4. Continual Learning(持续学习)学新任务同时不遗忘旧任务Memory Replay
5.3 替代信号(Ground Truth → Proxy Signals)

核心直觉

  • 例如问模型“桌上有几个苹果”,模型不知道正确答案但会说“4/5/6 的概率更大”,那么这个估计本身就提供了有用信息
  • 可以惩罚模型输出 1/2/3,鼓励输出 4/5/6
  • 即使没有外部 Ground Truth,模型内部信号仍有学习价值

经典统计学例证(Semi-Supervised Learning)

  • 只有标注数据时,分类线取决于标注点
  • 加入未标注数据点后,决策边界可被画得更精确、更接近真实分布
  • 结论:未标注数据依然有用——这是该方向的根本动机

近期代表:Test-Time Reinforcement Learning(TT-RL)

  • 通过 Majority Voting 获得伪 Ground Truth
  • 基于这些伪标签构造 Reward 来训练模型
5.4 自对弈与环境信号(Self-play & Weak Signals)

核心机制:信号从环境/对手中获得,而非模型内部。

代表机制
标准 RLVR(可验证奖励强化学习)用可验证的 Reward(如代码运行结果)校验回答,监督训练
Zero(对抗训练)两个模型互相博弈、互为“环境”,在对抗中交替提升

本质:当一个智能体的外部监督信号越来越弱时,它从环境(包括对手)获取信息来训练自身——这也是一种“无 Ground Truth”的学习。

5.5 Test-Time Training(TTT)

核心阐述:TTT 本质上是一种 架构(Architecture),而非学习算法。

数学关键:TTT 的 Inference 过程在数学上完全等价于做梯度下降

推理时每预测一个 next token,就是在对知识空间做一次梯度下降。预测次数足够长时,就相当于在朝真实目标做优化。

代表工作

  • DeltaNet(更重要):第一个将“推理等价于梯度下降”引入该领域的工作;是 Linear Attention 的一种变体
  • TTT:DeltaNet 的扩展——引入非线性信息

推荐资源:Young Kim 的 Slides、Santra 的 Block-G 有很好的讲解。

5.6 Continual Learning(持续学习)

传统定义

  • Task 0 → 训练好猫分类模型
  • Task A → 学习狗分类
  • Task B → 学习车分类
  • 核心要求:获得新能力的同时不遗忘旧能力

现状判断

  • 唯一被验证有效的方法是 Memory Replay(训练狗时加入部分猫的数据;训练车时重放猫狗的数据)
  • 架构类方法在大规模数据下效果有限
  • 传统意义下的 Continual Learning 工作已越来越少、声音越来越小

重要演变:LLM 时代,Continual Learning 的含义已发生迁移——越来越接近 Self-Improving、Artifact Improvement、Harness Improvement。词还在,但含义已变

5.7 术语演变的元观察

“Mechanics are more durable than names.”(机制比名称更持久)

  • Multimodal 一词:2017 年指 Caption/CLIP → 2023 年指 VLM(如 GPT-4V)→ 现在指 Unified Model 或 Real Generation
  • Continual Learning:从 Spatio-Temporal 到 Online Adaptation,再到 Self-Evolving Agents
  • 结论:我们一边发明新名词,一边赋予旧名词新含义。讨论时应明确所指含义,这是必要的。

6. 三者统一:反馈循环与趋势

6.1 完整循环
更好的模型 → 更好的 Harness → 更好的 Artifacts
                ↑                    ↓
              (优化反馈)     ← 产物/轨迹作为奖励信号
  • 更好的模型能产生更好的 Harness
  • Harness 改进后产生更好的 Artifacts
  • Artifacts 产生的结果作为奖励/轨迹反馈给模型,提升模型
6.2 边界融合

这三个类别的边界正在模糊化(Blurring),趋势是统一优化三者。

代表工作:SA(Self-Adapting)——同时优化 Harness 与权重,是最早尝试打破分类边界的工作之一。

6.3 抽象层级的提升

人类不断在提高自己的抽象层级:

Coding(单词级)→ 代码片段 → Function → Project

从微观层到越来越宏观的抽象控制,人只关心更高层级的决定。 下一个好的抽象:模型 + Harness + Artifact 的三者联合优化,而非单独某一类。

7. 总结与未来预测

  1. 分类框架:Self-Evolving Agents 分为 Model、Harness、Artifact 三类
  2. 边界模糊:词与词、类别与类别之间的界限逐渐模糊,趋向统一优化
  3. 虚拟世界已成熟:凡是可验证的任务,模型可以比人优化得更快
  4. 下一个主战场:真实世界——将 Agent 应用于真实世界的 Pipeline,因为 Real World 是现在最困难的环境

8. 问答与讨论精选

Q1:Jarvis 与文本梯度下降(Text Gradient)的区别?
  • Text Gradient 有多个流派:
  • 偏向参数/数值流派:模拟梯度下降方向的文本方法,置于标准梯度下降框架下
  • 偏向启发式流派:更像早期遗传算法/演化学习,不属于标准梯度框架
  • Jarvis 更像启发式方法(Heuristic),是一种无梯度优化;Text Gradient 的某些工作更接近模拟数字梯度的标准框架
  • 两者在更高层都是设定目标、进行优化的通用优化方法
Q2:AI 评审给出拒绝意见时,智能体会缩窄研究范围而非创造性改变设计,这一观察是否成立?
  • 主持人观察确认:AI 写 Rebuttal 时倾向于承认所有错误并最小化 Claim 范围,产出的回复往往“不能用”
  • 刘世龙解释:这种现象可能存在,原因有二:
  1. 保守策略:缩小 Scope 更容易“中”,人类面对 Reviewer 时也会如此做——Agent 模仿了人类行为
  2. 目标定义问题:Agent 的目标是“产出一篇论文”,过程中“价值”不是最高优先级
  3. Reward 偏差:Review 文本本身是一种约束性 Reward;人类希望模型同时“论文更强”和“解决 Rebuttal 问题”,但这部分 Reward 不包含在 Review 评论中——存在隐含的 Reward Function 未外化
Q3:Evaluator(评价器)在整个 Self-Evolving 中处于什么地位?
  • Evaluator 是最重要的事情:在自我进化系统中,评价器(Verifier)是产生 Evaluation Function 的组件
  • 核心观点:对模型而言,优化本身并不难;难点在于设定正确的目标
  • 做好 Evaluation、好的 Benchmark、提出好的问题——这些才是最难最有价值的部分
  • 这也是为什么近期 LLM Benchmark 文章特别多——合理现象
Q4:Self-Evolving 在目前路径下的天花板是什么?

回答:环境(Environment)是最大的瓶颈。

  • Model 与 Harness 的能力可以预期持续提升(外界公司也在推动)
  • 但限制整体系统的核心因素在环境:
  • 虚拟世界中:是否有可扩展的标准化环境
  • 真实世界中:是否能获得及时反馈,校验是否足够快,以及数据效率问题
  • Evaluator 和环境共同构成一个 Benchmark——Benchmark 的定义本身就是终极难题

追问:Benchmark 满分是否合理?

  • 满分是过于苛刻的要求;更有意义的目标是比较结果(例如比人更好或更快)
  • Benchmark 本身也有偏差——Ground Truth 往往由人类定义
  • 多数领域没有严格 Ground Truth,只能以人为对照
  • “天花板就是人的注意力时间”——人类无法完整逐字审核 AI 生成的论文和代码
Q5:对 Harness 与 Model Weight 联合进化有什么看法?
  • 目前工作仍非常早期,代表如 SA(同时优化 Harness 与权重)
  • 技术上存在困难:Model 用梯度优化,Harness 是非梯度优化——结合有挑战
  • 从抽象层级看,联合优化是值得探索的方向

关于最优 Harness 是否存在的问题:

  • “最优”需与 Benchmark 绑定;给定 Benchmark 后,就可以像学习一样找到一个更好的 Harness
  • 全局最优极难达到,但可以持续寻找更优的 Harness
  • 实验经验:同一模型下,Harness 带来的知识上限受 Model 本身能力限制——Harness 优化更多是对任务格式、说话方式的适应,无法超越 Model 的知识天花板
  • 关键问题:如何激励模型去探索——Harness 优化容易很快固定在一个方向;需要鼓励模型在 Exploitation 前多探索(类似 RL 中的 Exploration vs. Exploitation),从而进一步提升
Q6:研究 Self-Evolving 是否有领域/任务/数据集的限定?
  • 学术研究(Harness/Model 方向):使用相对传统的知识密集型 Benchmark;可从已有论文中找到一脉相承的 Benchmark 体系
  • Artifact 方向:面向实际场景,不同场景有不同 Benchmark(如 Kernel Optimization 有自己的标准)
  • 核心原则:Self-Evolving 一定要优化“什么”,所以必须有对应的验证基准
  • 建议:如果某一领域缺乏好 Benchmark,提出 Benchmark 本身就是极有意义的工作
Q7:现有的 Benchmark 是否能充分衡量 Self-Evolving 能力?
  • 可以衡量演化效率(例如模型在 Benchmark 上提升的速度/Delta),而非仅看 Benchmark 绝对分数
  • 真实世界中的大量任务未被现有 Benchmark 覆盖——但目前 Self-Evolving 研究的核心目标是解决真实任务本身

关于模型自身的品味(Taste):

  • 好研究者的关键能力是能自我判断(“我写的东西好不好”)
  • 这不完全依赖外部 Reward Function——内在的 Reward Function 可能更强
  • 类比:人的写作能力提升常始于 Review 别人的论文——先建立好的 Reviewer 能力,再提升生成能力
  • 即:可能要先训练好 Discriminator,再训练 Generator;先做好 Benchmark/Evaluator 再提升模型
Q8:Harness 是否是过渡性产物?

是,但并非完全被替代。

  • 能被吸收进模型的(“被吃掉”的):Rubric、规则、“Let's think step by step”等提示词技巧——已逐步融入模型能力
  • 不能被吸收的:Memory 设计(模型 Context 有限)、Tools(网络搜索需工具执行)、Context 管理、外部环境接口
  • 规律:越 specific(针对该模型定制设计)的东西越容易被吸收进模型;但模型始终不能做到所有事情——外层 Harness 将永远有效
  • 演进模式:Harness 不断被吸收为模型能力 → 产生新的更高级 Harness → 再被吸收——这本身就是一种自我进化
Q9:模型自身 Knowledge 是否很小?RAG 是否提供了大部分知识?
  • 模型 Knowledge 绝不小——现代模型的参数量决定了其知识远超任何个人
  • RAG 从业者说模型 Knowledge 小,有其推广 RAG 的动机
  • 但模型 Knowledge 确实不完整:仅限于训练截止时间之前的知识,之后的新知识没有
  • 这正是 Harness 存在的意义——需要一种机制提供新信息
  • 重要区分:Harness 提供的不一定是“知识”,但信息是重要的——其核心价值在于与外界交互的方式

行动清单

  • [ ] 区分 Self-Evolving 工作中的具体类别:是 Model、Harness 还是 Artifact 优化?
  • [ ] 判断任务是否满足“可快速验证”条件——满足则可考虑用自我进化智能体解决
  • [ ] 评估单 Agent 的 Context 管理极限,必要时转向 Multi-Agent 架构
  • [ ] 重视 Evaluator 设计——好的评价体系比优化本身更重要
  • [ ] 关注从虚拟世界到真实世界的迁移挑战(验证困难、反馈延迟、数据效率)