CuteNote
颜值笔记
价格
反馈
中 / EN
登录
中 / EN
登录
← 返回
生成耗时 17秒
耗时
查看原链接
原链接
导出脑图
导出
Bilibili
1小时32分21秒 · —
Harness Engineering 驾驭工程 · 笔记
长图
脑图
Markdown
原文
AI 问答
驾驭语言模型:Harness Eng
ineering
核心结论
通过设计工具、规则和流程来引导语
言模型完成任务,而非仅靠提示词。
引言:故事开篇
期末前轻松课
通过故事讲解harness工程
语言模型不是不聪明
可能只是缺乏人类引导
Gemma 4 2B模型实验
开源小型模型可在终端运行
任务:修复PaaS.py中的b
ug
模型不知道文件在附近,幻想编写
文件
添加引导后,模型正确使用工具完
成任务
什么是Harness Engine
ering
AI agent的组成
核心是语言模型
外围是工具和框架(harnes
s)
harness的比喻
马具、驾驭
控制模型的马鞍和缰绳
与prompt和context工
程的关系
prompt工程:改进输入文本
context工程:提供相关信
息
harness工程:多轮交互中
完成任务
控制认知框架
通过自然语言规则
类似法律,影响模型行为
规则文件如AGENTS.md
OpenClaw的AGENTS.
md
每次对话前读取
设置行为准则和记忆存储
AGENTS.md的实际效果
加速任务完成,减少token
但可能不总是有效,甚至有害
设计原则
像地图,而非百科全书
避免占据过多上下文
控制能力边界
通过限制工具
工具决定模型能做什么
例如OpenClaw与Clau
de Work区别
工具影响能力
SWE-agent实验
适合人类的工具不必然适合模型
工具设计要点
模型喜欢命令行和JSON结构
为AI设计合适接口
标准工作流程
规划-生成-评估
planner拆解任务
generator执行
evaluator检查
生成器与验证器协作
先定合同再执行
提高一致性
自我反思循环
模型输出反馈后迭代
反馈可来自编译器或实验结果
反馈与学习
反馈推动改进
语言模型根据反馈调整输出
类似梯度下降,但参数不变
反馈类型
标准答案(难取得)
数值奖励(中等)
口头反馈(容易但模糊)
反馈的有效性
随机反馈反而有害
模型确实依赖反馈调整
情绪影响
过度责备降低表现
期望信号影响行为
长期AI agent的挑战
寿命问题
需要整理记忆
Claude的to dream
功能
持续学习
从交互中积累skill
参数更新与口头反馈
自动更新harness
实验:让模型教另一个模型
修改AGENTS.md提升成绩
实验:教会笨模型
首页
登录
我的