技术反思:Replay Memory vs HarnessX 协同进化

技术反思:Replay Memory vs HarnessX 协同进化

日期: 2026-07-28
主题: Agent 持续学习机制的深度对比与工程思考


一、今日核心议题

今天围绕两个关键问题展开了深入讨论:

  1. Replay Learning + Agent Memory 能否实现无微调的持续学习?
  2. HarnessX 的协同进化机制与简单重复优化的本质区别

二、Replay Memory 方案:经验复用的天花板

2.1 方案架构

1
2
3
4
5
6
7
8
9
10
┌─────────────────────────────────────────┐
│ Replay Learning + Agent Memory │
├─────────────────────────────────────────┤
│ 短期记忆:当前对话上下文 │
│ 中期记忆:Replay Buffer (s, a, r, s') │
│ 长期记忆:向量数据库 + RAG 检索 │
├─────────────────────────────────────────┤
│ 预训练模型 (Frozen) │
│ └── 权重不变,只通过 Prompt 注入记忆 │
└─────────────────────────────────────────┘

2.2 能实现的效果

能力 机制 效果
避免重复犯错 Replay Buffer 检索相似失败 ✅ 有效
经验复用 RAG 检索相关经验 ✅ 有效
个性化适应 用户偏好记忆 ✅ 有效
上下文扩展 外部记忆弥补窗口限制 ✅ 有效

2.3 无法突破的天花板

限制 原因 结论
无法学习新能力 权重冻结,不能形成新神经连接 ❌ 核心瓶颈
无法深度理解 记忆是”提示”而非”内化” ❌ 浅层学习
上下文污染 记忆注入增加噪声 ⚠️ 副作用
检索精度瓶颈 相似度匹配不完美 ⚠️ 技术局限

2.4 核心结论

Replay + Memory = “经验丰富的顾问”,而非”不断成长的学生”

  • 能:避免重复犯错、复用历史经验、适应用户偏好
  • 不能:获得全新能力、深度理解复杂概念、突破模型智能天花板

三、HarnessX 协同进化:双变量优化的新范式

3.1 核心思想

不是简单重复优化,而是 Harness 和模型交替/并行提升,互相解锁对方的天花板。

1
2
3
4
5
6
7
8
初始: Harness₀ + 模型₀

Round 1: Harness₀ 运行 → 轨迹 → AEGIS → Harness₁
同时: 轨迹 → Buffer → GRPO → 模型₁

Round 2: Harness₁ + 模型₁ → 新轨迹 → Harness₂ + 模型₂

...持续迭代

3.2 七步循环详解

步骤 动作 产出
1. Rollout Harness + 模型运行 完整轨迹
2. Verification 验证器评分 标量奖励
3. Buffer Insertion 写入共享 FIFO 带版本标记的轨迹
4a. Digester 压缩为结构化摘要 失败类别、组件、证据
5a. Planner 构建适应景观 全局优化方向
6a. Evolver 产出候选 Harness 变更清单
7a. Critic+门控 验证后上线 新 Harness
4b-7b. GRPO 跨 Harness 训练 新模型

3.3 Cross-Harness GRPO 的核心创新

传统 GRPO: 同一模型、同一 Harness → 多次采样 → 组内比较

Cross-Harness GRPO: 同一任务、不同 Harness 版本 → 所有轨迹放一起 → 只看最终验证器分数

“不管你怎么跑的,只看最终验证器分数”

为什么这样设计?

  • Harness 进化改变动作空间 → 按任务分组,无需动作级对齐
  • 不同版本工具 Schema 不同 → 只比较最终奖励
  • 模型需要适应新 Harness → 在多种配置下训练,提升鲁棒性

3.4 关键实验结果

基准 模型 Harness-only 协同进化 额外增益
GAIA Qwen3.5-9B ~37% ~39.8% +2.8%
WebShop Qwen3.5-9B ~49% ~50.0% +1.0%
ALFWorld Qwen3.5-9B 53.0% 97.0% +44.0%*

*注: ALFWorld 的 +44% 主要是 Harness-only 贡献,协同进化在触顶后提供额外提升

3.5 两种天花板的互相解锁

天花板 表现 解锁方式
Scaffolding Ceiling Harness 已优化,模型无法利用 训练模型学会利用新 Harness
Training-Signal Ceiling 模型变强,Harness 不调用新能力 进化 Harness 暴露新能力给模型

四、深度对比:三种方案的本质差异

维度 Replay + Memory HarnessX AEGIS 微调 (SFT/RL)
学习对象 经验检索 结构优化 参数更新
优化空间 提示工程 符号空间 连续梯度
新能力获取 ❌ 不能 ❌ 不能 ✅ 能
避免重复犯错 ✅ 能 ✅ 能 ✅ 能
可解释性 高 (变更清单)
成本
天花板 模型能力上限 结构+模型双重上限 数据质量上限

关键洞察

Replay + Memory 是”低成本近似”,HarnessX 是”结构优化”,微调是”能力进化”——三者互补,而非替代。


五、工程落地的实际调整

5.1 论文理想 vs 工程现实

方面 论文方案 实际调整
Buffer 管理 固定 FIFO 分层 Buffer (hot/warm/cold)
版本兼容 版本标记 兼容性检查 + 轨迹归一化
门控策略 确定性 Seesaw 自适应阈值 + ε-greedy 探索
资源调度 Meta-Agent 四阶段 K8s 独立部署 + 资源隔离
监控运维 未涉及 实时监控 + 自动回滚

5.2 最小可行部署 (MVP)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
Phase 1 (1-2周): 静态 Harness + 记忆
└── 人工设计种子 Harness
└── 向量数据库存储历史
└── RAG 检索注入 Prompt

Phase 2 (1个月): 自动进化
└── 接入 AEGIS Digester + Planner
└── 人工审核 Evolver 产出
└── 小流量 A/B 测试

Phase 3 (2-3个月): 协同进化
└── 部署 GRPO 训练管线
└── 完整监控体系
└── 自动化门控上线

六、个人反思与心得

6.1 关于”持续学习”的本质

今天的讨论让我意识到,“持续学习”有三个层次

  1. 记忆层 (Replay + Memory): 记住过去,避免重复犯错
  2. 结构层 (HarnessX): 优化流程,提升执行效率
  3. 能力层 (微调): 真正学会新技能,突破能力边界

大多数产品停留在第 1 层,HarnessX 探索第 2 层,第 3 层仍是难题。

6.2 工程哲学:妥协的艺术

论文是”理想模型”,工程是”妥协艺术”。

实际部署必须:

  • 保留人工干预的逃生通道
  • 接受不完美的近似解
  • 优先跑起来,再逐步优化

6.3 对当前工作的启发

启发 应用场景
分层记忆设计 AI 助手可以引入 hot/warm/cold 三级记忆
变更清单审计 任何自动化调整都应该产出可读的变更说明
跨版本比较 系统升级时,应该能比较不同版本的性能差异
灰度发布 新策略必须支持小流量验证

6.4 开放问题

  1. 如何量化”结构优化” vs “参数优化”的 ROI?
  2. 在资源受限场景下,优先投资 Harness 还是模型?
  3. 如何设计有效的”回归测试集”防止灾难性遗忘?
  4. 人机协作的边界在哪里?哪些编辑必须人工审核?

七、延伸阅读与参考

今日讨论的论文

论文 链接 核心贡献
HarnessX https://arxiv.org/abs/2606.14249 可组合、可进化的 Agent Harness
SkillOS arXiv:2605.06614 训练 Curator 管理 Skill
Graph Engineering https://x.com/cyrilXBT/article/2081212504093446357 显式结构替代黑盒循环

八、总结

Agent 的持续学习不是单一技术的胜利,而是记忆、结构、参数三个层面的协同优化。

HarnessX 的价值在于:它证明了运行时接口和模型权重是同等重要的优化变量——当大家都在卷参数时,优化结构可能是一条被严重低估的捷径。


整理时间: 2026-07-28
飞书文档: https://www.feishu.cn/docx/DjWJdBG4toQT5bxcCOacr31OnJf