AI 数字员工核心突破:可审计、自适应的记忆重构技术详解

关键词追踪「{‘type’: ‘keyword’, ‘name’: ‘数字员工’}」 原文链接: https://mp.weixin.qq.com/s?src=11&timestamp=1785668439&ver=6880&signature=c80j8MJRwPqfXvSj3-Et5LoPWkU70Z53r3lrkDxf7ICNJSqm4DqPmAygwW1mPKXSF1aL3*qgzTNp2RThd-31aLGGdXJdFmHk9llpy8f2uvqALGkgNTUaZ3vzhJQJ7tg*&new=1 发布时间: 2026-08-02 02:13 监控类型: 关键词追踪


核心观点

  1. A:大多采用记忆原文复现范式,历史经验与当前环境状态不匹配,造成知识负迁移;技术路线割裂,外置记忆可追溯但无自适应能力,参数化记忆适配场景却无法溯源调试;纯强化学习无记忆,试错样本与算力消耗巨大。

  2. A:借鉴人类重构式认知记忆,在检索与动作间新增显式评判重构环节;单一流策略依托 GRPO 端到端训练,无需人工标注,自动对比历史、当前环境,修改适配或直接淘汰不适用记忆,兼顾外置记忆可追溯性与参数模型自适应能力。

  3. A:一是过滤环境不匹配记忆,消除负迁移噪声;二是训练阶段提供隐性推理监督,提升模型原生逻辑能力,无记忆输入时性能仍优于普通 RL 基线;三是大幅提升分布外陌生环境泛化鲁棒性。

  4. A:使用 7B 开源小模型,支持私有化部署,降低企业大模型调用成本;记忆存储向量库可审计、单点纠错,满足合规要求;适配动态变化的真实业务,减少模型重复训练;无需海量标注,缩短业务冷启动周期,一套框架覆盖机器人、数字员工等多类自动化场景。

  5. A:推理阶段会同步读取记忆原始生成状态,与实时环境精细比对,主动识别场景差异;对失效记忆直接标记为空、改用自主推理,不会照搬过时经验引入错误操作,因此在未见过的新布局、新业务规则下保持高任务成功率。

  6. 吴荣 ¹・²、付道成 ²・³、温立成 ²・⁴・⁵、杨学猛 ²、邹舒⁶、梅建标 ²、王宇鑫⁷、张海荣 ²、杨宇 ¹・²、胡涛 ²、张聪 ¹、施博天 ²、蔡品龙†・²¹ 浙江大学、² 上海人工智能实验室、³ 复旦大学、⁴ 上海创新研究院、⁵ 上海交通大学、⁶ 澳大利亚国立大学、⁷ 中国科学技术大学† 通讯作者发布日期:2026 年 7 月 31 日开源项目地址:https://github.com/KnowledgeXLab/MemHarness


全文

A:大多采用记忆原文复现范式,历史经验与当前环境状态不匹配,造成知识负迁移;技术路线割裂,外置记忆可追溯但无自适应能力,参数化记忆适配场景却无法溯源调试;纯强化学习无记忆,试错样本与算力消耗巨大。

A:借鉴人类重构式认知记忆,在检索与动作间新增显式评判重构环节;单一流策略依托 GRPO 端到端训练,无需人工标注,自动对比历史、当前环境,修改适配或直接淘汰不适用记忆,兼顾外置记忆可追溯性与参数模型自适应能力。

A:一是过滤环境不匹配记忆,消除负迁移噪声;二是训练阶段提供隐性推理监督,提升模型原生逻辑能力,无记忆输入时性能仍优于普通 RL 基线;三是大幅提升分布外陌生环境泛化鲁棒性。

A:使用 7B 开源小模型,支持私有化部署,降低企业大模型调用成本;记忆存储向量库可审计、单点纠错,满足合规要求;适配动态变化的真实业务,减少模型重复训练;无需海量标注,缩短业务冷启动周期,一套框架覆盖机器人、数字员工等多类自动化场景。

A:推理阶段会同步读取记忆原始生成状态,与实时环境精细比对,主动识别场景差异;对失效记忆直接标记为空、改用自主推理,不会照搬过时经验引入错误操作,因此在未见过的新布局、新业务规则下保持高任务成功率。

吴荣 ¹・²、付道成 ²・³、温立成 ²・⁴・⁵、杨学猛 ²、邹舒⁶、梅建标 ²、王宇鑫⁷、张海荣 ²、杨宇 ¹・²、胡涛 ²、张聪 ¹、施博天 ²、蔡品龙†・²¹ 浙江大学、² 上海人工智能实验室、³ 复旦大学、⁴ 上海创新研究院、⁵ 上海交通大学、⁶ 澳大利亚国立大学、⁷ 中国科学技术大学† 通讯作者发布日期:2026 年 7 月 31 日开源项目地址:https://github.com/KnowledgeXLab/MemHarness

调取过往交互经验已经成为提升大语言模型智能体性能的通用手段。但现有的绝大多数记忆增强型智能体,都会将检索得到的历史经验视作静态文本逐字原样复现,直接塞进上下文,完全不考量这段经验是否适配智能体当下所处环境。这种「直接复现」范式存在明显缺陷:存储的经验具备抽象、通用的特性,而智能体做决策时面对的环境状态具体多变,二者天然存在落差,极易造成知识负迁移。

反观人类的记忆回忆机制:我们几乎不会一字不差复述过往经历,而是结合当下场景对调取的记忆重新组织、适配,再以此指导自身行为。受人类认知规律启发,本文提出 MemHarness 框架,让大语言模型智能体能够结合当前环境主动利用、重构历史经验。在每一步决策流程中,统一策略模型会以当前环境状态为条件,对检索到的经验进行评估与重构,生成贴合当下场景的行动指引后再执行动作。这套记忆重构能力无需人工标注数据,仅通过分组相对策略优化(GRPO)开展端到端训练就能自然习得。

本文在 ALFWorld(具身家庭交互任务)、WebShop(线上购物交互任务)两大标准测试集上完成实验。结果显示,MemHarness 性能大幅超越纯强化学习基线模型、以及采用静态记忆复现方案的主流记忆增强智能体,在分布外(OOD)陌生环境中也具备极强鲁棒性。进一步分析表明:记忆重构优化目标不仅能避免知识负迁移,还会在训练阶段提供隐性指导,从根本上提升智能体原生逻辑推理能力。

大语言模型(LLM)已展现出强大能力,可作为自主智能体完成各类序列决策任务。经验记忆模块能够让智能体复用过往成功操作、避免重复犯错,进一步拓展智能体能力边界。

但目前绝大多数搭载记忆模块的智能体都遵循逐字复现的设计思路:检索得到的交互轨迹、提炼的行为准则会被当成静态素材,直接输入模型上下文。这种设计混淆了「语义相关」和「动作层面可用」两个概念:一段记忆哪怕在语义上和任务高度匹配,也未必适用于当前交互场景 —— 这段经验是在完全不同的环境条件下形成的。

另有一类研究将历史经验直接内化进模型参数,无需显式回放记忆就能生成适配环境的行为。但这类参数化记忆方案存在短板:底层经验、经验对决策产生的影响全部隐式存在,无法溯源、也无法人工修改。外置记忆库虽然能完整追溯每一条历史经验,但普遍缺少自适应复用经验的机制。由此我们找到了一条折中优化路线:保留可核查、可溯源的外置记忆,同时根据当前环境动态重构记忆内容。

这条思路和认知科学领域的经典结论完全契合:人类记忆的本质是重构式,而非复刻式。回忆行为不会调取一段一成不变的历史记录;而是结合当下环境线索、自身已有知识对记忆解读、重组,再以此指导行为。如图 1 所示,传统智能体流程为「检索记忆→直接生成动作」,而人类记忆会多出一层评估、适配记忆的中间处理步骤。这为记忆增强型智能体指明了范式革新方向:从「检索 + 复现」转变为「检索、评估、重构」。

三种记忆使用范式对比

受人类记忆重构机制启发,本文将记忆引导的决策流程拆解为五大阶段,完整复刻人类记忆逻辑:

基于这套流程,我们设计 MemHarness 框架:在记忆检索与动作生成两个环节之间,显式插入记忆评判、重构流程,把原本只是静态提示文本的记忆,转化为适配实时场景的动态行动指引。

MemHarness 融合了外置记忆与参数化记忆两类方案的优势:一方面保留可逐条溯源、可归因的检索经验;另一方面依靠单一策略模型,通过参数化实现基于环境状态的记忆评判与重构。单步决策完整流程:智能体基于当前观测,对比检索记忆对应的原始历史环境,完成记忆重构后,再生成可执行动作。

核心亮点:这套记忆重构能力无需额外人工标注数据,仅依靠 GRPO 端到端训练即可习得。模型以任务成功为最终优化目标,自主学习区分式重构策略:保留适配场景的记忆、改写具备误导性的内容,抹平历史经验与当下环境之间的鸿沟。

本文在两项高难度交互式决策基准任务上验证 MemHarness 效果,模型性能持续优于纯强化学习基线、以及当前最优的静态记忆增强模型。消融实验证明:移除重构模块后,模型性能会直接退化至朴素记忆复现方案水平,证明自适应重构是性能提升的核心来源,而非检索模块。

大模型智能体依靠 ReAct 等提示工程范式完成交互任务,通常搭配规划、自我反思模块进一步优化效果。但这类仅靠提示、无需微调训练的方案,性能上限会被模型原生能力限制。

为了从交互数据中习得专属任务技能,现有研究采用监督微调或强化学习(RL)优化智能体。虽然强化学习能够直接优化决策质量,但标准强化学习框架缺少显式机制,无法积累、复用不同交互轮次的历史经验,记忆增强型智能体由此应运而生。

记忆增强智能体通过检索过往交互记录、提炼通用经验规律,解决纯强化学习无法复用历史经验的短板。多数记忆方案依赖冻结的基础模型策略;另一类思路直接把经验内化进模型权重,但代价是失去外置记忆可追溯的优势。近期有研究将外置记忆库与强化学习结合,但全部采用逐字直接注入检索经验的方式。而交互式任务的环境状态变化幅度极大,直接复现记忆极易引入和当前场景不匹配、具备误导性的指引。

MemHarness 融合两类方案优势:保留完整可溯源的外置记忆库,同时用强化学习参数化实现基于实时环境的记忆重构。我们不会盲目套用检索到的记忆,而是通过端到端优化,让模型自主评判、改写历史经验,生成贴合当前场景的专属指引后再执行动作。

我们将交互式决策任务建模为部分可观测马尔可夫决策过程 (M=(S, A, O, P, R)),其中 S、A、O分别代表状态空间、动作空间、观测空间;P为环境状态转移函数,R为奖励函数。给定任务描述 (\mathcal{T}),在第 t步智能体观测到 (o_t),并通过策略 (\pi_\theta)选取动作 (a_t)。针对环境部分可观测的特性,策略会融合近期交互历史窗口 (h_t = (o_{t-w+1}, a_{t-w+1}, …, o_{t-1}, a_{t-1}, o_t))作为输入。整体优化目标是最大化智能体单轮交互的期望累积奖励:

(\mathbb{E}{\pi{\theta}}\left[\sum_{t=1}^{T} R(s_t,a_t)\right])

智能体维护记忆库 (\mathcal{B}={m_i}_{i=1}^N),训练过程中会周期性将交互轨迹提炼为自然语言形式的经验存入库中。每一条记忆条目 (m_i=(e_i, o_i^{src}))包含抽象策略 (e_i)、以及该经验产生时对应的原始观测 (o_i^{src})。本文沿用 EvolveR 的记忆管理方案:对记忆做语义去重、统计每条记忆的实际使用价值,并定期剔除低价值条目。基于当前上下文生成检索查询 (q_t)后,检索器 (\mathcal{R})返回相似度最高的前 k 条记忆:

(\mathcal{E}_t = \mathcal{R}(q_t, \mathcal{B}), \quad |\mathcal{E}_t|=k)存储的原始观测 (o_i^{src})用于重构阶段,对比历史环境与当前环境的差异。

传统逐字复现范式,会直接将检索到的记忆作为动作生成输入:

(a_t \sim \pi_\theta(\cdot | \mathcal{T}, h_t, \mathcal{E}_t))MemHarness 则增加记忆重构前置步骤,先将原始记忆转化为场景专属指引,再生成动作:

其中函数 f将原始重构输出 (g_t)转化为最终可用指引 (\tilde{g}t),包含舍弃完全不匹配记忆的逻辑。记忆重构、动作生成两个步骤共享同一套统一策略 (\pi\theta)。

本文提出 MemHarness,一套基于强化学习的框架:不对检索到的经验原样复现,而是基于当前环境完成重构。完整推理流程分为三大阶段(图 2),对应 1.1 节提出的五阶段决策模型:交互历史窗口 (h_t)对应环境观测环节,记忆评判逻辑内嵌在重构阶段中。

MemHarness框架总览

记忆检索阶段第 t步,智能体根据交互历史 (h_t)判断是否需要向经验记忆库 (\mathcal{B})发起检索。若触发检索,系统返回多条相关经验 (\mathcal{E}_t);这些经验不会直接送入动作上下文,而是进入重构流程处理。

上下文记忆重构阶段策略模型 (\pi_\theta)对比检索经验对应的原始环境与当前交互历史 (h_t),生成适配当前场景的指引 (g_t):保留可复用知识,舍弃或改写不匹配内容。

动作生成阶段同一策略模型 (\pi_\theta)结合交互历史 (h_t)、重构完成的指引 (\tilde{g}_t),生成可执行动作 (a_t)。

MemHarness 将记忆重构、动作生成拆分为两个独立步骤,但二者共享一套策略参数。由于不存在重构过程的人工标注真值,整套「检索 - 重构 - 动作」流程仅依靠任务奖励开展端到端 GRPO 训练。下文详细介绍重构机制与优化方案。

MemHarness 通过显式重构流程,将检索到的历史经验转化为适配当前场景的行动指引。从历史轨迹提炼的经验可能过时、和当前环境冲突,因此策略会先评估经验适用性,再将其用于动作生成。

重构阶段输入文本由任务描述 (\mathcal{T})、当前交互历史 (h_t)、全部检索记忆元组 ((e_{t,i}, o_{t,i}^{src}) \in \mathcal{E}_t)拼接而成:

(x_{recon} = \mathcal{T} \oplus h_t \oplus \bigcup_{i=1}^k \left(e_{t,i}, o_{t,i}^{src}\right))其中 (e_{t,i})为单条检索经验,(o_{t,i}^{src})为该经验对应的原始观测;符号 (\oplus)代表文本拼接。策略基于该输入生成重构内容:

(g_t \sim \pi_\theta(\cdot | x_{recon}))

模型逐条对比每条记忆的原始观测与当前交互历史 (h_t),识别环境状态差异,对检索经验执行保留、修改或舍弃操作,输出场景专属指引。若判定所有检索经验均不适用,模型输出标记。最终送入动作生成环节的指引定义为:

其中 (p_{self})代表无记忆指引的兜底逻辑,指令智能体仅依靠自身推理完成决策。

同一套策略模型结合重构后的指引生成可执行动作:

(a_t \sim \pi_\theta(\cdot | \mathcal{T}, h_t, \tilde{g}_t))动作生成环节的输入要么是经过适配改写的记忆,要么是纯自主推理结果,而非未经过滤的原始历史记录。记忆重构、动作生成共享参数 (\theta),二者联合优化。由于重构输出 (g_t)不存在人工标注真值,我们将其视作隐式推理过程,仅依靠任务级奖励完成整套流程的端到端训练。

重构指引 (g_t)属于无真值监督的隐变量,因此我们采用强化学习端到端优化「检索 - 重构 - 执行」完整流程。模型奖励融合任务最终结果、格式约束两类信号,确保重构输出、动作输出符合规范格式。本文选用分组相对策略优化(GRPO),基于多组采样轨迹计算优势值,无需额外训练价值网络。

单条交互轨迹 (\tau_i)的奖励 (R(\tau_i))主要由稀疏任务结果决定(任务失败得 0 分,成功得 10 分),叠加小幅格式约束奖励:

(R(\tau_i) = R_{outcome} + 0.1 \times R_{format})格式分数 (R_{format} \in [0,1])均等加权三项约束:

针对每项任务,我们采样一组共 G条交互轨迹 ({\tau_i}_{i=1}^G)。GRPO 基于分组归一化计算优势值:

(A_i = \frac{R(\tau_i) - \text{mean}\left({R(\tau_k)}{k=1}^G\right)}{\text{std}\left({R(\tau_k)}{k=1}^G\right)})整条轨迹对应的优势值 (A_i)分配给轨迹内所有文本 token,推理、重构、动作生成环节共享同一信用分配。对轨迹内第 i条样本的第 j个 token,重要性权重比定义为:

(r_{i,j}(\theta) = \frac{\pi_\theta\left(y_{i,j} \mid y_{i,<j}\right)}{\pi_{\theta_{old}}\left(y_{i,j} \mid y_{i,<j}\right)})裁剪替代损失项为:

(\mathcal{L}{i,j}^{CLIP}(\theta) = \min\left(r{i,j}(\theta)A_i,\ \text{clip}\left(r_{i,j}(\theta),1-\epsilon,1+\epsilon\right)A_i\right))完整整体优化目标:

(\mathcal{J}(\theta) = \mathbb{E}\left[\frac{1}{\sum_i |\tau_i|}\sum_{i=1}^G \sum_{j=1}^{|\tau_i|} \Big(\mathcal{L}{i,j}^{CLIP}(\theta) - \beta \mathbb{D}{KL}\big[\pi_\theta \parallel \pi_{ref}\big]\Big)\right])式中 (\epsilon)控制裁剪阈值,(\beta)控制 KL 散度正则项权重。该目标联合优化记忆重构、动作生成两大模块,共享同一条轨迹级奖励信号。

本章在长时序交互式环境中全面评估 MemHarness 框架。实验设计围绕五大核心研究问题展开:

本文选用两项高难度长时序交互式基准任务开展评估:ALFWorld(文本具身家庭家务任务)、WebShop(目标导向线上购物仿真任务)。核心评价指标为任务成功率,WebShop 额外统计平均任务得分。

对比基线覆盖四大类别:

策略主干模型选用 Qwen2.5-7B-Instruct,整套实现基于 veRL-agent 框架搭建。本文参考 Deepseek-R1、EvolveR 方案,在强化学习前增加简短冷启动训练阶段。每项基准的冷启动数据集包含两类样本,各 200 条:

经验记忆库初始化时为空,强化学习训练过程中由策略模型从自身交互轨迹中提炼规则,逐步填充。嵌入模型选用 BGE-M3,每一步检索相似度最高的前 3 条经验。

表 1 汇总 ALFWorld、WebShop 上全部模型性能。整体来看 MemHarness 取得最优效果:ALFWorld 平均任务成功率 85.2%,WebShop 任务成功率 75.6%。

MemHarness 相比基础模型 Qwen2.5-7B-Instruct 实现巨大性能提升;仅 7B 参数量的前提下,大幅超越 Gemini-2.5-Pro 闭源模型:ALFWorld 提升 23.1%,WebShop 提升 39.7%。

纯提示、仅测试时读取记忆的方案(Reflexion、ExpeL 等)无策略优化,性能提升幅度有限。原生纯 GRPO 强化学习基线效果较强,但简单将外置记忆与 GRPO 拼接(Mem0+GRPO、SimpleMem+GRPO)会严重降低性能。MemHarness 依靠基于环境状态的记忆重构机制解决该缺陷,安全复用历史经验:相较原生 GRPO,ALFWorld 绝对提升 8.8%,WebShop 绝对提升 9.5%。

为回答 RQ2,我们在 ALFWorld、WebShop 开展完整消融对照,结果见表 2,得到三条关键结论:

针对 RQ3,我们在 ALFWorld 分布外(OOD)测试集验证陌生环境鲁棒性:测试环境的房间布局、物体摆放均为训练阶段从未见过的配置。这类场景下直接套用历史记忆极易出现严重环境不匹配。

实验结果(表 3)显示:MemHarness 平均成功率 85.9%,大幅领先「强化学习 + 原始记忆复现」基线(76.3%)。值得注意的是,关闭记忆的原生策略基线性能尚可(83.0%),但移除重构、直接复现记忆后性能跌至 82.4%。该结果证实:在未见过的陌生环境中,逐字回放记忆会引入大量噪声;MemHarness 通过动态过滤、改写不匹配的历史指引,安全复用过往经验,取得最优分布外泛化效果。

针对 RQ4,我们探究重构行为是否真正依靠历史、当前环境的状态对比,从宏观过滤、微观自适应两个维度分析模型行为。

我们消融重构阶段输入的历史原始观测字段 (o^{src}),结果见表 4 (a):

该结果证明:策略会主动对比历史、当前环境状态以过滤不兼容记忆,而非单纯依赖字段缺失做判断,以此保障下游任务性能稳定。

我们构造 1000 条离线探测样本:用强大模型对当前环境做最小改动,使原本适配的检索记忆彻底失效,仅观测重构输出、不执行完整任务(附录 B)。表 4 (b) 统计环境改动后的输出分布变化:

两类任务行为差异源于观测文本格式:ALFWorld 环境描述简洁,WebShop 网页观测文本极长。但无论哪种场景,重构模块都会针对细微环境变化做出差异化响应。

我们全程追踪强化学习训练过程中,模型内部记忆决策行为、任务成功率的变化曲线,验证 MemHarness 会习得任务专属记忆使用策略,而非固定死板规则(图 3)。

训练过程记忆使用行为变化曲线

ALFWorld 训练收敛后记忆检索行为趋于稀疏:单条轨迹平均仅检索 2~3 次;WebShop 则全程保持高频检索,持续主动过滤不匹配记忆。模型习得的记忆使用策略直接和任务结果强相关(图 4)

记忆决策对应的任务成功率曲线

两类环境中,包含「重构后接纳记忆」的交互轨迹,成功率始终高于「直接拒绝记忆」的轨迹。证明智能体确实学会精准判断记忆的真实适用性,合理复用有效历史经验。

本文提出 MemHarness,一套基于强化学习的框架,将记忆增强智能体的设计范式从「逐字复现记忆」升级为「基于环境状态重构记忆」。整套框架依靠 GRPO 完成端到端优化,单一统一策略自主完成记忆评估、改写,输出贴合当前场景的专属行动指引后再执行动作。

在 ALFWorld、WebShop 两项交互式基准任务上,本文 7B 规模模型性能显著超越闭源大模型、各类强化学习基线,在分布外陌生环境中优势尤为突出。机理分析证明:这套重构机制能够主动过滤不匹配的噪声经验,同时从底层提升智能体原生推理能力 —— 即便推理阶段无法调取记忆,训练阶段学到的重构逻辑依旧能优化决策效果。

未来工作将拓展两大方向:1)将 MemHarness 拓展至更大规模基础模型;2)适配无边界开放式复杂交互环境。

本文两项测试环境参数约束:

两项环境共用一套结果驱动奖励 + 格式约束奖励:任务成功得稀疏奖励 + 10,失败 0;格式奖励权重 0.1,格式分数均等加权四项约束:

强化学习基于分组相对策略优化(GRPO)实现,依托 veRL 框架搭建;策略初始化使用 Qwen2.5-7B-Instruct,训练全程冻结参考策略 (\pi_{ref})用于计算 KL 散度正则损失。ALFWorld、WebShop 共享核心超参:

记忆存储库 (\mathcal{B})基于 Milvus 向量数据库实现,支持高效相似度检索。每条记忆条目由提炼经验 (e_i)、原始交互观测 (o_i^{src})组成。嵌入模型 BGE-M3 编码检索查询、库内记忆条目,基于余弦相似度返回前 k=3 条最优匹配经验。

记忆库不人工预填充,强化学习训练过程中由策略模型从自身交互轨迹提炼规则,在线填充。训练时仅保留 50% 交互轨迹用于提炼记忆,均衡筛选成功、失败样本;样本数量失衡时,剩余名额随机抽取轨迹补齐。

三层机制控制记忆库规模、消除冗余低价值条目:

冷启动数据集用于让模型熟悉完整交互规范,重点掌握记忆检索、轨迹提炼记忆两大能力。每条基准的种子交互轨迹取自 AgentGym 数据集。数据集包含两类子集,每项基准各 200 条样本:

两类样本合并后监督微调 2 轮,学习率 (1×10^{-5}),有效批次大小 2。GPT-5.1 仅用于离线冷启动数据构建,不参与后续强化学习训练、评测流程。冷启动仅对齐输出格式,不习得任务核心技能;真正的记忆重构、决策能力由后续任务级强化学习习得。

为验证 MemHarness 是否依靠细粒度环境对比、而非表面文本模式匹配完成重构,我们构建 2000 条探测样本(ALFWorld 1000 条、WebShop 1000 条)。每条样本包含一组原始适配状态 (s^+)、一条高度匹配的检索记忆;再由强大模型对原始状态做最小改动,生成反事实状态 (s^-),让原有记忆完全失效。

使用 GPT-5.1 生成反事实状态,提示词约束仅做最小修改、文本结构与原始观测保持一致,避免模型依靠格式差异直接拒绝记忆。

两类任务各举一例,展示原始状态、改动后状态、模型行为变化:

ALFWorld 前提失效案例任务:加热马克杯后放入咖啡机检索记忆:若在多个橱柜、抽屉中均未找到马克杯,转而查看台面、水槽等可视平面。原始状态 (s^+):5 号抽屉内无任何物品。改动状态 (s^-):5 号抽屉内摆放一只马克杯。模型行为变化:原始状态下接纳记忆,转向平面搜索;改动后记忆前提不成立,模型输出,直接拾取抽屉内马克杯。

WebShop 约束违背案例任务:寻找男士防滑牛津 T 恤,单价低于 50 美元检索记忆:确认商品全部满足需求约束、价格达标后,点击「立即购买」完成任务。原始状态 (s^+):商品标价 19.99 美元。改动状态 (s^-):商品标价 59.99 美元。模型行为变化:原始状态下直接执行购买;改动后价格超出限制,模型拒绝记忆,返回搜索页面重新筛选。

本节完整罗列五大类提示模板:记忆检索、状态条件记忆重构、智能体环境交互、轨迹提炼记忆、无记忆兜底自主推理;大括号内为运行时动态填充占位符。

通过两类任务真实重构案例,直观展示原始记忆直接复现的缺陷、以及 MemHarness 改写记忆、生成贴合场景指引的完整逻辑。

若直接复现原始记忆,会凭空生成「信用卡、咖啡桌」等当前场景不存在的实体,极易导致模型输出非法无效动作。MemHarness 会提取底层通用流程(备好目标物体后运送至最终存放点),替换为当前场景实体「杯子、边桌」…

5 个组关键问题Q&A

参考文献(略)

2 相关工作

附录 A 完整实现细节

附录 B 反事实探测样本构建

附录 C 全套提示词模板

附录 D 真实案例分析

Q1:现有记忆增强智能体的核心缺陷是什么?

Q2:MemHarness 核心创新逻辑是什么?

Q3:重构模块对模型性能起到什么关键作用?

Q4:MemHarness 核心工程落地价值体现在哪里?

Q5:MemHarness 在分布外场景优势的底层原理?

本文三大核心贡献

2.1 面向交互式决策的大模型智能体

2.2 搭载记忆模块的大模型智能体

3.1 问题形式化定义

3.2 整体框架

3.3 上下文记忆重构模块

3.4 基于 GRPO 的训练方案

4.1 实验基础设置

4.2 主实验结果:整体有效性

4.3 消融实验:模块贡献分析

4.4 分布外泛化能力

4.5 机制深度解析:记忆重构的底层逻辑

4.6 训练动态与行为演变(RQ5)

A.1 环境与评测配置

A.2 训练超参数

A.3 记忆库与检索配置

A.4 冷启动数据集构建

B.1 生成提示词规范

B.2 状态改动实例

D.1 ALFWorld:通用技能抽象迁移

环境观测捕获当前完整场景信息

经验检索调取潜在相关记忆,同步读取该记忆生成时对应的历史环境

记忆评判评估记忆的实际适用性,定位历史环境与当前环境的冲突点

上下文记忆重构保留具备迁移价值的知识,修改或舍弃和当前场景不兼容的内容

动作生成基于重构后的场景专属指引,输出贴合现状的决策动作

从重构视角重新定义智能体记忆指出行业通用的逐字复现范式存在「经验适用性鸿沟」;借鉴人类重构式记忆理论,将记忆引导的决策流程重新定义为「观测 - 检索 - 评判 - 重构 - 动作」五阶段完整链路。

提出以重构为核心的 MemHarness 框架在记忆检索与动作生成之间加入显式记忆重构环节,依托 GRPO 实现无外部监督的端到端联合训练;同时兼顾外置记忆可追溯性、参数化重构带来的环境自适应能力。

完备的实证效果验证在交互式决策标准测试集上,MemHarness 相对静态记忆复现方案实现稳定、显著的性能提升;消融实验精准验证重构模块是性能增益的核心驱动因素。

记忆检索阶段第 t步,智能体根据交互历史 (h_t)判断是否需要向经验记忆库 (\mathcal{B})发起检索。若触发检索,系统返回多条相关经验 (\mathcal{E}_t);这些经验不会直接送入动作上下文,而是进入重构流程处理。

上下文记忆重构阶段策略模型 (\pi_\theta)对比检索经验对应的原始环境与当前交互历史 (h_t),生成适配当前场景的指引 (g_t):保留可复用知识,舍弃或改写不匹配内容。

动作生成阶段同一策略模型 (\pi_\theta)结合交互历史 (h_t)、重构完成的指引 (\tilde{g}_t),生成可执行动作 (a_t)。

每一步输出严格包含一组合法 “ 推理块、一组动作块;

通过<retrieve_memory>标记控制记忆检索频率:单轮交互检索 1~5 次;

全部输出内容仅使用英文。格式奖励仅用于规范智能体交互流程,不会盖过任务结果奖励的主导地位。

研究问题 1(RQ1)MemHarness 在复杂交互式任务上,性能是否超越现有智能体、记忆增强基线模型?(4.2 节)

研究问题 2(RQ2)各模块(尤其是上下文记忆重构模块)分别对整体性能有多大贡献?(4.3 节)

研究问题 3(RQ3)MemHarness 在分布外(OOD)陌生环境中是否具备鲁棒性?(4.4 节)

研究问题 4(RQ4)重构机制是否真的依靠历史与当前环境的状态对比完成决策?(4.5 节)

研究问题 5(RQ5)强化学习训练过程中,自适应记忆使用行为如何演变?该行为与任务成功率存在何种关联?(4.6 节)

闭源大模型:GPT-4o、Gemini-2.5-Pro;

提示工程 / 纯记忆智能体:ReAct、Reflexion、Mem0、ExpeL、MemP、SimpleMem;

强化学习训练智能体:RLOO、原生 GRPO、MemRL、EvolveR、Mem0+GRPO、SimpleMem+GRPO;

消融变体:推理时移除重构模块、采用原始记忆复现的对照模型,用于单独验证本文核心设计增益。

多轮交互轨迹样本:配备思维链推理、主动记忆检索逻辑;

轨迹摘要问答样本:教会模型将完整交互轨迹提炼为记忆条目。只要触发记忆检索,模型必须先完成重构再输出动作。冷启动仅对齐交互格式、记忆提炼规范;后续统一依靠 GRPO 端到端优化,稀疏任务奖励(成功 10 分、失败 0 分)搭配小幅格式奖励。所有可训练基线统一使用相同主干模型、交互历史窗口长度 (w=3)、交互步数上限、优化超参,保证对比公平性。更多细节见附录。

强化学习是必备环节仅做格式对齐的冷启动模型性能极差(ALFWorld 平均成功率仅 7.6%),证明只有强化学习才能让智能体习得真实交互决策能力。

原始未处理记忆会引入噪声干扰「强化学习 + 原始记忆直接复现」、「移除重构模块」两组对照,ALFWorld 性能明显下滑。证明逐字复现记忆会引入环境不匹配噪声,本文重构机制可有效消除该负面影响。

重构优化能原生提升策略推理能力推理阶段完全关闭记忆读取(无记忆消融组),性能依旧显著优于纯 GRPO 基线(ALFWorld 83.0% vs 76.4%)。说明训练阶段的重构优化目标,会作为高质量隐性指引,从底层提升智能体原生推理能力,即便推理时无记忆可用也能受益。

策略内置重构模块不可替代将 MemHarness 内置重构模块替换为通用微调大模型,其余结构不变,性能大幅衰减(ALFWorld 85.2% 降至 77.7%)。证明零样本文本改写不足以适配环境动态;依托强化学习端到端训练,习得贴合任务环境的自适应重构逻辑至关重要。

完全移除 (o^{src}):记忆拒绝率变化极小,但任务成功率显著下降(ALFWorld 85.2%→80.0%),模型会接纳大量不匹配记忆;

将 (o^{src})替换为随机无关记忆的历史观测:记忆拒绝率明显上升(ALFWorld 8.7%→13.3%,WebShop 56.0%→63.3%)。

ALFWorld:环境改动后,模型原样复用记忆的比例下降,改写、直接拒绝记忆的比例上升;

WebShop:环境改动后,记忆拒绝率进一步上涨。

ALFWorld:文本具身家务仿真,共 6 大类子任务(拾取、观察、清洁、加热、制冷、二次拾取);单轮交互最大步数 50,输入上下文上限 2048 token,单次生成上限 512 token;

WebShop:电商网页仿真,商品总量超 110 万;单轮交互最大步数 15,输入上下文上限 4096 token,单次生成上限 512 token。

每一步输出严格包含一组合法 “ 推理块、一组动作块;

通过<retrieve_memory>标记控制记忆检索频率:单轮交互检索 1~5 次;

推理内容完整包裹在 “ 标签内;

全部输出内容仅使用英文。

采样与生成:每组采样轨迹数量 (G=8);生成阶段温度 1.0,验证推理温度 0.4;每轮采样 16 组轨迹,并行环境总数 128;

优化器:Adam 优化器,学习率 (1×10^{-6});

GRPO 目标:PPO 裁剪参数 (\epsilon=0.2);KL 散度正则权重 (\beta=0.01),防止策略偏离基础模型分布;

批次设置:ALFWorld 单批次 256,WebShop 单批次 64;张量并行规模 1;依托 vLLM 实现高吞吐采样,GPU 显存占用上限 0.75。

写入时去重:新增记忆入库前做嵌入近邻检索,若与库内已有条目余弦相似度超过阈值 0.85 则跳过入库;WebShop 开启,ALFWorld 关闭;

检索时去重:推理检索阶段先拉取更大候选池,嵌入贪心去重后再截断至前 3 条,保证返回记忆无语义重复;

容量与质量裁剪:沿用 EvolveR 拉普拉斯平滑效用分数 (s(p)=(c_{succ}(p)+1)/(c_{use}(p)+2));单条记忆被检索至少 3 次后,若效用分数低于裁剪阈值 0.3 则定期剔除。

记忆增强交互轨迹样本:随机选取轨迹中间决策点,插入记忆检索流程;由 GPT-5.1 基于任务描述、交互历史生成适配检索查询;同时由 GPT-5.1 将对应历史轨迹提炼为简洁复用经验。完整样本覆盖「发起检索→接收记忆→继续交互」全流程,严格遵循规定输出格式;

轨迹 - 记忆摘要配对样本:完整交互轨迹作为输入,GPT-5.1 生成结构化记忆摘要作为目标输出,教会模型将交互历史压缩为包含前置场景、通用规则的精简记忆。

ALFWorld 前提失效案例任务:加热马克杯后放入咖啡机检索记忆:若在多个橱柜、抽屉中均未找到马克杯,转而查看台面、水槽等可视平面。原始状态 (s^+):5 号抽屉内无任何物品。改动状态 (s^-):5 号抽屉内摆放一只马克杯。模型行为变化:原始状态下接纳记忆,转向平面搜索;改动后记忆前提不成立,模型输出,直接拾取抽屉内马克杯。

WebShop 约束违背案例任务:寻找男士防滑牛津 T 恤,单价低于 50 美元检索记忆:确认商品全部满足需求约束、价格达标后,点击「立即购买」完成任务。原始状态 (s^+):商品标价 19.99 美元。改动状态 (s^-):商品标价 59.99 美元。模型行为变化:原始状态下直接执行购买;改动后价格超出限制,模型拒绝记忆,返回搜索页面重新筛选。

智能体环境交互提示词:包含任务、交互步数、历史观测动作、合法动作集合,强制 “ 推理 +动作输出格式,区分检索、动作输出逻辑,禁止同轮同时输出检索与动作;

无记忆兜底提示词:全部检索经验均不适用时,指令模型仅依靠观测自主推理;

状态条件记忆重构提示词:输入任务、当前状态、记忆原始历史状态、历史经验规则,输出适配后的精简指引,完全不匹配则输出;禁止第一人称、长步骤规划;

轨迹摘要提示词:输入完整交互轨迹,输出 JSON 格式记忆条目,每条包含通用前置场景、可复用经验;

反事实探测生成提示词:分 ALFWorld、WebShop 两套,约束仅做最小事实修改、文本结构不变,输出 JSON 格式反事实状态与改动说明。


文章来源