在大模型应用飞速普及的今天,AI Agent已经能够胜任网页导航、深度研究、多轮对话交互等各类复杂任务,成为提升生产效率、简化复杂流程的核心工具。但随着应用场景的不断深入,一个关键瓶颈逐渐凸显:大多数Agent虽然能够积累海量的历史交互经验,却始终无法将这些经验转化为自身成长的动力,陷入了“有经验无成长”的困境。
具体来说,当前Agent的运行模式多为孤立执行,每一次任务完成后,交互轨迹、决策过程等经验要么被简单存储,要么直接丢弃,既无法有效复用过往的成败经验,也难以从充满噪声的文本信息中提炼出可复用的决策模式。更令人困扰的是,这种经验存储方式还会导致上下文臃肿,随着任务复杂度的提升,Agent的响应效率和决策准确性会明显下降。
在长期个性化场景中,这一问题表现得更为突出。比如在专业写作辅助场景中,用户可能会反复强调“减少内容幻觉”“遵循特定行业规范”“保持简洁严谨的语气”等核心诉求,但现有方案要么需要通过参数更新来适配这些偏好,成本高且可控性差;要么只是简单记忆用户的对话片段,无法将这些偏好转化为可执行的行为策略,导致Agent始终无法精准匹配用户的长期需求。
破解这一困境的关键,在于建立一套完善的Skills自进化机制,将零散、杂乱的交互经验提炼为核心原则,封装成统一、可编辑、可迁移的技能模块,让Agent能够在持续的交互中实现技能的自我迭代、自我优化,真正摆脱“经验闲置”的尴尬,实现从“被动执行”到“主动成长”的跨越。
技能自进化机制的本质,就是“将经验转化为可进化的技能”,其核心流程可概括为三大环节:技能库构建、递归式技能进化、技能的迭代管理。首先通过技能提取,从多样化的交互轨迹中抽象出可复用的候选技能;再通过结构化的技能库实现高效存储与检索;随后基于失败经验进行递归式进化,生成新技能或优化原有技能;最后通过科学的决策机制,实现技能的新增、合并或丢弃,避免技能库冗余膨胀。
目前,学术界和工业界已经提出了多种技能自进化的实现方案,其中SkillRL、AutoSkill、MemSkill三种框架最具代表性,它们分别从强化学习、经验驱动、记忆重构三个不同角度,构建了完整的技能自进化体系,为AI Agent的持续成长提供了可落地的实战路径。本文将结合这三种框架的核心原理、实现方案和实验结果,深入解析AI Agent技能自进化的底层逻辑与实战要点,帮助大家全面理解这一关键技术的价值与应用方法。
一、SkillRL:用强化学习打通经验到策略的进化链路
在AI Agent的复杂任务执行中,经验复用能力缺失、记忆方案存在缺陷、经验与策略优化脱节,是制约其自进化的三大核心痛点。为了解决这些问题,研究者们提出了SkillRL框架,这是一套面向Agent的技能增强递归强化学习框架,核心目标是通过自动技能发现与递归式进化,打通原始交互经验到策略持续优化的链路,让Agent能够真正从经验中学习、实现跨任务知识迁移与持续进化。
与传统Agent的“孤立执行”模式不同,SkillRL的核心创新的在于将差异化经验蒸馏、分层技能库构建、递归技能演化与强化学习深度融合,既解决了经验复用的难题,也破解了上下文膨胀的困境,为Agent的自进化提供了完整的技术支撑。其源码已开源,感兴趣的开发者可以通过https://github.com/aiming-lab/SkillRL获取完整实现细节,快速落地实践。
1.1 SkillRL的核心贡献
SkillRL的出现,填补了传统Agent无法从经验中持续学习的技术空白,其核心贡献主要体现在三个方面。
首先,它首次将差异化经验蒸馏、分层技能库构建、递归技能演化与强化学习深度融合,提出了完整的SkillRL框架,精准解决了Agent无法从经验中持续学习的核心痛点。传统Agent要么无法利用历史经验,要么只能简单记忆原始轨迹,而SkillRL通过经验蒸馏提炼核心知识,通过分层技能库实现高效检索,通过递归进化实现技能与策略的协同优化,形成了一套闭环的自进化体系。
其次,它证明了从原始经验到可复用技能的抽象,以及协同进化的技能库,是Agent实现高效经验迁移的核心原则。SkillRL的经验蒸馏机制不仅解决了传统记忆方法的噪声与上下文膨胀问题,还为策略优化提供了高质量的先验引导,让Agent能够快速复用过往经验,提升任务执行效率。
最后,它开创了技能库与Agent策略协同演化的范式,打破了静态记忆的性能瓶颈。传统Agent的记忆的是静态的,无法适配策略的进化,也无法覆盖未知场景,而SkillRL通过递归式技能进化,让技能库与Agent策略动态协同优化,使Agent能够持续适配新场景、解决新问题,实现长期成长。
1.2 SkillRL的核心实现方案
SkillRL的核心逻辑是通过自动技能发现与递归式进化,弥合原始交互经验与策略优化之间的鸿沟,其整体架构包含三大核心组件:基于经验的技能蒸馏机制、分层技能库构建、递归式技能进化机制。这三大组件相互配合,形成了完整的技能自进化闭环,确保Agent能够高效利用经验、持续优化技能。
(1)基于经验的技能蒸馏:从冗余轨迹中提炼核心知识
原始的Agent交互轨迹往往冗长、噪声高,直接存储和利用不仅会导致上下文膨胀,还会影响决策效率。SkillRL通过技能蒸馏机制,将这些冗余轨迹转化为凝练、可落地的知识,既实现了数据压缩,又提升了经验的推理效用。
其具体流程分为两步:第一步,将基础Agent部署在目标环境中,采样多样的交互轨迹,同时保留成功轨迹和失败轨迹——成功轨迹中包含有效的决策模式,失败轨迹中则隐藏着需要规避的错误,两者结合才能形成完整的经验体系。第二步,对轨迹进行差异化处理,分别提炼核心知识。
对于成功轨迹,重点提取驱动任务完成的决策模式,同时识别关键决策点、正确动作的推理逻辑,以及可迁移至特定任务实例之外的泛化模式。比如在网页导航任务中,成功轨迹可能包含“识别目标链接—点击进入—验证内容—完成操作”的核心流程,这些流程可以被提炼为通用技能,适配同类导航任务。
对于失败轨迹,则将其合成为简洁的失败经验,明确故障点、错误推理或动作及正确操作,归纳规避同类错误的通用原则,把冗长样本转化为反事实约束知识。比如在搜索QA任务中,失败轨迹可能是因为“检索关键词错误—获取无效信息—无法回答问题”,此时会提炼出“精准选择检索关键词”的约束原则,避免Agent再次出现同类错误。
通过这种差异化蒸馏机制,SkillRL实现了10-20倍的token压缩,在大幅减少上下文长度的同时,显著提升了原始经验的推理效用,从根源上解决了上下文膨胀的问题。
(2)分层技能库SkillBank:实现知识的高效检索与复用
提炼出可复用的技能后,如何实现高效存储与检索,是决定Agent经验复用效率的关键。SkillRL构建了分层技能库SkillBank,将蒸馏后的知识组织为两层结构,每层采用针对性的检索策略,实现通用与特定任务知识的高效检索,确保Agent在决策过程中能够快速调用相关技能。
SkillBank的两层结构各有侧重,相互互补。第一层是通用技能层,主要捕捉跨任务通用策略原则,比如探索策略、状态管理、目标跟踪启发式等,这些技能适用于各类任务,能够为Agent提供可迁移的基础指导。在推理过程中,通用技能会始终全量引入上下文,确保Agent具备基础的决策能力。
第二层是特定任务技能层,针对不同任务类别编码专业知识,比如动作序列、前置条件、约束、故障模式等,通过分类轨迹提取细粒度策略,与通用技能形成互补。比如在编程任务中,特定任务技能可能包含“Python语法规范”“代码调试技巧”“常用函数调用方法”等;在写作任务中,则可能包含“文章结构搭建”“语气控制”“内容去幻觉”等。在推理过程中,Agent会基于语义相似度做Top-K检索,只将与当前任务相关的特定技能引入上下文,避免冗余。
值得注意的是,SkillBank中的每个技能都包含名称、描述策略的原则、适用条件三大要素,既保证了检索效率,又确保了技能的应用指导性。Agent在决策时,能够根据当前任务场景,快速检索到最相关的技能,实现经验的高效复用。
(3)递归式技能进化:实现技能与策略的协同优化
静态的技能库无法适配Agent策略的进化,也无法覆盖未知场景,因此SkillRL引入了递归式技能进化机制,通过强化学习实现技能库与Agent策略的动态协同优化,形成“性能提升—挑战驱动—技能扩展—性能再提升”的正向循环。
这一机制主要分为三个阶段:冷启动SFT阶段、递归式技能进化阶段、基于RL的策略优化阶段。
冷启动SFT阶段的核心目标是让Agent掌握检索、解读及应用技能的能力。研究者利用教师模型生成技能增强的推理轨迹,对基础模型进行有监督微调,让Agent能够理解技能的含义、适用场景,以及如何将技能应用到具体任务中,解决技能利用的基础问题。
递归式技能进化阶段是自进化的核心。基于初始技能库,Agent在执行任务的过程中,会收集失败任务的轨迹,由教师模型分析这些失败轨迹,识别其中的失败模式,然后生成新技能或优化原有技能,更新SkillBank。比如Agent在执行写作任务时,多次因为“内容冗余”导致用户不满意,教师模型会分析这些失败案例,提炼出“精简内容、突出重点”的新技能,或者优化原有“写作规范”技能,加入内容冗余的约束条件。
基于RL的策略优化阶段则是为了提升Agent的技能应用能力。SkillRL采用GRPO算法对技能增强策略进行优化,首先让智能体检索相关技能,并从当前策略中采样多条完整轨迹,每条轨迹赋予二值奖励,用于计算归一化优势函数。在策略更新时,引入重要性权重和KL散度惩罚项,既保证了任务性能的提升,又避免了模型遗忘已习得的技能利用能力,确保技能与策略的协同进化。
1.3 SkillRL的核心实验结果
为了验证SkillRL的有效性,研究者们在9个Agent主流基准上完成了全面验证,包括ALFWorld、WebShop,以及7个搜索增强QA任务,涵盖单跳和多跳场景,对比了纯GRPO、Mem0+GRPO等强基线,甚至与GPT-4o、Gemini 2.5-Pro等超大闭源模型进行了对比,实验结果显著优于所有对比对象,充分证明了SkillRL的优势。
在具身交互场景中,ALFWorld基准的整体成功率达到89.9%,WebShop基准的成功率达到72.7%,远超所有基线模型。在强化学习对比中,SkillRL的整体成功率相比纯GRPO提升12.3%,相比最强记忆增强RL基线Mem0+GRPO领先35.2%,甚至大幅超越GPT-4o(41.9%)、Gemini 2.5-Pro(29.6%)等超大闭源模型,展现出极强的任务执行能力。
在搜索增强QA任务中,SkillRL的平均得分达到47.1%,刷新了该领域的SOTA记录,相比Search-R1提升8.6%,相比EvolveR提升4%。尤其在复杂多跳任务Bamboogle上,SkillRL领先EvolveR 19.4%,并且在分布外任务上保持了强泛化性,说明其技能体系具备良好的迁移能力,能够适配未知场景。
除了整体性能领先,SkillRL在上下文效率和收敛速度上也表现突出。相比原始记忆检索方案,SkillRL的平均Prompt长度降低10.3%,能够用更少的上下文实现更优性能,有效解决了上下文膨胀问题。在收敛速度上,60个训练步内ALFWorld成功率突破80%,而无演化的基线需要90步才能达到更低的性能峰值,不仅提升了训练效率,还实现了更高的性能天花板。
二、AutoSkill:经验驱动的终身学习,无需微调即可进化
随着AI Agent在实际场景中的落地,用户会在多轮会话中反复表达稳定的需求,比如在内容创作场景中,用户可能始终要求“语言正式、逻辑清晰、避免口语化”;在编程辅助场景中,用户可能偏好“代码简洁、注释完整、符合PEP8规范”。但现有方案在适配这些个性化需求时,存在明显的局限。
参数更新或自进化方案需要通过自反思、反馈优化等方式调整模型参数,面对高频、细粒度的个性化场景,不仅成本高,而且可控性差,容易出现“过度优化”或“优化不到位”的问题;长时记忆方案仅存储对话片段、偏好文本,把历史交互当作待检索的文本,而非可落地执行的行为策略,无法实现需求的精准适配;传统技能学习方案中,技能多隐式存在于提示词、执行轨迹或策略中,缺乏统一的可编辑、可维护、可迁移机制,难以实现技能的持续迭代。
针对这些问题,研究者们提出了AutoSkill框架,其核心思想是将交互经验从“原始记忆文本”升级为“可执行的行为技能单元”,把用户的重复需求固化为结构化的技能制品,实现跨会话的能力持续积累。与SkillRL不同,AutoSkill是一种无需训练的终身学习框架,完全基于提示词驱动实现,全程无需训练或微调基座模型,能够无缝对接现有LLM技术栈,降低部署门槛。其源码已开源,地址为https://github.com/ECNU-ICALK/AutoSkill,便于开发者快速集成应用。
2.1 AutoSkill的核心贡献
AutoSkill的核心价值在于解决了AI Agent在个性化场景中的终身学习问题,其核心贡献主要体现在两个方面。
第一,它形式化了“将LLM交互经验转化为显式可复用技能”的个性化问题,提出了完整的AutoSkill框架。传统方案中,用户的个性化需求往往被当作零散的记忆片段,而AutoSkill将这些需求转化为显式的、可执行的技能,让Agent能够精准捕捉用户偏好,实现个性化适配。
第二,它设计了覆盖技能提取、迭代优化、检索、复用的全生命周期技能管理机制,无需修改基座模型即可实现终身能力进化。这一机制打破了“技能进化必须微调模型”的固有认知,通过提示词驱动的方式,让Agent能够在不改变基座模型的前提下,持续积累技能、优化能力,大幅降低了进化成本,提升了可控性。
2.2 AutoSkill的核心实现机制
AutoSkill的核心逻辑是将可复用的任务求解模式封装为带版本控制的显式技能,在生成响应时检索相关技能,并根据新交互不断优化技能库。其整体框架由两个耦合的循环驱动:技能增强的响应生成循环和技能进化循环,两个循环相互配合,实现“响应优化—经验提取—技能进化—响应再优化”的闭环。
(1)技能增强的响应生成循环:用现有技能优化当前响应
该循环的核心目标是利用已有的技能库,优化当前用户请求的响应质量,确保Agent能够精准适配用户的个性化需求,其核心步骤分为三步:查询重写、混合技能检索、技能条件响应生成。
查询重写是基础步骤,主要解决上下文依赖问题。AutoSkill会基于用户当前查询和近期对话历史,生成简洁、独立的检索查询,保留格式、风格、领域等核心检索信息,确保能够精准检索到相关技能。比如用户当前查询为“帮我修改这篇文章”,结合近期对话历史中“要求语言正式、避免口语化”的偏好,查询重写后可能为“帮我修改文章,要求语言正式、无口语化表达”,便于检索相关技能。
混合技能检索是关键步骤,用于筛选与当前任务最相关的技能。AutoSkill结合稠密语义相关性得分与BM25相关性分数,加权计算技能与查询的相关性,筛选出Top-K且超过预定义阈值的相关技能。如果没有符合条件的技能,则不进行技能注入,避免冗余信息影响响应质量。这种混合检索方式既保证了检索的精准性,又兼顾了效率,能够快速匹配到最适合当前任务的技能。
技能条件响应生成是最终步骤,用于将技能转化为实际的响应优化策略。AutoSkill会将筛选后的技能渲染为紧凑的上下文,注入到响应提示词中,让模型能够适配用户积累的经验,同时不会在回复中暴露技能注入的过程,保证响应的自然性。比如将“语言正式、避免口语化”的技能注入提示词后,模型生成的文章会自动规避口语化表达,符合用户偏好。
(2)技能自进化循环:从新交互中持续优化技能库
该循环的核心目标是从新的交互经验中提取、维护、迭代技能,实现Agent的终身学习,覆盖完整的技能生命周期,其核心步骤分为三步:技能提取、检索辅助的技能管理、带版本控制的技能合并。
技能提取是基础,以用户查询作为提取依据,从交互中抽象出可复用、长期有效的候选技能。需要注意的是,AutoSkill会过滤掉一次性请求,只提取可复用的通用能力,比如用户偶尔提出的“帮我查询某个具体数据”属于一次性请求,不会生成技能;而用户反复强调的“写作时避免使用感叹号”则会被提取为候选技能,用于后续任务的复用。
检索辅助的技能管理用于避免技能库冗余膨胀。对于新生成的候选技能,AutoSkill会先检索现有技能库中最相似的技能,再由决策器进行决策,决定是新增、合并还是丢弃该候选技能。如果候选技能与现有技能差异较大,属于新的能力范畴,则新增为新技能;如果与现有技能高度相似,只是细节上有优化,则进行合并;如果候选技能不可复用或无实际价值,则直接丢弃。
带版本控制的技能合并是AutoSkill的核心创新点之一。如果决策为合并,框架会将候选技能与现有技能做语义融合,而不是简单的文本拼接。融合过程中,会保留原有技能的核心标识,整合新增的约束与细节,同时升级版本号,实现同一项能力的持续迭代优化,而非重复创建相似技能。比如原有“写作规范”技能包含“语言正式”的约束,新增候选技能包含“避免使用感叹号”的细节,合并后会生成“写作规范V2”,既保留“语言正式”的核心要求,又新增“避免使用感叹号”的约束,实现技能的逐步优化。
2.3 AutoSkill的系统设计和工程实现
AutoSkill的系统设计遵循“显式技能表示、持续且可控的进化、低门槛部署”三大核心原则,确保系统能够适配多场景、易部署、可管控,其系统架构分为四层,分别是技能抽象层、技能管理层、存储与检索层、服务与交互层,各层分工明确、协同工作,支撑技能自进化的全流程。
(1)系统架构详解
技能抽象层是系统的核心,其核心对象是可复用的技能。每个技能是以SKILL.md为核心的标准化智能体技能制品,记录了技能标识、元数据与可执行指令,还可配套脚本、参考资料等资源,确保技能的可检查、可编辑、可跨环境迁移。比如一个“Python代码规范”技能,会包含技能名称、适用场景、具体规范(如变量命名、代码缩进、注释要求)等内容,便于Agent理解和应用。
技能管理层负责将原始的交互轨迹转化为可复用的技能,包含技能提取器和技能维护器两个核心组件。技能提取器从交互证据中生成候选技能,聚焦于抽象可复用的能力;技能维护器则负责对候选技能进行管理,完成新增、合并、丢弃的决策,确保技能库的精简与行为一致性。
存储与检索层是技能的载体,采用本地持久化的SkillBank,通过向量索引实现高效检索,支持分离用户私有技能与共享技能。用户私有技能仅用于适配该用户的个性化需求,共享技能则可用于所有用户的同类任务,既保证了个性化适配,又提升了技能的复用效率。
服务与交互层提供多种前端接入方式,包括Python SDK、Web UI、兼容OpenAI规范的智能体,便于开发者和用户快速接入系统。无论是开发者通过SDK集成到自有应用中,还是用户通过Web UI直接使用,都能获得便捷的体验。
(2)技能生命周期管理
AutoSkill的技能生命周期涵盖经验摄入、技能提取、技能维护与版本管理、技能复用四个阶段,形成了完整的闭环,确保技能能够持续迭代、高效复用。
经验摄入阶段,系统接收交互证据,包括对话、行为、事件轨迹等,从中提炼与用户对齐的稳定能力。这一阶段的核心是筛选出有价值的经验,过滤掉无复用价值的一次性交互。
技能提取阶段,从经验中生成候选技能,目标是抽象出可复用的能力,而非记忆所有交互。如前所述,通用一次性请求通常不产生技能,只有那些用户反复强调、可适配同类任务的需求,才会被提取为候选技能。
技能维护与版本管理阶段,将候选技能与现有技能对比,执行新增、合并或丢弃操作。新能力存为新技能,现有行为的优化合并到对应技能并更新版本;不可复用模式被过滤,确保技能库的精简。这种版本管理机制,让技能的进化过程可追溯、可回滚,提升了系统的可控性。
技能复用阶段,在未来任务中,从向量索引检索相关技能,渲染为简洁上下文并注入LLM请求,使历史学习的行为影响后续生成。通过这种方式,Agent能够持续适配用户的个性化需求,实现能力的持续提升。
(3)核心工程特性
AutoSkill在工程实现上具备诸多优势,能够满足开发、测试、生产级等多场景的部署需求,其核心工程特性主要包括四个方面。
一是前后台分离,前台交互聚焦于低延迟的关键响应路径,技能提取与维护等耗时任务则在后台异步执行,完全不影响前端体验。比如用户发送请求后,前台能够快速返回响应,而技能提取和优化则在后台默默进行,既保证了响应速度,又实现了技能的持续进化。
二是模块化与可插拔,LLM连接器、嵌入模型、向量数据库等核心组件均支持灵活替换,无需改动系统核心逻辑。开发者可以根据自身需求,选择合适的LLM模型、嵌入模型和向量数据库,降低了系统的耦合度,提升了灵活性。
三是透明可管控,技能以显式的SKILL.md文件定义,支持人工审核、编辑、导入导出,其可解释性远超隐式的模型参数适配。开发者和用户可以清晰地看到技能的具体内容,根据需求进行修改和优化,提升了系统的可控性和可维护性。
四是支持离线初始化,可通过导入历史对话、文档、Agent执行轨迹等数据,预先构建初始技能库,上线后即可持续迭代优化。这一特性让AutoSkill能够快速适配已有场景,无需从零开始积累技能,大幅降低了部署成本和周期。
2.4 AutoSkill的实验结果
为了验证AutoSkill的有效性,研究者们基于WildChat-1M真实用户交互语料开展实验,筛选出8轮以上的长对话,按中英语言、GPT-3.5/GPT-4模型分为四个子集,全面验证了框架的技能提取能力、迭代能力和适配能力,实验结果充分证明了AutoSkill在个性化场景中的优势。
从技能提取规模来看,四个子集共提取出1858个有效技能,其中英文GPT-3.5子集规模最大,提取631个技能,说明AutoSkill能够有效从真实交互语料中提取可复用技能,适配不同语言和模型场景。
从技能领域分布来看,编程与软件开发占比最高,达到482个,其次是写作与内容创作363个、数据与AI/ML 354个,同时还覆盖办公、教育、翻译、自动化等多个场景,说明AutoSkill的技能提取机制具备较强的通用性,能够适配各类主流应用场景。
从关键结论来看,AutoSkill的版本迭代机制效果显著,高频使用的生产力技能会持续迭代优化,例如专业文本重写技能累计完成34次补丁级更新;而低频、专用技能则保持初始版本,实现了技能的差异化进化,既保证了核心技能的持续优化,又避免了无效的迭代消耗。
同时,技能表达能力具备通用性,同一套结构化格式,可同时承载软交互偏好和硬执行规则,支持中英多语言。比如既可以记录用户“喜欢简洁语气”的软偏好,也可以记录“代码必须添加注释”的硬规则,适配不同类型的个性化需求。
此外,AutoSkill的提取精准性较高,能够有效过滤一次性请求,仅固化可复用的通用能力,避免技能库无效膨胀。实验数据显示,无效技能的占比不足5%,说明技能提取机制能够精准识别可复用经验,保证技能库的精简与高效。
三、MemSkill:重构记忆技能,实现记忆与能力的双重进化
在AI Agent的自进化过程中,记忆系统扮演着至关重要的角色,它是经验存储、技能提取、策略优化的基础。但现有Agent记忆系统普遍存在三大核心局限,严重制约了Agent的自进化能力。
首先,强依赖人工先验,预设静态的记忆操作,比如新增、删除、修改等,无法适配多样的交互场景与动态变化的任务需求。比如人工预设的“新增记忆”操作,无法区分哪些记忆是可复用的、哪些是冗余的,导致记忆库臃肿,影响决策效率。
其次,长历史处理效率低,主流的逐轮增量式更新方式,在超长交互场景中调用成本高、性能衰减明显。比如在数百轮的长对话中,逐轮更新记忆会导致LLM调用次数激增,响应速度变慢,同时记忆的准确性也会下降。
最后,进化能力缺失,现有自进化记忆研究仅聚焦于架构元优化或基准搭建,未实现记忆操作行为的自主迭代与进化。记忆系统始终处于静态状态,无法随着Agent的策略进化而优化,也无法适配未知场景的记忆需求。
为了解决这些问题,研究者们提出了MemSkill框架,其核心创新点在于将传统的固定记忆操作,重构为可学习、可复用、可进化的记忆技能,打破了传统人工固定记忆流程的刚性局限,为自进化Agent记忆系统提供了新的范式。MemSkill通过“强化学习优化技能使用 + LLM引导技能进化”的双阶段闭环自进化体系,实现了记忆技能库本身的持续自主迭代优化,其源码已开源,地址为https://github.com/ViktorAxelsen/MemSkill。
3.1 MemSkill的核心贡献
MemSkill的核心价值在于重构了Agent的记忆系统,实现了记忆技能的自进化,其核心贡献主要体现在两个方面。
第一,提出了面向Agent的MemSkill记忆框架,将Agent记忆操作重构为可进化的技能抽象。传统记忆系统的操作是固定的、静态的,而MemSkill将记忆操作转化为可学习、可复用、可进化的技能,让记忆系统能够适配动态变化的任务场景,打破了人工固定记忆流程的局限。
第二,设计了“强化学习优化技能使用 + LLM引导技能进化”的双阶段闭环自进化体系,实现了记忆技能库本身的持续自主迭代优化。这一体系既保证了Agent能够高效使用现有记忆技能,又实现了记忆技能的持续进化,让记忆系统与Agent策略协同成长,提升了Agent的长时记忆能力和自进化能力。
3.2 核心设计理念:将技能重构为可学习、可复用、可进化的记忆技能
MemSkill的核心设计理念,是将传统的固定记忆操作,重构为可学习、可复用、可进化的记忆技能,即一套结构化的、可组合的执行例程,用于从交互轨迹中完成信息提取、整合、修剪与更新。与传统记忆操作不同,这些记忆技能能够通过学习不断优化,通过组合适配复杂场景,实现记忆系统的自进化。
(1)技能库(Skill Bank):记忆技能的载体
MemSkill的技能库中,记忆技能被定义为可复用的结构化操作规范,涵盖适用场景及具体应用方式,每个技能包含两部分内容:一是用于表征与筛选的简短描述,便于Agent快速检索和识别技能;二是指导执行器完成记忆提取或修正的详细内容规范,确保技能能够被准确执行。
为了确保系统初始的稳定性与功能性,MemSkill的初始技能库仅包含4个通用基础原语,分别是新增(INSERT)、更新(UPDATE)、删除(DELETE)和跳过(SKIP)。这4个基础原语能够覆盖最基本的记忆操作,为系统的冷启动提供支撑。随着系统的运行,技能库会通过进化机制不断新增、优化技能,逐步丰富记忆操作能力。
(2)技能的使用学习:高效利用现有记忆技能
技能的使用学习,负责基于当前技能库完成记忆的构建与更新,包含控制器(Controller)和执行器(Executor)两个核心子组件,采用span级的处理模式,大幅提升长历史场景的处理效率,降低LLM调用成本。
控制器的核心作用是筛选合适的记忆技能,用于处理当前的交互轨迹。与传统逐轮处理模式不同,控制器采用span级更新记忆,将每条交互轨迹切分为连续的文本span并进行顺序处理。对于每个文本span,控制器会基于当前文本span和检索到的已有记忆,完成技能筛选,而非逐轮进行处理,这种方式能够自然适配动态变化的技能库,无需绑定固定维度的动作输出。
控制器的技能筛选过程分为三步:首先,基于当前文本片段和已检索的历史记忆,生成一个状态向量来表征当前上下文;其次,根据每个技能的描述生成技能向量;最后,通过状态向量与技能向量的相似度对技能库中的技能进行打分,采用Gumbel-Top-K等不放回抽样机制,筛选最相关的技能子集,确保技能的适配性。
执行器的核心作用是执行筛选出的记忆技能,完成记忆的更新。执行器同样采用span级的处理模式,基于选中的技能、当前文本span、已检索的相关记忆,生成记忆更新内容,并以结构化格式输出,经解析后用于更新当前轨迹的记忆库。这种span级处理模式,大幅减少了LLM的调用次数,提升了长历史场景的处理效率。
此外,控制器还会通过强化学习进行优化,以下游任务性能作为其筛选决策的反馈。在每条训练轨迹中,控制器执行Top-K技能筛选,执行器构建该轨迹专属的记忆库。完成后,基于该轨迹的记忆依赖型查询评估其性能,比如F1值、成功率等,并将其作为奖励信号,优化控制器的技能筛选策略,提升技能使用的准确性。
(3)技能进化模块(Designer):实现记忆技能的自主迭代
技能进化模块是MemSkill实现记忆技能自进化的核心,其核心流程是基于任务失败的困难案例,分析现有技能的不足,进而优化原有技能、新增相关技能,实现技能库的自主迭代。具体流程分为三步:困难案例收集与筛选、两阶段进化、性能保障机制。
第一步,困难案例收集与筛选。系统会维护一个困难案例缓冲区,记录记忆任务中的失败案例,每个案例以查询为核心,包含查询内容、真实标签、元数据及任务性能、累计失败次数等统计信息。随后,通过聚类算法将案例划分为不同组别,并对每个组内的案例进行难度系数打分,筛选出高价值、多样化的代表性失败案例——这些案例能够反映现有技能的不足,是技能进化的核心依据。
第二步,两阶段进化。首先,利用大语言模型分析筛选出的困难案例,识别缺失或定义不当的记忆行为,比如现有技能无法处理“长文本记忆修剪”“多源信息整合”等场景;随后,基于分析结果,对现有技能提出修改方案并新增相关技能,比如新增“长文本记忆修剪”技能,优化“多源信息整合”技能,完善技能库的能力。
第三步,性能保障机制。为了避免技能更新导致系统性能退化,MemSkill配套了性能回滚机制与新技能探索激励。如果技能更新导致任务性能退化,则回滚至最优快照,确保系统的稳定性;技能更新后,通过对数偏置强化新技能的探索,加速控制器对新技能的适配,让新技能能够快速投入使用,提升系统性能。
(4)闭环优化流程:技能应用与进化的交替迭代
MemSkill采用交替迭代的双循环闭环,实现技能应用与技能进化的协同推进,确保记忆技能库与Agent的技能使用能力同步提升。这一双循环闭环分为两个阶段:技能应用阶段和技能进化阶段。
技能应用阶段,基于当前技能库,训练控制器优化技能选择策略,执行器在交互轨迹中逐段构建记忆,同时积累任务失败的困难案例。这一阶段的核心是高效利用现有技能,完成记忆构建与任务执行,同时为技能进化收集素材。
技能进化阶段,技能进化模块基于收集到的困难案例,完成技能库的进化优化,包括新增技能、修改原有技能等。这一阶段的核心是解决现有技能的不足,丰富技能库的能力,为下一阶段的技能应用提供支撑。
两个阶段循环往复,每轮循环后,下一轮训练将基于进化后的技能库重启,持续同步提升技能选择能力与技能库本身的质量,实现记忆技能与Agent能力的双重进化。
3.3 MemSkill的实验结果
为了全面验证MemSkill的有效性,研究者们在4类典型基准上完成了实验,包括LoCoMo、LongMemEval(用于评估长对话记忆构建能力)、HotpotQA(用于研究技能泛化能力)、ALFWorld(用于评估具身交互任务),对比了8个SOTA基线方案,实验结果显示,MemSkill在全场景中均表现领先,且具备极强的泛化迁移能力。
(1)全场景性能领先
在对话长记忆场景(LoCoMo/LongMemEval)中,MemSkill在LLaMA3.3-70B与Qwen3-Next80B双底座下,F1值、LLM裁判打分(L-J)均全面超越所有基线。其中,LoCoMo的L-J得分达50.96,远超第二名MemoryOS的44.59,说明MemSkill在长对话记忆构建方面具备显著优势,能够精准提取和维护长对话中的关键信息。
在具身交互场景(ALFWorld)中,MemSkill在Seen/Unseen两个子集上,任务成功率(SR)均为全场最高,Unseen场景成功率达47.01,显著优于第二名的38.06,同时交互步数更少,决策效率更高。这说明MemSkill的记忆技能能够有效支撑具身交互任务,帮助Agent快速适应未知场景,提升任务执行效率。
(2)极强的泛化迁移能力
MemSkill的一大核心优势是具备极强的泛化迁移能力,主要体现在跨模型迁移和跨数据集迁移两个方面。
在跨模型迁移中,仅用LLaMA训练的技能库,可直接迁移至Qwen3底座,无需额外训练仍保持SOTA性能。这说明MemSkill的记忆技能具备模型无关性,能够适配不同的LLM基座,降低了技能迁移的成本,提升了系统的灵活性。
在跨数据集迁移中,LoCoMo训练的技能库,可零样本迁移至LongMemEval、HotpotQA,且在50/100/200篇文档的超长上下文场景下,优势随上下文长度增加进一步放大。这说明MemSkill的记忆技能能够适配不同的任务场景,尤其是在超长上下文场景中,能够有效处理噪声和冗余信息,保持高性能。
(3)分布偏移下的技能泛化能力
为了验证MemSkill在分布偏移场景下的泛化能力,研究者们在LLaMA模型下,将LoCoMo上训练的技能库迁移到HotpotQA,评估三种上下文长度场景。实验结果证明,在分布偏移下,MemSkill的技能依旧具有较强的泛化能力。
在三种上下文规模下,MemSkill持续优于MemoryOS与A-MEM等强基线模型,且在难度更高的长上下文场景中,性能增益更为显著。当上下文更长、噪声更多时,MemSkill能够通过组合多项技能获得性能增益,比如将“信息提取”“记忆修剪”“多源整合”等技能组合使用,精准处理复杂场景中的记忆需求,这充分证明了MemSkill记忆技能的灵活性和泛化性。
四、三大框架对比与技能自进化的核心启示
SkillRL、AutoSkill、MemSkill三种框架,分别从不同角度构建了AI Agent技能自进化体系,它们各有侧重、各有优势,适用于不同的应用场景,通过对比分析这三种框架的核心特点,能够为我们实现AI Agent技能自进化提供重要的实践启示。
4.1 三大框架核心特点对比
SkillRL以强化学习为核心,聚焦于打通原始经验到策略优化的链路,通过经验蒸馏、分层技能库、递归进化,实现技能与策略的协同优化,适用于复杂的具身交互、搜索QA等任务,能够大幅提升Agent的任务执行能力和收敛速度,但其需要进行强化学习训练,部署成本相对较高。
AutoSkill以经验驱动为核心,无需微调基座模型,通过提示词驱动实现技能的全生命周期管理,聚焦于个性化场景的终身学习,能够将用户的重复需求固化为显式技能,适配多语言、多模型场景,部署门槛低、可控性强,适用于多轮对话、内容创作、编程辅助等个性化需求突出的场景。
MemSkill以记忆重构为核心,将固定记忆操作转化为可进化的记忆技能,通过双阶段闭环进化,实现记忆技能与Agent能力的双重提升,适用于长对话、超长上下文、具身交互等对记忆能力要求较高的场景,具备极强的泛化迁移能力,能够有效解决长历史处理效率低的问题。
总体来看,三种框架的核心目标都是实现Agent的技能自进化,打破“有经验无成长”的困境,但侧重点不同:SkillRL侧重“策略进化”,AutoSkill侧重“个性化经验落地”,MemSkill侧重“记忆技能进化”。开发者可以根据自身的应用场景和需求,选择合适的框架,或结合三种框架的核心思想,构建符合自身需求的技能自进化体系。
4.2 技能自进化的核心启示
通过对三种框架的深入分析,我们可以总结出AI Agent技能自进化的核心启示,为后续的技术实践提供指导。
第一,经验的有效提炼是技能自进化的基础。无论是SkillRL的经验蒸馏,还是AutoSkill的技能提取,抑或是MemSkill的困难案例分析,核心都是从海量的交互经验中提炼出可复用、有价值的知识,转化为技能。只有实现经验的有效提炼,才能避免冗余噪声的干扰,为技能进化提供高质量的素材。
第二,结构化的技能库是技能复用与进化的关键。三种框架都构建了结构化的技能库,用于存储、检索和管理技能,这说明结构化的技能组织方式能够提升技能的检索效率和复用能力,同时为技能的迭代优化提供支撑。技能库的设计应注重分层、分类,兼顾通用性与特异性,确保技能能够快速适配不同任务场景。
第三,闭环进化机制是技能持续成长的保障。三种框架都采用了闭环的进化机制,无论是SkillRL的“性能提升—挑战驱动—技能扩展”循环,还是AutoSkill的“响应优化—经验提取—技能进化”循环,抑或是MemSkill的“技能应用—困难收集—技能进化”循环,都实现了技能的持续迭代。闭环机制能够让Agent在实践中不断发现问题、优化技能,实现能力的持续提升。
第四,低门槛、高可控性是技能自进化落地的关键。AutoSkill的无需微调、MemSkill的模块化设计,都体现了低门槛、高可控性的重要性。在实际落地中,技能自进化体系应尽可能降低部署成本,支持灵活配置和人工管控,让开发者和用户能够根据需求调整技能,确保技能进化的方向符合预期。
第五,泛化迁移能力是技能自进化的核心目标之一。MemSkill的跨模型、跨数据集迁移能力,SkillRL的分布外泛化能力,都说明泛化迁移是技能自进化的重要目标。只有具备较强的泛化迁移能力,技能才能适配不同的模型、不同的场景,实现Agent的通用成长。
五、总结与未来展望
AI Agent的技能自进化,是实现Agent从“被动执行”到“主动成长”的关键,也是大模型应用从“单点突破”到“规模化落地”的核心支撑。本文通过对SkillRL、AutoSkill、MemSkill三种主流框架的深入解析,全面梳理了技能自进化的核心原理、实现方案和实验价值,总结了技能自进化的关键要点和实践启示。
当前,AI Agent技能自进化技术已经取得了显著的进展,三种框架分别从强化学习、经验驱动、记忆重构三个角度,为技能自进化提供了可落地的实战路径,能够有效解决Agent“有经验无成长”的困境,提升Agent的任务执行能力、个性化适配能力和泛化迁移能力。但同时,技能自进化技术仍面临一些挑战:比如技能的自动提取精度仍有提升空间,复杂场景下的技能组合优化难度较大,技能进化的可解释性有待加强等。
展望未来,AI Agent技能自进化技术将朝着三个方向发展。一是更精准的技能提取与进化,通过结合大语言模型的理解能力和强化学习的优化能力,提升技能提取的精度,实现技能的精细化进化;二是更高效的技能组合与适配,构建灵活的技能组合机制,让Agent能够根据复杂任务场景,自动组合多种技能,提升任务执行效率;三是更开放的生态与更广泛的落地,推动技能自进化框架的开源与普及,形成标准化的技能格式和管理规范,适配更多行业场景,让AI Agent能够真正融入生产生活,实现持续成长,为人类提供更高效、更智能的服务。