强化学习大本营新作:如何破解「学新忘旧」困局
近日,强化学习领域传来重磅研究进展,阿尔伯塔大学强化学习团队推出的全新持续强化学习框架精准击中传统强化学习“学新忘旧”的核心痛点,为智能体实现持续学习提供了可落地的技术路径,相关论文已被ICLR 2026收录,AI科技评论(雷峰网)也独家对话了论文两位共同第一作者张鸿铭、孙科,深入解读研究背后的思路与行业价值。

双系统架构破解持续学习“可塑-稳定”悖论
传统强化学习默认建立在环境不变的前提之上,仅需在固定场景中打磨最优策略即可,但真实世界场景的动态性要求智能体同时具备两种核心能力:一是可塑性,即面对全新任务时能快速学习适应;二是稳定性,即学习新任务后不会丢失已掌握的旧知识,二者天然存在矛盾,也是“学新忘旧”灾难性遗忘问题的核心根源。针对这一痛点,该研究首次提出了“快速学习+元学习”的双系统框架,将两个能力拆解到独立模块中分别优化,从架构层面为持续学习提供了原则性的分析范式,彻底改变了此前依赖经验调参的零散研究现状。
自适应热启动机制让新任务起跑路径最优
快速学习模块的核心是解决新任务到来时的初始策略选择问题,该模块设计了基于统计学假设检验的自适应热启动机制,将初始策略选择转化为one-vs-all的检验问题:当历史知识与当前新任务高度相关时,直接调用元学习策略初始化,大幅缩短训练周期;当新任务与上一任务场景相似时,选择直接微调上一任务的策略,减少重复计算;当新任务完全无历史经验可参考时,则随机初始化从头训练,避免错误知识的干扰。实验数据显示,该机制在不同新旧任务关联度的场景下,能自动匹配最优起跑策略,训练效率比默认全量微调的方式提升30%以上。
知识整合模块从数学层面打通两类学习范式边界
快速学习模块完成新任务训练后,元学习模块会承担知识整合的工作,将新学的知识无损并入长期知识库,核心优化目标是灾难性遗忘的最小化。针对不同类型的动作空间,该模块做了针对性的数学转化:在离散动作场景下,该目标等价于增量式的极大似然估计;在连续动作场景下,则对应最小化KL散度或Wasserstein距离。这种数学上的统一转化,首次模糊了持续强化学习与多任务强化学习之间的边界,让两类方向的算法优化可以共用同一套理论框架,为后续研究提供了更统一的分析视角。
具身智能落地成为该技术的最核心应用场景
当前具身智能的商业化进程正遭遇现实挑战,宇树科技上市后的市场反响平淡,一定程度上折射出具身智能在真实场景落地的难度:机器人若要在真实世界中完成多样化作业任务,必须解决“学新忘旧”的问题,一旦学习新技能后丢失了基础运动、避障等旧能力,其危害性远超大模型的幻觉问题。而该双系统框架刚好补上了具身智能持续学习的基础短板,让机器人可以在完成新任务的同时保留原有能力,真正实现技能的持续积累,目前已有不少具身智能团队开始对接该技术的落地验证。
目前,该论文的详细解读已上线强化学习大本营专区,配套开源教程《动手学强化学习》也同步更新了该框架的代码实现,学界和工业界用户可通过对应渠道获取论文原文及代码资源。此外,强化学习大本营还同步开放了ICLR 2026投稿交流群,为研究者提供路线导航、议题共读、Poster汇编、学术交流等专属服务,助力研究者快速掌握顶会前沿动态。