国内刊号:32-1772/TN
国际刊号:1673-5439
发布日期:
作者:许斌,练元洪,卞鸿根,刘丹,亓晋
单位:南京邮电大学 物联网学院,江苏 南京 210003南京邮电大学 物联网学院,江苏 南京 210003南京邮电大学 物联网学院,江苏 南京 210003南京邮电大学 物联网学院,江苏 南京 210003南京邮电大学 物联网学院,江苏 南京 210003
关键词:CEM?RL;深度强化学习;进化算法;历史梯度
基金:国家自然科学基金(62172235)和江苏省高等学校基础科学(自然科学)研究项目(22KJB520028)
进化算法(Evolutionary Algorithm,EA)和深度强化学习(Deep Reinforcement Learning,DRL)的组合被认为能够结合二者的优点,即EA 的强大随机搜索能力和DRL 的样本效率,实现更好的策略学习。然而,现有的组合方法存在EA 引入所导致的策略性能不可预测性问题。提出自适应历史梯度引导机制,其利用历史梯度信息,找到平衡探索和利用的线索,从而获得较为稳定的高质量策略,进一步将此机制融合经典的进化强化学习算法,提出一种进化梯度引导的强化学习算法(Evolutionary Gradient Guided Reinforcement Learning,EGG?RL)。在连续控制任务方面的实验表明,EGG?RL 的性能表现优于其他方法。
来源:2025年第01期
《南京邮电大学学报(自然科学版)》期刊编辑部