国内刊号:32-1772/TN
国际刊号:1673-5439
发布日期:
作者:张伯雷,刘哲闰
单位:南京邮电大学 计算机学院,江苏 南京 210023南京邮电大学 计算机学院,江苏 南京 210023
关键词:离线强化学习;环境模型;自适应权重;不确定性度量
基金:基金项目:国家自然科学基金( 62202238)资助项目
离线强化学习可以从历史经验数据中直接学习出可执行的策略,由此来避免与在线环境的高代价交互,可应用于机器人控制、无人驾驶、智能营销等多种真实场景。有模型的离线强化学习首先通过监督学习构造环境模型,并通过与该环境模型交互来优化学习策略,具有样本效率高的特点,是最常用的离线强化学习算法。然而,由于离线数据集存在分布偏移问题,现有的方法往往通过静态的方法来评估此种不确定性,无法动态自适应于智能体策略的优化过程。针对以上问题,提出一种自适应的不确定性度量方法,首先对状态的不确定性进行估计,然后通过动态自适应的方法来衡量环境模型的不确定性,从而使得智能体可以在探索-保守中取得更好的平衡。在多个基准的离线数据集对算法进行了验证,实验结果表明,该算法在多个数据集中都取得最好的效果,消融实验等也验证了所提方法的有效性。
来源:2024年第04期
《南京邮电大学学报(自然科学版)》期刊编辑部