节点文献

一种基于核的在线策略梯度算法

免费订阅

【作者】 唐丽丽朱海军朱斐

【Author】 TANG Lili;ZHU Haijun;ZHU Fei;Suzhou Polytechnic Institute of Agriculture;School of Computer Science and Technology, Suzhou University;

【机构】 苏州农业职业技术学院苏州大学计算机科学与技术学院

【摘要】 策略梯度算法是一种广义的策略迭代方法,由于其高效性得到了广泛的关注和研究.策略梯度算法包括策略评估与策略改进两个部分.传统的在线策略梯度方法在处理大规模问题时,表现不佳.为此,提出一种基于核的在线策略梯度算法,在强化学习经典算法评论家行动者的框架下,采用核方法近似表示值函数与策略函数,采用真在线时间差分算法评估策略的值函数,并根据真在线思想改进策略参数的更新方式.最后通过平衡杆问题和爬山小车实验验证算法的有效性.

【基金】 国家自然科学基金(61303108)
【所属期刊栏目】 信息科学与技术 (2018年02期)
  • 【DOI】10.13568/j.cnki.651094.2018.02.014
  • 【分类号】TP181
  • 【下载频次】59
节点文献中: 

本文链接的文献网络图示:

浏览历史:
下载历史: