首页 炼丹房 帖子详情
强化学习中的策略梯度算法,对应的动作空间是有限的?
收藏
快速回复
炼丹房 问答新手上路 412 1
强化学习中的策略梯度算法,对应的动作空间是有限的?
收藏
快速回复
炼丹房 问答新手上路 412 1

一般采用 策略梯度的方法,是不是对应的 动作空间是有限的呢?比如动作空间有{上,下,左,右},但是对当前状态的施加某个动作的概率是不一定的,所以要寻找最佳的动作策略,是吗

0
收藏
回复
全部评论(1)
时间顺序
三岁
#2 回复于2021-10

差不多就这个意思吧

0
回复
在@后输入用户全名并按空格结束,可艾特全站任一用户