基于matlab的强化学习QLearning路径规划性能仿真-机器学习--FPGA/MATLAB商业/科研类项目合作-Powered by HighSpeedLogic

基于matlab的强化学习QLearning路径规划性能仿真

时间：2022/10/30 6:33:08 点击：

　　核心提示：包括程序操作录像，A0005...

1.完整项目描述和程序获取

面包多安全交易平台:https://mbd.pub/o/bread/Y5uVkp5t

如果链接失效，程序调试报错或者项目合作可以加微信或者QQ联系。

2.部分源码

3.部分仿真图预览

4.算法概述

假设我们的行为准则已经学习好了, 现在我们处于状态s1, 我在写作业, 我有两个行为 a1, a2, 分别是看电视和写作业, 根据我的经验, 在这种 s1 状态下, a2 写作业带来的潜在奖励要比 a1 看电视高, 这里的潜在奖励我们可以用一个有关于 s 和 a 的 Q 表格代替, 在我的记忆Q表格中, Q(s1, a1)=-2 要小于 Q(s1, a2)=1, 所以我们判断要选择 a2 作为下一个行为. 现在我们的状态更新成 s2 , 我们还是有两个同样的选择, 重复上面的过程, 在行为准则Q 表中寻找 Q(s2, a1) Q(s2, a2) 的值, 并比较他们的大小, 选取较大的一个. 接着根据 a2 我们到达 s3 并在此重复上面的决策过程. Q learning 的方法也就是这样决策的. 看完决策, 我看在来研究一下这张行为准则 Q 表是通过什么样的方式更改, 提升的.Q-Learning它是强化学习中的一种 values-based 算法，是以QTable表格形式体现，在学习中遇到的任何操作存入QTable中，根据之前的学习选择当前最优操作，也可以根据设置的e_greedy机率随机选择。

作者：我爱C编程　来源：我爱C编程

基于matlab的强化学习QLearning路径规划性能仿真

时间：2022/10/30 6:33:08 点击：

相关文章

相关评论

发表我的评论

本类热门

本类推荐

本类固顶