貝爾曼最優方程推導(來源:B站up主:shuhuai008)
1.明確一下概念間的關系
2.反證法證明 v*(s)=max(a)_q*(s,a)
3.“套娃”得到貝爾曼最優方程
參考資料:
1.https://www.bilibili.com/video/BV1RA411q7wt?p=5,B站UP主:shuhuai008
貝爾曼最優方程推導(來源:B站up主:shuhuai008)
1.明確一下概念間的關系
2.反證法證明 v*(s)=max(a)_q*(s,a)
3.“套娃”得到貝爾曼最優方程
參考資料:
1.https://www.bilibili.com/video/BV1RA411q7wt?p=5,B站UP主:shuhuai008
本站轉載的文章為個人學習借鑒使用,本站對版權不負任何法律責任。如果侵犯了您的隱私權益,請聯系本站郵箱yoyou2525@163.com刪除。