強化學習:馬爾可夫決策過程(貝爾曼最優方程)


 

                       貝爾曼最優方程推導(來源:B站up主:shuhuai008)

1.明確一下概念間的關系

2.反證法證明 v*(s)=max(a)_q*(s,a)

3.“套娃”得到貝爾曼最優方程

 

 

參考資料:

1.https://www.bilibili.com/video/BV1RA411q7wt?p=5,B站UP主:shuhuai008


免責聲明!

本站轉載的文章為個人學習借鑒使用,本站對版權不負任何法律責任。如果侵犯了您的隱私權益,請聯系本站郵箱yoyou2525@163.com刪除。



 
粵ICP備18138465號   © 2018-2025 CODEPRJ.COM