思想:當前狀態的價值和下一步的價值和當前的獎勵有關。價值函數分解為當前獎勵和下一步價值函數兩部分,類似於遞歸的思想
例如在上面這個圖中。vπ(s)是狀態s的價值函數。π(a|s)是狀態s下執行行為a的概率,Rsa是對應的即時獎勵,是在狀態S下執行了動作a之后轉移到狀態S′的概率。
上面這個圖就是實際計算過程,計算的是最右邊這個狀態的價值。往上走study動作為a3,往下走為a4
思想:當前狀態的價值和下一步的價值和當前的獎勵有關。價值函數分解為當前獎勵和下一步價值函數兩部分,類似於遞歸的思想
例如在上面這個圖中。vπ(s)是狀態s的價值函數。π(a|s)是狀態s下執行行為a的概率,Rsa是對應的即時獎勵,是在狀態S下執行了動作a之后轉移到狀態S′的概率。
上面這個圖就是實際計算過程,計算的是最右邊這個狀態的價值。往上走study動作為a3,往下走為a4
本站轉載的文章為個人學習借鑒使用,本站對版權不負任何法律責任。如果侵犯了您的隱私權益,請聯系本站郵箱yoyou2525@163.com刪除。