本公開涉及強化學習領域,具體涉及一種基于視覺表征的單智能體強化學習模型的訓練方法、裝置、電子設備、存儲介質和計算機程序產品。
背景技術:
1、隨著計算能力的顯著提升和算法創新的不斷涌現,強化學習(reinforcementlearning,rl)在眾多領域取得了顯著進展,包括游戲、機器人、自動駕駛等。盡管已經取得輝煌的成就,rl在實際應用中仍面臨一個核心挑戰,即如何提高樣本效率。
2、智能體需要具有從有限的交互中快速學習到有效策略的能力,尤其是在處理高維視覺圖像并執行復雜連續控制任務時,這一挑戰顯得尤為突出。視覺信號的高維度、冗余性以及多樣性給基于視覺的強化學習的應用帶來了一系列挑戰,例如視覺強化學習普遍面臨樣本效率低、控制性能差的問題。
技術實現思路
1、本公開示例性實施例提供的基于視覺表征的單智能體強化學習模型的訓練方法、裝置、電子設備、存儲介質和計算機程序產品,可以至少解決上述技術問題和上文未提及的其它技術問題。
2、根據本公開的一個方面,提供一種基于視覺表征的單智能體強化學習模型的訓練方法,所述基于視覺表征的單智能體強化學習模型包括在線狀態編碼器、動作編碼器、強化學習網絡和輔助任務網絡,所述輔助任務網絡包括狀態預測模型,所述基于視覺表征的單智能體強化學習模型的訓練方法包括:獲取目標智能體當前時間段的狀態信息、動作信息和獎賞信息,其中,所述當前時間段由包含當前時刻在內的預設多個連續的時刻組成,所述狀態信息和所述動作信息是基于針對所述目標智能體的觀測圖像而得到的;將所述狀態信息輸入到所述在線狀態編碼器,得到狀態特征;將所述動作信息輸入到所述動作編碼器,得到動作特征;將所述狀態特征、所述動作特征和所述獎賞信息輸入到所述狀態預測模型,得到所述目標智能體下一時間段的狀態預測特征,其中,所述下一時間段由包含下一時刻在內的預設多個連續的時刻組成;基于所述狀態預測特征和對應真實值之間的差異,計算狀態預測損失;將所述狀態特征和所述動作特征輸入到所述強化學習網絡,以計算強化學習損失;基于所述強化學習損失和所述狀態預測損失,對所述基于視覺表征的單智能體強化學習模型進行訓練。
3、可選的,所述將所述狀態特征、所述動作特征和所述獎賞信息輸入到所述狀態預測模型,得到所述目標智能體下一時間段的狀態預測特征,包括:將所述狀態特征、所述動作特征和所述獎賞信息輸入到所述狀態預測模型,并對所述狀態預測模型的輸出求平均值,以得到所述目標智能體下一時間段的初始狀態預測特征;將所述初始狀態預測特征輸入到在線投影網絡,得到所述狀態預測特征。
4、可選的,所述在線投影網絡包括在線投影頭和在線預測頭;其中,所述將所述初始狀態預測特征輸入到在線投影網絡,得到所述狀態預測特征,包括:將所述初始狀態預測特征輸入到所述在線投影頭,得到第一投影數據;將所述第一投影數據輸入到所述在線預測頭,得到所述狀態預測特征;其中,所述基于所述狀態預測特征和對應真實值之間的差異,計算狀態預測損失,包括:獲取所述目標智能體下一時間段的狀態信息;將所述下一時間段的狀態信息輸入到目標狀態編碼器,得到第二狀態預測特征,其中,所述目標狀態編碼器的參數基于所述在線狀態編碼器當前的參數以及預設衰減率通過指數移動平均而得到;將所述第二狀態預測特征輸入到目標投影網絡,得到所述狀態預測特征的對應真實值,其中,所述目標投影網絡包括目標投影頭,所述目標投影頭的參數基于所述在線投影頭當前的參數通過指數移動平均而得到;基于所述狀態預測特征和對應真實值之間的差異,計算所述狀態預測損失。
5、可選的,所述輔助任務網絡還包括動作預測模型;其中,所述基于視覺表征的單智能體強化學習模型的訓練方法還包括:獲取所述目標智能體當前時刻的狀態信息和下一時刻的狀態信息;將所述當前時刻的狀態信息和所述下一時刻的狀態信息分別輸入到所述在線狀態編碼器,得到當前時刻的狀態特征和下一時刻的狀態特征;將所述當前時刻的狀態特征和所述下一時刻的狀態特征輸入到所述動作預測模型,得到當前時刻的動作預測特征;基于所述動作預測特征和對應真實值之間的差異,計算動作預測損失;其中,所述基于所述強化學習損失和所述狀態預測損失,對所述基于視覺表征的單智能體強化學習模型進行訓練,包括:基于所述強化學習損失、所述狀態預測損失和所述動作預測損失,對所述基于視覺表征的單智能體強化學習模型進行訓練。
6、可選的,所述輔助任務網絡還包括獎賞預測模型;其中,所述基于視覺表征的單智能體強化學習模型的訓練方法還包括:獲取所述目標智能體當前時刻的狀態信息和當前時間段的動作信息;將所述當前時間段的動作信息輸入到動作編碼器,得到當前時間段的動作特征;將所述當前時刻的狀態特征和所述當前時間段的動作特征輸入到獎賞預測模型,得到所述當前時間段中最后一個時刻的獎賞預測特征;基于所述獎賞預測特征和對應真實值之間的差異,計算獎賞預測損失;其中,所述基于所述強化學習損失、所述狀態預測損失和所述動作預測損失,對所述基于視覺表征的單智能體強化學習模型進行訓練,包括:基于所述強化學習損失、所述狀態預測損失、所述動作預測損失和所述獎賞預測損失,對所述基于視覺表征的單智能體強化學習模型進行訓練。
7、可選的,所述將所述狀態特征、所述動作特征和所述獎賞信息輸入到所述狀態預測模型,包括:將所述狀態特征、所述動作特征、所述獎賞信息和空間位置信息輸入到所述狀態預測模型,其中,同一時刻的所述狀態特征、所述動作特征和所述獎賞信息共享相同的所述空間位置信息。
8、可選的,所述狀態預測模型為預設多個相同塊構成的transformer模型,每個塊包含一個多頭自注意力層和一個由多層感知機構成的前饋網絡層,每個層之前包括層歸一化組件,每個層之后包括殘差連接。
9、可選的,所述方法還包括:在所述獲取目標智能體當前時間段的狀態信息之后,對所述狀態信息中預設比例的數據執行隨機掩碼操作,以得到更新后的狀態信息。
10、根據本公開的另一方面,還提供一種基于視覺表征的單智能體強化學習模型的訓練裝置,所述基于視覺表征的單智能體強化學習模型包括在線狀態編碼器、動作編碼器、強化學習網絡和輔助任務網絡,所述輔助任務網絡包括狀態預測模型,所述基于視覺表征的單智能體強化學習模型的訓練裝置包括:
11、信息獲取單元,被配置為:獲取目標智能體當前時間段的狀態信息、動作信息和獎賞信息,其中,所述當前時間段由包含當前時刻在內的預設多個連續的時刻組成,所述狀態信息和所述動作信息是基于針對所述目標智能體的觀測圖像而得到的;狀態表征單元,被配置為:將所述狀態信息輸入到所述在線狀態編碼器,得到狀態特征;動作表征單元,被配置為:將所述動作信息輸入到所述動作編碼器,得到動作特征;狀態預測單元,被配置為:將所述狀態特征、所述動作特征和所述獎賞信息輸入到所述狀態預測模型,得到所述目標智能體下一時間段的狀態預測特征,其中,所述下一時間段由包含下一時刻在內的預設多個連續的時刻組成;狀態損失計算單元,被配置為:基于所述狀態預測特征和對應真實值之間的差異,計算狀態預測損失;強化學習損失計算單元,被配置為:將所述狀態特征和所述動作特征輸入到所述強化學習網絡,以計算強化學習損失;模型訓練單元,被配置為:基于所述強化學習損失和所述狀態預測損失,對所述基于視覺表征的單智能體強化學習模型進行訓練。
12、根據本公開實施例的另一方面,還提供一種電子設備,包括:至少一個處理器;至少一個存儲計算機可執行指令的存儲器,其中,所述計算機可執行指令在被所述至少一個處理器運行時,促使所述至少一個處理器執行如上任一所述的基于視覺表征的單智能體強化學習模型的訓練方法。
13、根據本公開實施例的另一方面,還提供一種存儲指令的計算機可讀存儲介質,當所述指令被至少一個處理器運行時,促使所述至少一個處理器執行如上任一所述的基于視覺表征的單智能體強化學習模型的訓練方法。
14、根據本公開實施例的另一方面,還提供一種包括至少一個計算裝置和至少一個存儲指令的存儲裝置的系統,其中,所述指令在被所述至少一個計算裝置運行時,促使所述至少一個計算裝置執行如上任一所述的基于視覺表征的單智能體強化學習模型的訓練方法。
15、根據本公開實施例的另一方面,還提供一種計算機程序產品,包括計算機程序/指令,所述計算機程序/指令被處理器執行時實現如上任意一項所述的基于視覺表征的單智能體強化學習模型的訓練方法。
16、本公開實施例提供的技術方案至少帶來以下有益效果:
17、根據本公開的基于視覺表征的單智能體強化學習模型的訓練方法、裝置、電子設備、存儲介質和計算機程序產品,針對目標智能體,能夠通過輔助任務網絡從視覺表征的角度出發,學習目標智能體的狀態表征和動作表征,通過強化學習網絡為目標智能體選擇最佳決策動作,并且,充分利用強化學習中時間段的時序信息,可以實現單智能體在具有挑戰的以圖像作為狀態輸入的復雜連續控制任務中的性能和樣本效率提升。
18、另外,采用一種非對稱的投影網絡架構,可以避免模型在自監督學習過程中的崩潰問題。
19、另外,引入動作預測學習作為額外的學習約束,可以增強狀態表征在未來動作預測中的貢獻。
20、另外,額外添加獎賞預測學習用于約束狀態和動作表征,可以促進智能體更好地理解其行為可能產生的后果。
21、另外,transformer架構使得可以同時處理目標智能體一段時間序列的信息,以充分利用強化學習中時間段的時序信息;每個層的前面均配備層歸一化組件,可以提高模型訓練過程中的穩定性和加快收斂速度;每個層的輸出都加上殘差連接,可以促進更深層次網絡的有效訓練,且有助于防止梯度消失或爆炸問題,保證信息在網絡中的順暢流動。