本技術屬于人工智能,尤其涉及一種基于雙評價網絡的多無人機協同對抗決策方法。
背景技術:
1、隨著無人機技術的迅猛發展,其在戰爭場景的應用逐漸增多,現代戰爭環境日益復雜,無人機不僅需執行偵察和打擊任務,還需在動態戰場上與敵方進行實時決策與策略對抗。因此,優化無人機的戰斗博弈決策能力顯得尤為重要。
2、戰斗博弈論為無人機提供了一種有效的分析框架,通過建模不同主體之間的互動關系,可以評估在對抗或合作情況下的決策策略。
3、然而,在復雜空戰場景下,面臨著計算復雜性以及多無人機協同作戰的挑戰,現有博弈決策仍需進一步優化。
技術實現思路
1、本技術旨在至少解決現有技術中存在的技術問題之一。為此,本技術提出一種基于雙評價網絡的多無人機協同對抗決策方法,優化了無人機的博弈決策。
2、第一方面,本技術提供了一種基于雙評價網絡的多無人機協同對抗決策方法,應用于第一無人機群和第二無人機群對抗訓練的目標無人機,該方法包括:
3、獲取所述目標無人機執行第一動作的第一本地觀測狀態和動作信息;
4、將所述第一本地觀測狀態和所述動作信息輸入至雙評價網絡,得到所述雙評價網絡輸出的聯合動作,所述雙評價網絡包括:當前actor網絡、目標actor網絡、第一當前critic網絡、第二當前critic網絡和目標critic網絡;
5、基于所述聯合動作對應的獎勵值,對所述雙評價網絡進行循環計算,直至所述獎勵值收斂,確定所述目標無人機需要執行的第二動作的動作參數;
6、其中,在所述雙評價網絡循環計算的過程中,對所述第一當前critic網絡和所述第二當前critic網絡計算的所述第一動作的動作價值取最小值,以對所述當前actor網絡進行參數更新。
7、根據本技術的一個實施例,所述對所述第一當前critic網絡和所述第二當前critic網絡計算的所述第一動作的動作價值取最小值,包括:
8、
9、其中,i是所述目標無人機的編號;t是時刻;k=1表示所述第一當前critic網絡,k=2表示所述第二當前critic網絡;yi,t是所述目標無人機i在t時刻的所述第一動作的所述動作價值的最小值,所述動作價值用于對所述當前actor網絡進行參數更新;ri,t是所述目標無人機i在t時刻的所述獎勵值;γ是所述獎勵值的折扣因子;q′i是所述目標無人機i的目標critic網絡;si,t是所述目標無人機i在t時刻的所述第一本地觀測狀態;ai,t是所述目標無人機i在t時刻的所述動作信息;θi,k,q′是所述目標無人機i的所述目標critic網絡的網絡參數;μ′是所述目標無人機i的目標actor網絡;θi,k,μ′是所述目標無人機i的所述目標actor網絡的網絡參數;
10、所述當前actor網絡和所述目標actor網絡的網絡結構相同,所述第一當前critic網絡、所述第二當前critic網絡和所述目標critic網絡的網絡結構相同。
11、根據本技術的一個實施例,在所述確定所述目標無人機需要執行的第二動作的動作參數之后,所述方法還包括:
12、在所述目標無人機基于所述動作參數執行所述第二動作的情況下,獲取所述第二動作對應的第二本地觀測狀態;
13、將所述第一本地觀測狀態、所述動作信息、所述獎勵值和所述第二本地觀測狀態的組合作為訓練樣本,將所述訓練樣本存儲至經驗回放池;
14、在所述經驗回放池中的所述訓練樣本的數量大于數量閾值的情況下,從所述經驗回放池中抽取所述訓練樣本,以對所述雙評價網絡進行參數更新。
15、根據本技術的一個實施例,所述動作信息是基于機動模式下的所述目標無人機的機動動作確定的動作變量。
16、根據本技術的一個實施例,所述機動動作包括等速平飛、加速平飛、減速平飛、最速爬升、左轉向、右轉向和俯沖。
17、根據本技術的一個實施例,所述獎勵值基于如下計算得到:
18、
19、其中,ri,t為所述目標無人機i在t時刻的所述獎勵值;ai,t為所述目標無人機i在t時刻的聯合動作;在所述目標無人機i屬于所述第一無人機群的情況下,ai,t∈t1用于表征所述目標無人機i在t時刻被所述第二無人機群中的無人機消滅,ai,t∈t2用于表征所述目標無人機i在t時刻發射的導彈進入導引頭已截獲狀態,ai,t∈t3用于表征所述目標無人機i在t時刻在所述第二無人機群中的無人機進入所述第一無人機群的可攻擊范圍內發射導彈,ai,t∈t4用于表征所述目標無人機i在t時刻與所述第二無人機群中的無人機j的距離變化率為正數。
20、根據本技術的一個實施例,所述目標critic網絡用于評估最優博弈動作。
21、根據本技術的一個實施例,所述基于所述聯合動作對應的獎勵值,對所述雙評價網絡進行循環計算,包括:
22、將所述第一本地觀測狀態和所述動作信息代入雙評價網絡,根據策略梯度對所述當前actor網絡和目標actor網絡進行參數更新。
23、第二方面,本技術提供了一種基于雙評價網絡的多無人機協同對抗決策裝置,應用于第一無人機群和第二無人機群對抗訓練的目標無人機,該裝置包括:
24、獲取模塊,用于獲取所述目標無人機執行第一動作的第一本地觀測狀態和動作信息;
25、第一處理模塊,用于將所述第一本地觀測狀態和所述動作信息輸入至雙評價網絡,得到所述雙評價網絡輸出的聯合動作,所述雙評價網絡包括:當前actor網絡、目標actor網絡、第一當前critic網絡、第二當前critic網絡和目標critic網絡;
26、第二處理模塊,用于基于所述聯合動作對應的獎勵值,對所述雙評價網絡進行循環計算,直至所述獎勵值收斂,確定所述目標無人機需要執行的第二動作的動作參數;
27、其中,在所述雙評價網絡循環計算的過程中,對所述第一當前critic網絡和所述第二當前critic網絡計算的所述第一動作的動作價值取最小值,以對所述當前actor網絡進行參數更新。
28、第三方面,本技術提供了一種電子設備,包括存儲器、處理器及存儲在所述存儲器上并可在所述處理器上運行的計算機程序,所述處理器執行所述計算機程序時實現如上述第一方面所述的基于雙評價網絡的多無人機協同對抗決策方法。
29、第四方面,本技術提供了一種非暫態計算機可讀存儲介質,其上存儲有計算機程序,所述計算機程序被處理器執行時實現如上述第一方面所述的基于雙評價網絡的多無人機協同對抗決策方法。
30、第五方面,本技術提供了一種芯片,所述芯片包括處理器和通信接口,所述通信接口和所述處理器耦合,所述處理器用于運行程序或指令,實現如第一方面所述的基于雙評價網絡的多無人機協同對抗決策方法。
31、第六方面,本技術提供了一種計算機程序產品,包括計算機程序,所述計算機程序被處理器執行時實現如上述第一方面所述的基于雙評價網絡的多無人機協同對抗決策方法。
32、本技術的附加方面和優點將在下面的描述中部分給出,部分將從下面的描述中變得明顯,或通過本技術的實踐了解到。
33、本發明提供的一種基于雙評價網絡的多無人機協同對抗決策方法,相對于現有技術具有以下有益效果:
34、(1)通過在對抗訓練的目標無人機中,通過基于改進的actor-critic網絡結構得到的雙評價網絡,對第一當前critic網絡和第二當前critic網絡計算的動作價值取最小值,解決了構建訓練框架的動作信息所在的動作空間和第一本地觀測狀態所在的狀態空間較大的問題,能夠有效減少動作價值高估的影響,對無人機博弈的動作價值進行了更準確的估計,使得目標無人機根據博弈策略選擇執行最優的第二動作,實現了在多變的戰場環境中快速而準確的決策,提高了作戰任務執行的成功率,推動了無人機在未來戰場的應用,為戰爭行動提供更高效的支持。
35、(2)針對目標無人機的聯合動作,構建了精細化面向無人機對抗博弈的獎勵機制,引導無人機學習并形成靈活而有效的空中博弈策略,實現了在多變的戰場環境中快速而準確的決策,提高了作戰任務執行的成功率,能夠構建出一個更為先進的多無人機對抗任務訓練體系。
36、(3)通過延遲actor網絡更新策略,以最小化actor網絡參數更新前的誤差,將actor網絡的更新頻率設置為低于critic網絡的更新頻率,減少誤差積累,降低使用沒變化的critic網絡得到的價值估值來指導actor網絡重復更新的可能性,從而實現更高質量的策略更新,降低取小值操作的影響。