本發明涉及視頻編碼,尤其涉及一種用于vvc編碼單元的cu分區模式預測方法及視頻編碼設備。
背景技術:
1、隨著視頻分辨率和質量要求的不斷提高,視頻編碼技術在有限帶寬和存儲空間下的高效壓縮變得尤為重要。vvc(h.266)作為最新的視頻編碼標準,相比前代標準hevc(h.265),引入了更加靈活的四叉樹加多類型樹(qtmt)分區結構,使得視頻的壓縮效率大幅提高。然而,這也導致了編碼復雜度的顯著增加,尤其在cu的分區模式預測過程中,傳統的率失真優化(rdo)方法需要遍歷所有可能的cu分區模式,計算量極大,成為編碼效率提升的瓶頸。
2、現有技術中,一些基于深度學習的方法嘗試通過卷積神經網絡(cnn)進行cu分區模式的預測,借此減少遍歷搜索的計算復雜度。然而,單純的cnn模型只擅長捕捉圖像的局部紋理信息,無法充分利用視頻幀之間的時序依賴關系,因此在復雜場景中的表現仍存在局限。
3、因此,需要對現有的cu分區模式預測技術進行改進,以克服現有技術的缺陷。
技術實現思路
1、為克服相關技術中存在的vvc視頻編碼過程中由于復雜cu分區模式預測帶來的高計算復雜度問題,本發明的目的之一是提供一種用于vvc編碼單元的cu分區模式預測方法,該預測方法通過cnn-rnn混合神經網絡模型,結合cu的局部紋理特征和時序依賴關系預測cu分區模式,根據模型預測的置信度評分,選擇最終的cu分區模式。在保證編碼效率的前提下,降低計算復雜度,提高編碼速度。以克服現有技術中存在高計算復雜度的問題。
2、一種用于vvc編碼單元的cu分區模式預測方法,包括:
3、步驟100:構建并訓練cnn-rnn混合神經網絡模型,所述cnn-rnn混合神經網絡模型包括cnn模塊和rnn模塊,所述cnn模塊用于提取cu的局部紋理特征,所述rnn模塊用于捕捉cu的時序依賴關系;
4、步驟200:將待編碼的cu輸入所述cnn-rnn混合神經網絡模型,輸出cu分區模式的預測結果及所述預測結果的置信度評分;
5、步驟300:基于所述置信度評分,選擇以所述預測結果作為最終cu分區模式,或執行rdo搜索并以所述rdo搜索的結果作為最終cu分區模式。
6、在一些實施方式中,所述步驟300包括:
7、將所述置信度評分與第一預設閾值進行比較;
8、若所述置信度評分大于等于所述第一預設閾值,則選擇以所述預測結果作為最終cu分區模式;
9、否則,執行rdo搜索,并以所述rdo搜索的結果作為最終cu分區模式。
10、通過第一預設閾值和置信度評分,實現了基于置信度評分的決策機制。當cnn-rnn混合神經網絡模型預測結果的置信度評分較高時,表明模型對預測結果較為確定,可以直接采用預測結果作為最終cu分區模式,避免執行rdo搜索,從而節省計算資源,提高編碼速度。而當置信度評分較低時,則執行rdo搜索,以確保cu分區模式的準確性,在編碼效率和計算復雜度之間取得平衡。
11、在一些實施方式中,所述執行rdo搜索包括:
12、將所述置信度評分與第二預設閾值進行比較;
13、若所述置信度評分大于等于所述第二預設閾值,則選擇執行快速rdo搜索;
14、否則,執行完全rdo搜索。
15、通過比較置信度評分和第二預設閾值,可以判斷是否執行快速rdo搜索。當置信度評分較高時,執行快速rdo搜索,可以減少搜索范圍,降低計算復雜度;而當置信度評分較低時,執行完全rdo搜索,以保證cu分區模式的準確性,實現了更精細的計算資源分配,進一步提高了編碼效率。
16、在一些實施方式中,所述訓練cnn-rnn混合神經網絡模型包括:
17、由公開數據集獲取vvc測試視頻序列;
18、使用vtm源碼對所述vvc測試視頻序列進行全幀內編碼,獲取編碼信息及原始重建幀;
19、從所述原始重建幀中提取不同尺寸的cu及其對應的分區模式;
20、根據cu的尺寸對cu進行分類,并構建cu分區模式的樣本集;
21、對所述樣本集中cu數據進行歸一化和尺寸調整,得到訓練集;
22、用所述訓練集訓練cnn-rnn混合神經網絡模型。
23、通過使用公開數據集的vvc測試視頻序列,并使用vtm源碼進行全幀內編碼,可以獲取大量的cu及其對應的分區模式,構建高質量的訓練數據集。對cu數據進行歸一化和尺寸調整,可以提高模型訓練的效率和穩定性。使用構建的訓練集訓練cnn-rnn模型,可以使模型學習到視頻內容的特征和cu分區模式之間的關聯關系,從而實現準確的cu分區模式預測。
24、在一些實施方式中,所述不同尺寸的cu包括尺寸為16×16、32×32及64×64的cu,所述cu分區模式包括不分割、四叉樹分割、水平二叉樹分割、垂直二叉樹分割、水平三叉樹分割和垂直三叉樹分割。
25、通過指定cu尺寸為16×16、32×32及64×64,涵蓋了vvc中常用的cu尺寸,可以使模型學習到不同尺寸cu的特征。通過指定cu分區模式包括不分割、四叉樹分割、水平/垂直二叉樹分割、水平/垂直三叉樹分割,涵蓋了vvc中所有可能的cu分區模式,可以使模型預測所有類型的分區模式,從而提高模型的適用性和預測準確性。
26、在一些實施方式中,所述cnn模塊包括:
27、至少兩個3×3卷積層,所述卷積層后接relu激活函數;
28、至少兩個2×2最大池化層。
29、通過3×3卷積層能夠有效地提取局部紋理特征,并且后接的relu激活函數可以增強模型的非線性表達能力,最大池化層可以降低特征圖的維度,減少計算量。
30、在一些實施方式中,所述rnn模塊為雙向lstm網絡。
31、通過雙向lstm網絡可以同時考慮cu的過去和未來信息,捕捉更長范圍的時序依賴關系,從而更準確地預測cu分區模式,特別是對于運動劇烈的視頻序列,雙向lstm能夠更好地捕捉運動信息,提高預測準確性。
32、在一些實施方式中,所述cnn-rnn混合神經網絡模型使用交叉熵損失函數訓練,所述交叉熵損失函數為l=(1―ε)h(p,q)+εh(p,u),其中p為模型預測logits輸出,q為真實標簽,u為均勻分布,ε為平滑系數;
33、交叉熵損失函數可以有效地衡量模型預測的概率分布與真實標簽之間的差異。使模型學習到更準確的cu分區模式概率分布,從而提高預測準確性。
34、在一些實施方式中,所述置信度評分為所述cnn-rnn混合神經網絡模型輸出的cu分區模式概率分布中的最大概率值,所述第一預設閾值和第二預設閾值根據視頻序列的復雜度動態調整,所述第一預設閾值和第二預設閾值與所述視頻序列的復雜度呈正相關。
35、通過選擇模型輸出的cu分區模式概率分布中的最大概率值作為置信度評分,反映模型對預測結果的確定程度。根據視頻序列的復雜度動態調整第一預設閾值和第二預設閾值,可以使模型更好地適應不同類型的視頻內容,對于復雜度較高的視頻序列,可以降低閾值,更傾向于執行rdo搜索,以保證cu分區模式的準確性;對于復雜度較低的視頻序列,可以提高閾值,更傾向于采用模型預測結果,以降低計算復雜度,在不同復雜度的視頻序列中都能取得較好的平衡。
36、本發明的目的之二是提供一種視頻編碼設備,包括處理器和存儲器,所述存儲器存儲指令,所述指令在被所述處理器執行時,執行如上述的用于vvc編碼單元的cu分區模式預測方法。
37、通過執行上述的用于vvc編碼單元的cu分區模式預測方法,該視頻編碼設備可以實現高效的cu分區模式預測,降低vvc編碼器的計算復雜度,提高編碼效率。
38、本發明的有益效果為:
39、本發明提供的一種用于vvc編碼單元的cu分區模式預測方法,該用于vvc編碼單元的cu分區模式預測方法包括構建并訓練cnn-rnn混合神經網絡模型,將待編碼的cu輸入到訓練好的cnn-rnn混合神經網絡模型中,基于置信度評分進行決策以確定cu分區模式。通過融合cnn提取的局部紋理特征和rnn捕捉的時序依賴關系,能夠更全面地理解視頻內容,從而更準確地預測cu分區模式。相比傳統的完全依賴rdo搜索確定cu分區模式的方法,本方法能夠在保證編碼效率的前提下,顯著降低計算復雜度,提高編碼速度,尤其是在處理紋理復雜或運動劇烈的視頻序列時,優勢更加明顯。通過構建并訓練包含cnn和rnn模塊的混合神經網絡模型,能夠有效提取cu的局部紋理特征和時序依賴關系,并根據模型預測的置信度評分,自適應地選擇使用預測結果或執行rdo搜索來確定最終的cu分區模式。在置信度較高的情況下,可以直接使用模型預測結果,避免了耗時的rdo搜索,在編碼速度和編碼效率之間取得平衡。