本發明屬于自然語言處理,具體涉及基于機器學習的投資者對esg關注度的量化評估方法及系統。
背景技術:
1、隨著全球對環境保護和減污降碳意識的提升,機構投資者對公司的環境、社會和治理(esg)表現日益重視,特別是在重污染行業。為了衡量機構投資者對esg的關注程度,目前存在四種主要方法。第一種方法是通過問卷調查直接了解機構投資者的esg關注情況。第二種方法是利用機構投資者投資組合中公司的esg評級的加權平均數作為衡量指標。第三種方法通過分析股東提案來評估機構投資者的esg關注,這在國外較為常見。第四種方法則是通過分析機構投資者實地調研的內容來衡量其對esg的關注。
2、然而,這些現有的衡量方法都存在不同程度的局限性和不足。問卷調查方法雖然直接,但存在衡量不準確、成本高昂的問題,且覆蓋范圍有限,樣本代表性不足,回答質量也難以保證。運用esg評級加權平均數的方法則受到評級不統一的影響,不同評級機構的標準和結果差異較大,導致衡量結果的不一致性。股東提案分析方法在國外較為可行,但在國內由于數據難以獲取,因此實施難度較大。而通過分析機構投資者實地調研內容的方法,則存在esg相關詞確定主觀性強、效率低的問題,因為專家人為確定的esg相關詞可能無法全面、準確地反映調研內容中的esg信息。
技術實現思路
1、本發明的目的就在于提供基于機器學習的投資者對esg關注度的量化評估方法及系統,以解決傳統的衡量方法往往依賴于專家人為確定的esg相關詞,存在主觀性強、效率低等問題。
2、本發明通過以下技術方案來實現上述目的:
3、第一方面、本發明提出了基于機器學習的投資者對esg關注度的量化評估方法,所述方法包括:
4、s1、收集esg報告并解析其文本內容,獲取esg報告的文本數據;
5、s2、對所述文本數據進行預處理,得到待處理語料庫;
6、s3、基于word2vec模型對所述待處理語料庫進行詞嵌入,以獲取待處理語料庫中所有詞語的向量表示,形成向量數據集;其中,所述word2vec模型采用基于負采樣的skip-gram模型進行訓練得到;
7、s4、定義代表esg報告中對應維度的種子詞,利用預先訓練的word2vec模型識別與所述種子詞相近的詞語以擴展esg相關詞,得到esg相關詞詞典;
8、s5、根據投資者在設定問答場景下esg相關詞出現的頻數確定投資者對esg關注度。
9、進一步的,步驟s2包括:
10、s2.1、對所述文本數據進行數據清洗;
11、s2.2、利用jieba分詞工具對清洗后的文本數據進行分詞,并刪除特殊字符、數字和標點符號,形成待處理語料庫。
12、進一步的,步驟s3包括:
13、s3.1、調用python庫確認輸入輸出,以初始化word2vec模型參數,并設定上下文窗口大小、詞向量維度、以及語料庫的迭代次數,選擇skip-gram模型;
14、s3.2、定義skip-gram模型結構如下:
15、(1)輸入層:將待處理語料庫中的每個詞表示為維數為詞匯表大小維數的one-hot行向量;
16、(2)隱藏層:通過維的參數矩陣,將輸入層的one-hot向量投射為空間的,其中對應w中與對應的行向量;
17、(3)輸出層:通過維的參數矩陣,接收隱藏層的輸出作為輸入,預測待處理語料庫中每個單詞出現在上下文的原始概率,并通過softmax激活函數得到真實概率分布,中與對應的列向量表示為;
18、s3.3、訓練模型:采用負采樣技術優化所述skip-gram模型,優化目標函數為:
19、;
20、;
21、其中是正樣本集,是負樣本集,表示中心詞的相鄰詞來自正樣本集,表示中心詞的相鄰詞來自負樣本集;
22、使用gensim庫,根據步驟s3.1中設定的參數和所述優化目標函數,遍歷待處理語料庫進行迭代訓練,直至達到設定的迭代次數;
23、s3.4、獲取詞向量表示,并保存模型:訓練完成后,將待處理語料庫中的每個詞轉換為設定維數的向量表示,形成向量數據集,并保存訓練好的模型。
24、進一步的,步驟s4包括:
25、s4.1、定義代表esg中環境、社會、治理的維度的種子詞,運用步驟s3.4中預先訓練好的word2vec模型,對于每個esg維度中的任意種子詞,生成詞向量;
26、s4.2、計算每個esg維度的平均向量,計算與所述向量數據集中每個詞向量之間的余弦相似度,為每個維度選擇最相似的設定數量的詞作為esg相關詞;
27、s4.3、將所述esg相關詞添加到所述向量數據集中得到esg相關詞詞典。
28、進一步的,步驟s5包括:
29、基于所述esg相關詞詞典,計算投資者在設定問答場景下對esg的關注,如下式:
30、;
31、其中表示在第年時公司的投資者對esg的關注程度,表示公司第年的esg報告中esg相關詞的頻數。
32、第二方面、本發明提出了基于機器學習的投資者對esg關注度的量化評估系統,應用于執行上述任一項所述的評估方法,所述系統包括:
33、數據收集模塊,用于收集esg報告并解析其文本內容,獲取esg報告的文本數據;
34、預處理模塊,用于對所述文本數據進行預處理,得到待處理語料庫;
35、詞嵌入模塊,用于基于word2vec模型對所述待處理語料庫進行詞嵌入,以獲取待處理語料庫中所有詞語的向量表示,形成向量數據集;其中,所述word2vec模型采用基于負采樣的skip-gram模型進行訓練得到;
36、詞典構建模塊,用于定義代表esg報告中對應維度的種子詞,利用預先訓練的word2vec模型識別與所述種子詞相近的詞語以擴展esg相關詞,得到esg相關詞詞典;
37、計算模塊,用于根據投資者在設定問答場景下esg相關詞出現的頻數確定投資者對esg關注度。
38、進一步的,所述預處理模塊還包括分詞單元和停用詞刪除單元,分詞單元用于利用jieba分詞工具進行分詞,停用詞刪除單元用于刪除特殊字符、數字和標點符號,形成待處理語料庫。
39、進一步的,所述詞嵌入模塊包括:
40、初始化單元,用于調用python庫確認輸入輸出,以初始化word2vec模型參數,并設定上下文窗口大小、詞向量維度、以及語料庫的迭代次數,選擇skip-gram模型;
41、模型構建單元,用于構建skip-gram模型結構,包括輸入層、隱藏層和輸出層,其中輸入層將待處理語料庫中的每個詞表示為維數為詞匯表大小的one-hot行向量,隱藏層通過參數矩陣將輸入層的one-hot向量投射為空間向量,輸出層通過另一參數矩陣接收隱藏層的輸出作為輸入,預測待處理語料庫中每個單詞出現在給定中心詞上下文中的概率,并通過softmax激活函數得到真實概率分布;
42、模型訓練單元,使用gensim庫,根據初始化單元設定的參數和負采樣優化單元定義的優化目標函數,遍歷待處理語料庫進行迭代訓練,直至達到設定的迭代次數;
43、詞向量獲取單元,用于訓練完成后,將待處理語料庫中的每個詞轉換為設定維數的向量表示,并形成向量數據集。
44、進一步的,所述詞典構建模塊包括:
45、種子詞定義單元,用于定義代表esg中環境、社會、治理維度的種子詞;
46、詞向量生成單元,用于結合詞嵌入模塊中預先訓練的word2vec模型,為每個esg維度中的任意種子詞生成詞向量;
47、相似詞選擇單元,用于計算每個esg維度的平均向量,并與向量數據集中每個詞向量計算余弦相似度,為每個維度選擇最相似的設定數量的詞作為esg相關詞;
48、詞典構建單元,用于將選擇的esg相關詞添加到向量數據集中,得到esg相關詞詞典。
49、本發明的有益效果在于:
50、本發明通過引入機器學習模型word2vec來確定esg相關詞,對現有的機構投資者esg關注度的衡量方法進行了顯著改進。本發明通過訓練word2vec模型,能夠自動從大量的esg報告文本中學習到與esg相關的詞匯,大大降低了主觀性,提高了衡量的準確性和效率。同時,由于word2vec模型能夠捕獲詞語之間的語義和句法相似性,因此能夠更全面地反映出機構投資者在實地調研中對esg問題的關注情況,為投資者、企業和監管機構提供了更為可靠和科學的esg關注度量化指標。