<listing id="vjp15"></listing><menuitem id="vjp15"></menuitem><var id="vjp15"></var><cite id="vjp15"></cite>
<var id="vjp15"></var><cite id="vjp15"><video id="vjp15"><menuitem id="vjp15"></menuitem></video></cite>
<cite id="vjp15"></cite>
<var id="vjp15"><strike id="vjp15"><listing id="vjp15"></listing></strike></var>
<var id="vjp15"><strike id="vjp15"><listing id="vjp15"></listing></strike></var>
<menuitem id="vjp15"><strike id="vjp15"></strike></menuitem>
<cite id="vjp15"></cite>
<var id="vjp15"><strike id="vjp15"></strike></var>
<var id="vjp15"></var>
<var id="vjp15"></var>
<var id="vjp15"><video id="vjp15"><thead id="vjp15"></thead></video></var>
<menuitem id="vjp15"></menuitem><cite id="vjp15"><video id="vjp15"></video></cite>
<var id="vjp15"></var><cite id="vjp15"><video id="vjp15"><thead id="vjp15"></thead></video></cite>
<var id="vjp15"></var>
<var id="vjp15"></var>
<menuitem id="vjp15"><span id="vjp15"><thead id="vjp15"></thead></span></menuitem>
<cite id="vjp15"><video id="vjp15"></video></cite>
<menuitem id="vjp15"></menuitem>

基于機器學習的投資者對ESG關注度的量化評估方法及系統

文檔序號:41261655發布日期:2025-03-14 12:33閱讀:67來源:國知局

本發明屬于自然語言處理,具體涉及基于機器學習的投資者對esg關注度的量化評估方法及系統。


背景技術:

1、隨著全球對環境保護和減污降碳意識的提升,機構投資者對公司的環境、社會和治理(esg)表現日益重視,特別是在重污染行業。為了衡量機構投資者對esg的關注程度,目前存在四種主要方法。第一種方法是通過問卷調查直接了解機構投資者的esg關注情況。第二種方法是利用機構投資者投資組合中公司的esg評級的加權平均數作為衡量指標。第三種方法通過分析股東提案來評估機構投資者的esg關注,這在國外較為常見。第四種方法則是通過分析機構投資者實地調研的內容來衡量其對esg的關注。

2、然而,這些現有的衡量方法都存在不同程度的局限性和不足。問卷調查方法雖然直接,但存在衡量不準確、成本高昂的問題,且覆蓋范圍有限,樣本代表性不足,回答質量也難以保證。運用esg評級加權平均數的方法則受到評級不統一的影響,不同評級機構的標準和結果差異較大,導致衡量結果的不一致性。股東提案分析方法在國外較為可行,但在國內由于數據難以獲取,因此實施難度較大。而通過分析機構投資者實地調研內容的方法,則存在esg相關詞確定主觀性強、效率低的問題,因為專家人為確定的esg相關詞可能無法全面、準確地反映調研內容中的esg信息。


技術實現思路

1、本發明的目的就在于提供基于機器學習的投資者對esg關注度的量化評估方法及系統,以解決傳統的衡量方法往往依賴于專家人為確定的esg相關詞,存在主觀性強、效率低等問題。

2、本發明通過以下技術方案來實現上述目的:

3、第一方面、本發明提出了基于機器學習的投資者對esg關注度的量化評估方法,所述方法包括:

4、s1、收集esg報告并解析其文本內容,獲取esg報告的文本數據;

5、s2、對所述文本數據進行預處理,得到待處理語料庫;

6、s3、基于word2vec模型對所述待處理語料庫進行詞嵌入,以獲取待處理語料庫中所有詞語的向量表示,形成向量數據集;其中,所述word2vec模型采用基于負采樣的skip-gram模型進行訓練得到;

7、s4、定義代表esg報告中對應維度的種子詞,利用預先訓練的word2vec模型識別與所述種子詞相近的詞語以擴展esg相關詞,得到esg相關詞詞典;

8、s5、根據投資者在設定問答場景下esg相關詞出現的頻數確定投資者對esg關注度。

9、進一步的,步驟s2包括:

10、s2.1、對所述文本數據進行數據清洗;

11、s2.2、利用jieba分詞工具對清洗后的文本數據進行分詞,并刪除特殊字符、數字和標點符號,形成待處理語料庫。

12、進一步的,步驟s3包括:

13、s3.1、調用python庫確認輸入輸出,以初始化word2vec模型參數,并設定上下文窗口大小、詞向量維度、以及語料庫的迭代次數,選擇skip-gram模型;

14、s3.2、定義skip-gram模型結構如下:

15、(1)輸入層:將待處理語料庫中的每個詞表示為維數為詞匯表大小維數的one-hot行向量;

16、(2)隱藏層:通過維的參數矩陣,將輸入層的one-hot向量投射為空間的,其中對應w中與對應的行向量;

17、(3)輸出層:通過維的參數矩陣,接收隱藏層的輸出作為輸入,預測待處理語料庫中每個單詞出現在上下文的原始概率,并通過softmax激活函數得到真實概率分布,中與對應的列向量表示為;

18、s3.3、訓練模型:采用負采樣技術優化所述skip-gram模型,優化目標函數為:

19、;

20、;

21、其中是正樣本集,是負樣本集,表示中心詞的相鄰詞來自正樣本集,表示中心詞的相鄰詞來自負樣本集;

22、使用gensim庫,根據步驟s3.1中設定的參數和所述優化目標函數,遍歷待處理語料庫進行迭代訓練,直至達到設定的迭代次數;

23、s3.4、獲取詞向量表示,并保存模型:訓練完成后,將待處理語料庫中的每個詞轉換為設定維數的向量表示,形成向量數據集,并保存訓練好的模型。

24、進一步的,步驟s4包括:

25、s4.1、定義代表esg中環境、社會、治理的維度的種子詞,運用步驟s3.4中預先訓練好的word2vec模型,對于每個esg維度中的任意種子詞,生成詞向量;

26、s4.2、計算每個esg維度的平均向量,計算與所述向量數據集中每個詞向量之間的余弦相似度,為每個維度選擇最相似的設定數量的詞作為esg相關詞;

27、s4.3、將所述esg相關詞添加到所述向量數據集中得到esg相關詞詞典。

28、進一步的,步驟s5包括:

29、基于所述esg相關詞詞典,計算投資者在設定問答場景下對esg的關注,如下式:

30、;

31、其中表示在第年時公司的投資者對esg的關注程度,表示公司第年的esg報告中esg相關詞的頻數。

32、第二方面、本發明提出了基于機器學習的投資者對esg關注度的量化評估系統,應用于執行上述任一項所述的評估方法,所述系統包括:

33、數據收集模塊,用于收集esg報告并解析其文本內容,獲取esg報告的文本數據;

34、預處理模塊,用于對所述文本數據進行預處理,得到待處理語料庫;

35、詞嵌入模塊,用于基于word2vec模型對所述待處理語料庫進行詞嵌入,以獲取待處理語料庫中所有詞語的向量表示,形成向量數據集;其中,所述word2vec模型采用基于負采樣的skip-gram模型進行訓練得到;

36、詞典構建模塊,用于定義代表esg報告中對應維度的種子詞,利用預先訓練的word2vec模型識別與所述種子詞相近的詞語以擴展esg相關詞,得到esg相關詞詞典;

37、計算模塊,用于根據投資者在設定問答場景下esg相關詞出現的頻數確定投資者對esg關注度。

38、進一步的,所述預處理模塊還包括分詞單元和停用詞刪除單元,分詞單元用于利用jieba分詞工具進行分詞,停用詞刪除單元用于刪除特殊字符、數字和標點符號,形成待處理語料庫。

39、進一步的,所述詞嵌入模塊包括:

40、初始化單元,用于調用python庫確認輸入輸出,以初始化word2vec模型參數,并設定上下文窗口大小、詞向量維度、以及語料庫的迭代次數,選擇skip-gram模型;

41、模型構建單元,用于構建skip-gram模型結構,包括輸入層、隱藏層和輸出層,其中輸入層將待處理語料庫中的每個詞表示為維數為詞匯表大小的one-hot行向量,隱藏層通過參數矩陣將輸入層的one-hot向量投射為空間向量,輸出層通過另一參數矩陣接收隱藏層的輸出作為輸入,預測待處理語料庫中每個單詞出現在給定中心詞上下文中的概率,并通過softmax激活函數得到真實概率分布;

42、模型訓練單元,使用gensim庫,根據初始化單元設定的參數和負采樣優化單元定義的優化目標函數,遍歷待處理語料庫進行迭代訓練,直至達到設定的迭代次數;

43、詞向量獲取單元,用于訓練完成后,將待處理語料庫中的每個詞轉換為設定維數的向量表示,并形成向量數據集。

44、進一步的,所述詞典構建模塊包括:

45、種子詞定義單元,用于定義代表esg中環境、社會、治理維度的種子詞;

46、詞向量生成單元,用于結合詞嵌入模塊中預先訓練的word2vec模型,為每個esg維度中的任意種子詞生成詞向量;

47、相似詞選擇單元,用于計算每個esg維度的平均向量,并與向量數據集中每個詞向量計算余弦相似度,為每個維度選擇最相似的設定數量的詞作為esg相關詞;

48、詞典構建單元,用于將選擇的esg相關詞添加到向量數據集中,得到esg相關詞詞典。

49、本發明的有益效果在于:

50、本發明通過引入機器學習模型word2vec來確定esg相關詞,對現有的機構投資者esg關注度的衡量方法進行了顯著改進。本發明通過訓練word2vec模型,能夠自動從大量的esg報告文本中學習到與esg相關的詞匯,大大降低了主觀性,提高了衡量的準確性和效率。同時,由于word2vec模型能夠捕獲詞語之間的語義和句法相似性,因此能夠更全面地反映出機構投資者在實地調研中對esg問題的關注情況,為投資者、企業和監管機構提供了更為可靠和科學的esg關注度量化指標。

當前第1頁1 2 
網友詢問留言 已有0條留言
  • 還沒有人留言評論。精彩留言會獲得點贊!
1
韩国伦理电影