<listing id="vjp15"></listing><menuitem id="vjp15"></menuitem><var id="vjp15"></var><cite id="vjp15"></cite>
<var id="vjp15"></var><cite id="vjp15"><video id="vjp15"><menuitem id="vjp15"></menuitem></video></cite>
<cite id="vjp15"></cite>
<var id="vjp15"><strike id="vjp15"><listing id="vjp15"></listing></strike></var>
<var id="vjp15"><strike id="vjp15"><listing id="vjp15"></listing></strike></var>
<menuitem id="vjp15"><strike id="vjp15"></strike></menuitem>
<cite id="vjp15"></cite>
<var id="vjp15"><strike id="vjp15"></strike></var>
<var id="vjp15"></var>
<var id="vjp15"></var>
<var id="vjp15"><video id="vjp15"><thead id="vjp15"></thead></video></var>
<menuitem id="vjp15"></menuitem><cite id="vjp15"><video id="vjp15"></video></cite>
<var id="vjp15"></var><cite id="vjp15"><video id="vjp15"><thead id="vjp15"></thead></video></cite>
<var id="vjp15"></var>
<var id="vjp15"></var>
<menuitem id="vjp15"><span id="vjp15"><thead id="vjp15"></thead></span></menuitem>
<cite id="vjp15"><video id="vjp15"></video></cite>
<menuitem id="vjp15"></menuitem>

用于使用動態門限進行講話者驗證的方法與系統的制作方法

文檔序號:2822450閱讀:204來源:國知局
專利名稱:用于使用動態門限進行講話者驗證的方法與系統的制作方法
技術領域
一般地,本發明涉及講話者驗證方法與系統。更具體地,盡管并非排它性地,本發明涉及使用基于背景噪聲的估計水平設置的動態門限的講話者驗證。
背景技術
生物鑒定常常是保護對設備或設施的訪問的理想方法。與傳統的涉及物理鑰匙或者鍵入的密碼的安全鎖不同,生物鎖僅可由特定的、授權的個人操作。因此,這樣的鎖通過測量獨特的生物特性,例如指紋、眼模式、或話音簽名,來評定個人身份。當某人試圖開啟這樣的鎖時,測量該人士的一或多個生物特性,并與授權人士數據庫中的信息比較。如果找到匹配,則鎖開啟,否則鎖保持關閉。因為沒有易于丟失、失竊或忘記的鑰匙或密碼,并且因為生物簽名可以是高度可靠和獨特的,生物鎖很可能越來越普及。
涉及講話者驗證、或話音認證的生物鎖,關注話音簽名的生物匹配。講話者驗證是保護訪問的特別方便的技術,這是因為用戶可以以“免提(hand free)”的方式容易地進行之。這使得對于經常操作于“免提”模式的設備,例如移動電話與個人數字助理(PDA),講話者驗證成為理想的安全技術。
因此,存在無數種試圖分類和匹配人類話音的特性,以允許話音簽名作為生物鑰匙得到可靠使用的算法。算法包括高斯混合模型通用背景模型(GMM-UBM)方法。在GMM-UBM講話者鑒定中,以GMM建模授權的講話者。使用大的語音語料庫(large speech corpus)首先創建高階講話者無關的UBM。其后,使用貝葉斯(Bayesian)或最大后驗概率(MAP)適配方法,從UBM導出單個講話者的模型。其后,將模型與輸入話音特性向量比較,以確定特定輸入話音是否匹配GMM-UBM模型之一。
如大多數檢測系統那樣,講話者驗證系統通常被調諧,以提供想要的接收器操作特性(ROC)。檢測/錯誤折衷(DET)曲線是測量ROC的通用方法,其評估兩種類型的錯誤誤拒絕率與誤接受率。關于講話者驗證,當授權的人士試圖將他的或她的話音與話音模型匹配,但該人士被驗證系統不適當地拒絕時,誤拒絕發生。當未授權的人士,例如冒名頂替者,能夠成功地將他的或她的話音與為另一人士創建的話音模型匹配,從而獲得對設備或設施的不適當的訪問時,誤接受發生。
許多檢測系統被校準,使得系統操作于誤接受率曲線與誤拒絕率曲線相交的狀況。該狀況常常被稱為等錯誤率(EER)點,其提供了位于過多的誤接受與過多的誤拒絕之間的平衡。


為使本發明易于理解和投入實用,現在將參照示例性實施例,如參照所附繪圖所示,其中在各個分立的視圖中,相似的引用號指代相同或功能上相似的組件。繪圖連同下面的詳細描述集成到說明書中并形成說明書的一部分,以進一步闡釋實施例,和解釋各種原則與優點,其遵照本發明,其中圖1是闡釋無線電話形式的無線通信設備的示意圖;圖2是闡釋接收器操作特性(ROC)曲線的典型集的圖形;圖3是闡釋兩對誤接受/誤拒絕(FA/FR)ROC曲線的圖形;圖4是闡釋恒定FR錯誤率曲線的圖形,其中門限Th顯示為SNR的函數;圖5是闡釋恒定FA錯誤率曲線的圖形,其中門限Th顯示為SNR的函數和圖6是闡釋遵照本發明的一個實施例的講話者驗證方法的步驟的流程圖。
本領域技術人員將意識到,圖中的組件為簡單和清晰起見而繪制,不一定遵照比例畫出。例如,圖中某些組件的尺寸相對于其它組件可能被夸大,以幫助促進對本發明的實施例的理解。
具體實施例方式
在詳細描述遵照本發明的實施例之前,需要觀察到的是,實施例主要存在于涉及用于使用動態門限進行講話者驗證的方法與系統的方法步驟與設備組件的組合。相應地,在適宜時,圖中以傳統符號表示設備組件與方法步驟,僅顯示與理解本發明的實施例相關的特定細節,從而避免對于本領域普通技術人員而言顯而易見的細節壓倒這里的描述,令本公開變得晦澀。
在本文檔中,關系術語,例如第一與第二、頂與底、等等僅用于將一實體或動作從另一實體或動作區分開來,而不一定要求或暗示在這樣的實體或動作之間(存在)任何實際的這樣的關系或順序。術語“包括”或其任何其它變形意欲指代非排它性的包括,使得包括一組組件的過程、方法、物品、或設備不僅包括這些組件,還可包括未特別地列出的或為該過程、方法、物品、或設備所固有的其它組件。在無更多限制時,“包括...”之后的組件不排除在包括該組件的過程、方法、物品、或設備中存在其它相同組件。
參照圖1,闡釋無線電話100形式的無線通信設備的示意圖,無線電話100包括射頻通信單元102,其被連接以與處理器103通信。無線電話100還具有小鍵盤106與顯示屏105,其被連接以與處理器103通信。如對于本領域技術人員而言將顯而易見的那樣,屏105可以是觸摸屏,從而使小鍵盤106成為可選項。
處理器103包括編碼器/解碼器111,其具有相關聯的代碼只讀存儲器(ROM)112,其為編碼和解碼可由無線電話100發送或接收的話音或其它信號存儲數據。處理器103還包括微處理器113,其由公共數據與地址總線117連接到編碼器/解碼器111、字符只讀存儲器(ROM)114、隨機存取存儲器(RAM)104、靜態可編程存儲器116與SIM接118。靜態可編程存儲器116與SIM(常稱為SIM卡)可操作地連接到SIM接口118,除其它功能之外,其可分別存儲所選擇的進來的文本消息與電話號碼數據庫(TND)(電話簿),其包括用于電話號碼的號碼域以及用于標識符的名稱域,名稱域中的標識符與號碼之一相關聯。例如,電話號碼數據庫TND中的一個條目可以是91999111111(在號碼域中輸入),其名稱域中為相關聯的標識符“StevenC!at work”。SIM卡與靜態存儲器116還可存儲密碼或訓練語音信號語料庫,以允許訪問無線電話100上的受保護功能。
微處理器113具有端口,以連接到小鍵盤106與屏105和警報115,警報115典型地包括警報揚聲器、振動器馬達與相關聯的驅動器。而且,微處理器113具有端口,以連接到麥克風135和通信揚聲器140。字符只讀存儲器114存儲碼字,以解碼或編碼可由通信單元102接收的文本消息。在此實施例中,字符只讀存儲器114也存儲用于微處理器113的操作碼字(OC),并存儲用于進行與無線電話100相關聯的功能的碼字。
射頻通信單元102為具有公共天線107的組合的接收器與發送器。通信單元102具有收發器108,其經由射頻放大器109連接到天線107。收發器108也連接到組合調制器/解調器110,以將通信單元102連接到處理器103。
參照圖2,闡釋本領域眾所周知的接收器操作特性(ROC)曲線的典型集的圖形。y軸表示錯誤率,而x軸表示門限設置,特定檢測系統操作于該門限以產生一組給定的錯誤率。如應用于講話者驗證(SV)技術,例如可包括在無線電話100中的那樣,誤接受(FA)曲線表示這樣的錯誤率,其中未授權的人士,例如冒名頂替者,能夠成功地將他的或她的話音與為另一人士創建的話音模型匹配,從而獲得對電話100的不適當的訪問。誤拒絕(FR)曲線表示這樣的錯誤率,其中授權的人士試圖將他的或她的話音與話音模型匹配,但對電話100的訪問被不適當地拒絕。兩曲線的交點常被稱為等錯誤率(EER)點。如本領域眾所周知的那樣,檢測系統常被校準,以操作在EER點或接近EER點,以提供最優性能。
關于無線電話100中包括的SV系統,如果系統被校準以操作在對應于門限設置T0的EER點,電話100可為授權的用戶提供方便程度的訪問安全性,其中電話100可快速地、可靠地驗證授權的(用戶)的話音,而拒絕未授權的用戶的訪問。然而,如果用戶要求電話100更可靠地識別授權的用戶的話音,系統可被校準以操作在對應于門限設置T1的更低的FR率。另一方面,如果用戶要求電話100的更大的訪問安全性,SV系統可被校準以操作在對應于門限設置T2的更低的FA率。
參照圖3,闡釋兩對FA/FR ROC曲線的圖形。遵照本發明,已觀察到SV系統在不同的背景噪聲環境中遵照不同的FA/FR ROC曲線起作用。在SV系統中測量背景噪聲的一種方法使用語音噪聲比(SNR)。安靜的背景生成高的SNR,而嘈雜的背景生成低的SNR。當SV系統從具有高SNR的環境移動到具有較低SNR的環境時,定義系統的ROC的FA/FR曲線將改變,并且一般將左移。這樣,在圖2中,FA1/FR1曲線對表示操作于相對高SNR的SV系統。如果系統移動到相對較低SNR環境,系統的ROC可由第二對曲線FA2/FR2定義。這意味著如果用戶尋求維持電話100,比如說,操作于特定FR率,當SNR環境改變時,電話100的門限設置T必須改變。
例如,再次參照圖2,可將SV系統設置于門限T1,以便在由曲線FA1/FR1表示的安靜環境中提供要求的FR率2.0%。然而,如果系統移動到由曲線FA2/FR2表示的嘈雜環境,則EER點從T0移動到T’0,并且如果T1被維持為門限,FR率將從2.0%增加到3.5%。FR率這樣的增加可能代表用戶不可接受的、特定ROC之外的系統性能。如果用戶要求系統在嘈雜環境中操作于原來的FR率2.0%,門限必須從T1移動到T’1。
作為進一步的示例,考慮這樣的SV系統,其中FR率從相對安靜的環境(SNR=25dB)中的2.0%變為最壞情形的嘈雜環境(SNR=5dB)中的10%。如果SV系統的性能規范要求FR率<1.5%,則必須使用最壞情形的SNR=5dB來設置系統門限。這樣的設置將保證FR率始終低于所要求的規范。然而,在該門限設置下,在較安靜的狀況(較大的SNR)中,FR率將不必要的低,而FA率將不必要的高。表1提供當門限固定在0.167時,這樣的系統的SV性能(FR率與FA率)的示例,使得FR率在最壞情形的SNR為1.5%。表1中清楚的是,這樣的固定門限將導致不同的背景噪聲環境中不同的FR與FA率。
表1

遵照本發明,SV系統的門限設定是可調節的。可基于操作環境的SNR中的變化來實時調節的動態門限設定導致改善的SV性能。這樣,要求恒定FR或FA率的SV應用,例如用于移動電話100的,可動態地調節系統門限,以響應SNR中的變化。
因此,將這樣的遵照本發明的實施例的動態或可變門限定義為SNR的函數,其遵照方程1Th=f(SNR). 方程1為獲取相應的映射函數f(*),要求對固定的FR或FA率與變化的SNR處的門限變化進行比較。
參照圖4與5,分別是闡釋恒定FR與FA錯誤率曲線的圖形,其中門限Th顯示為SNR的函數。由“*”字符限定的曲線集表示經驗數據,而由“O”字符限定的曲線集表示經驗數據的數學近似。在圖4中顯然的是,當FR率增加時,門限值增大;而在圖5中顯然的是,當FA率增加時,門限值減小。因此,使用兩組不同的方程(一組用于FR,而另一組用于FA)來近似經驗數據。
對于固定FR率系統,一個這樣的示例性的方程組為ThFR=C*log(SNR)+f(FR),C=0.2;方程2f(FR)=-(0.01*FA2-0.12*FA+0.39).方程3這些方程在圖4中作為由“O”限定的曲線繪出。
對于固定FA率系統,一個這樣的示例性的方程組為
ThFA=C*log(SNR)+f(FA),C=0.08;方程4f(FA)=0.01*FA2-0.12*FA+0.39.方程5這些方程在圖5中作為由“O”限定的曲線繪出。
本領域技術人員將認識到,遵照本發明,基于變化的背景噪聲水平,可使用各種其它的方程來定義SV系統的適宜的門限設置。
例如,遵照本發明的一個實施例,可使用由移動電話100接收的語音信號來驗證講話者的身份。可使用動態門限設置Th來符合指定ROC,例如可接受的FR率。這樣,可從諸如辦公室等安靜環境確定用于移動電話100的初始SV門限設置。當在諸如公共汽車等相對嘈雜的環境中操作電話100時,對SNR進行估計,并以從存儲在電話100的存儲器中的相應的公式估計的值更新門限Th。更新的門限適宜于新環境,這樣,預定義的FR率將保持在想要的范圍。進一步地,本領域技術人員將意識到,遵照本發明的SV系統可集成到除移動電話100之外的各種類型的設備中,例如個人數字助理與筆記本電腦,其可能經歷變化水平的背景噪聲。
表2提供由不同的SNR定義的噪聲環境中SV系統性能的示例。這里,為闡釋起見,假定移動電話100的SV系統理想地操作于1.45%的FR率。遵照本發明的教導,基于背景噪聲的變化,動態地調節門限設定,以便維持幾乎恒定的FR率。表2闡釋FR率在所有噪聲水平將保持基本一致,而FA率在較安靜的背景狀況中變得低得多。遵照由表2描述的本發明的示例的平均FA率是5.42%。相反,遵照相同環境中、但使用具有固定門限設定的傳統SV系統的類似的電話100的FA率可高達9.22%。
表2

遵照圖6,闡釋遵照本發明的一個實施例的講話者驗證方法600的流程圖。在步驟605,估計接收的語音信號的語音噪聲比(SNR)。例如,遵照本發明的一個實施例,移動電話100的用戶可向電話100的麥克風135說話,并執行集成在電話的ROM 112、RAM 104或靜態可編程存儲器116中的軟件以估計SNR。接著,在步驟610,確定門限設定,其為SNR與特定接收器操作特性(ROC)的函數。如上面所描述的那樣,指定ROC的一個示例是目標FR率,意欲在該目標FR率處操作電話100。最后,在步驟615,使用確定的門限設定處理語音信號,以驗證講話者的屬性,并符合指定ROC。例如,在移動電話100的情形中,可使用微處理器113處理語音信號,以便驗證用戶的身份,并提供到電話100的受保護的訪問。在這樣的情形中,可使用本發明的語音驗證方法600來替代標準的基于碼字的鎖定系統,其中用戶必須在電話小鍵盤106上鍵入碼字,以便解鎖和訪問電話100。
可由本發明的方法600驗證的其它講話者屬性包括可基于話音特性分配給某個人士或某組人士的任何類型的屬性。因此,在特定情形中,這樣的屬性可包括講話者的身份、語言、性別、或年齡。例如,可編程遵照本發明的語音驗證系統,以鑒定小孩的話音,并響應以與成人不同的方式。
總之,本發明提供改善的方法與系統,其用于使用動態門限來驗證講話者的屬性。使用動態門限允許用于諸如移動電話100等設備的給定的ROC保持在指定的范圍之內。進一步地,可確定ROC,使得其適宜于特定SNR。例如,遵照本發明的一個實施例,可編程移動電話100,以提供規定的FR或FA率,其適宜于估計水平的背景噪聲。這樣,改善了關于電話100的可靠話音激活安全特性的服務質量。
上面的細節描述僅提供示例性實施例,而無意限制本發明的范圍、適用性、或配置。相反地,示例性實施例的詳細描述向本領域技術人員提供這樣的描述,其允許他們實現本發明的示例性實施例。需要理解的是,可在組件與步驟的功能與排列中進行各種變化,而不偏離如所附權利要求書所述的本發明的實質與范圍。本領域技術人員將意識到,這里描述的本發明的實施例可包括一或多個傳統處理器以及獨特的存儲的程序指令,其控制所述一或多個處理器連同特定的非處理器電路實現使用動態門限進行講話者驗證的一些、大部分、或全部功能,如這里所描述的那樣。非處理器電路可包括,但不限于,無線接收器、無線發送器、信號驅動器、時鐘電路、電源電路、與用戶輸入設備。同樣地,可將這些功能解釋為使用動態門限進行講話者驗證的方法的步驟。作為可供選擇的另一替代方案,可使用沒有存儲的程序指令的狀態機實現一些或全部功能,或者在一或多個專用集成電路(ASIC)中(實現一些或全部功能),其中將每一功能或者特定功能的某些組合作為定制邏輯來實現。當然,可使用兩種方法的組合。這樣,已描述了這些功能的方法與設備。進一步地,盡管可能需要顯著的努力,以及存在由,比如說,可用時間、當前技術、與經濟考慮等激發的許多設計選擇,當由這里公開的概念與原則指導時,預期本領域普通技術人員將能夠容易地生成這樣的軟件指令與程序與IC,而只需最少的實驗。
在前面的詳述中,已描述本發明的特定實施例。然而,本領域普通技術人員意識到,可進行各種修改與變動,而不偏離如所附權利要求書所闡明的本發明的范圍。相應地,說明書與附圖應被視為闡釋性的而非限制性的,并且所有這樣的修改均被試圖包括在本發明的范圍之內。好處、優點、問題的解決方案,以及任何可引起任何好處、優點、或解決方案發生或變得更加顯著的元素,不應被解釋為任何權利要求的決定性的、必需的、或本質性的特性或元素。本發明僅由所附權利要求書,包括在本申請的預決期間進行的任何修正,以及權利要求的所有等價物,來定義。
權利要求
1.一種講話者驗證的方法,其包括估計接收的語音信號的語音噪聲比(SNR);確定門限設定,其為所述SNR與指定接收器操作特性(ROC)的函數;和使用所述門限設定來處理所述語音信號,以驗證講話者的屬性,并符合所述的指定的ROC。
2.如權利要求1所述的方法,其中所述的指定的ROC為誤拒絕(FR)率、誤接受(FA)率、或等錯誤率(EER)狀況。
3.如權利要求1所述的方法,其中所述門限設定是誤接受(FA)率ROC的函數,且遵照下面的公式確定ThresholdFA=C*log(SNR)+f(FA)。
4.如權利要求1所述的方法,其中所述門限設定是誤拒絕(FR)率ROC的函數,且遵照下面的公式確定ThresholdFR=C*log(SNR)+f(FR)。
5.如權利要求1所述的方法,其中所述的處理所述語音信號的步驟包括將所述語音信號的屬性與訓練語音信號語料庫的屬性匹配。
6.如權利要求1所述的方法,其中所述講話者屬性從下面的組中挑選講話者的身份、講話者講的語言、講話者的性別、或講話者的年齡。
7.一種講話者驗證系統,其包括麥克風,其被適配以接收語音信號;和微處理器,其可被操作地連接到所述麥克風;其中所述微處理器被適配,以便估計所述語音信號的語音噪聲比(SNR);確定門限設定,其為所述SNR與指定接收器操作特性(ROC)的函數;和使用所述門限設定來處理所述語音信號,以驗證講話者的屬性,并符合所述的指定的ROC。
8.如權利要求7所述的系統,其中所述的指定的ROC為誤拒絕(FR)率、誤接受(FA)率、或等錯誤率(EER)狀況。
9.如權利要求7所述的系統,其中所述門限設定是誤接受(FA)率ROC的函數,且遵照下面的公式確定ThresholdFA=C*log(SNR)+f(FA)。
10.如權利要求7所述的系統,其中所述門限設定是誤拒絕(FR)率ROC的函數,且遵照下面的公式確定ThresholdFR=C*log(SNR)+f(FR)。
11.如權利要求7所述的系統,其中處理所述語音信號包括將所述語音信號的屬性與訓練語音信號語料庫的屬性匹配。
12.如權利要求7所述的系統,其中所述講話者屬性從下面的組中挑選講話者的身份、講話者講的語言、講話者的性別、或講話者的年齡。
13.如權利要求7所述的系統,其中所述系統被可操作地連接到電子設備,以提供到所述設備的受安全保護的訪問。
14.如權利要求13所述的系統,其中所述電子設備是移動電話、個人數字助理或筆記本電腦。
全文摘要
本發明公開一種用于使用動態門限進行講話者驗證的方法與系統,其對于驗證諸如講話者的身份等講話者屬性是有用的。該方法包括估計接收的語音信號的語音噪聲比(SNR)(步驟605)。接著,確定門限設定,其為SNR與指定接收器操作特性(ROC)的函數(步驟610)。其后,使用門限設定來處理語音信號,以驗證講話者的屬性,并符合指定的ROC(步驟615)。
文檔編號G10L17/00GK1924997SQ20051009764
公開日2007年3月7日 申請日期2005年8月29日 優先權日2005年8月29日
發明者張亞昕, 韓兆兵, 黃偉 申請人:摩托羅拉公司
網友詢問留言 已有0條留言
  • 還沒有人留言評論。精彩留言會獲得點贊!
1
韩国伦理电影