<listing id="vjp15"></listing><menuitem id="vjp15"></menuitem><var id="vjp15"></var><cite id="vjp15"></cite>
<var id="vjp15"></var><cite id="vjp15"><video id="vjp15"><menuitem id="vjp15"></menuitem></video></cite>
<cite id="vjp15"></cite>
<var id="vjp15"><strike id="vjp15"><listing id="vjp15"></listing></strike></var>
<var id="vjp15"><strike id="vjp15"><listing id="vjp15"></listing></strike></var>
<menuitem id="vjp15"><strike id="vjp15"></strike></menuitem>
<cite id="vjp15"></cite>
<var id="vjp15"><strike id="vjp15"></strike></var>
<var id="vjp15"></var>
<var id="vjp15"></var>
<var id="vjp15"><video id="vjp15"><thead id="vjp15"></thead></video></var>
<menuitem id="vjp15"></menuitem><cite id="vjp15"><video id="vjp15"></video></cite>
<var id="vjp15"></var><cite id="vjp15"><video id="vjp15"><thead id="vjp15"></thead></video></cite>
<var id="vjp15"></var>
<var id="vjp15"></var>
<menuitem id="vjp15"><span id="vjp15"><thead id="vjp15"></thead></span></menuitem>
<cite id="vjp15"><video id="vjp15"></video></cite>
<menuitem id="vjp15"></menuitem>

嵌入式多媒體基于關鍵幀的視頻檢索的實現方法

文檔序號:7955799閱讀:288來源:國知局
專利名稱:嵌入式多媒體基于關鍵幀的視頻檢索的實現方法
技術領域
本發明涉及嵌入式多媒體技術領域,特別是涉及一種嵌入式多媒體基于關鍵幀的視頻檢索的實現方法。
背景技術
目前的信息量以每1.6年翻一倍的速度急劇增長。由于Intenet的普及和廣播電視向數字化方向的發展,以數字視頻、音頻信息為代表的多媒體信息越來越多。多媒體信息具有信息量大、難描述的特點,因此,如何對這些海量信息進行組織、建庫以達到快速、有效的檢索成為當今人們需要迫切解決的問題。傳統的數據類型主要是整型、實型、布爾型和字符型,其數據庫技術可采用基于關鍵詞的檢索方式。而多媒體數據處理中,除了上述常規的數據類型外,還要處理圖像、圖形、音頻及視頻流等數據類型。如果將這種基于關鍵詞的檢索方法用于多媒體信息就會有困難,因為多媒體信息同文本、數值信息有著本質的區別。
基于內容的檢索是一種新型的多媒體檢索技術。它是指根據媒體和媒體對象的內容及上下文聯系在大規模多媒體數據庫中進行檢索,主要是利用媒體對象的語義、視覺和聽覺特征來進行檢索。它突破了傳統的基于文本檢索技術的局限,直接對圖像、視頻、音頻內容進行分析、抽取特征,利用這些內容特征建立索引并進行檢索,使得檢索更加接近媒體對象。如利用圖像中的顏色、紋理、形狀,視頻中的鏡頭、場景、鏡頭的運動,聲音中的音調、響度、音色等。它的研究目標是提供在沒有人類參與的情況下能自動識別或理解圖像重要特征的算法。由此可見,基于內容的檢索是一門涉及面很廣的交叉學科,需要利用圖像處理、模式識別、計算機視覺、圖像理解等技術,是多種技術的合成,因而有著廣泛的應用前景。
多媒體信息中,基本的信息種類有聲、像、圖、文四大類,不同的信息類型有不同的特點,同一類信息又有很多種特征,即便是提取同一特征也有很多不同的方法。比如對圖像信息來說,其特征就有邊緣、色彩、紋理等。雖然實現的難度很大,但目前世界上已經有一些基于內容檢索的系統出現,比如IBM推出的O.BIC(Query By Image Content)系統,由中國科學院計算技術研究所和北京圖書館研制的‘基于特征的多媒體信息檢索系統MIRES’等等。
如果我們在對媒體數據編碼表示時就考慮到媒體的內容,即媒體包含其表示內容的信息,那么,對這些數據的內容進行檢索就會更有效與準確。這意味著需要將基于內容的檢索與編碼結合起來考慮,在壓縮數據中應有描述視頻內容的信息,從而使對多媒體信息內容的訪問可以直接針對壓縮數據進行,這種壓縮編碼方法就叫作基于內容的壓縮方法。
目前這方面的工作已經取得很大的進展,例如基于內容的編碼標準MPEG一4和多媒體數據內容表示國際標準MPEG-7。
MPEG-4旨在將眾多的多媒體應用集于一個完整的框架內,為不同性質的視音頻數據制定通用、有效的編碼方案,提出基于具體內容的視頻對象的編碼標準。基于對象編碼的MPEG-4把支持基于內容的檢索作為目標之一,但這種支持是有限的。為了克服MPEG-4的不足,MPEG啟動了新的項目MPBG7。
MPEG-7的目標是建立一種多媒體內容描述接口(Multimedia ContentDescription Interface)進一步發展基于內容的描述和檢索規范。如MPEG-7標準的視頻部分提供視頻碼流和存儲的圖像的標準化描述,幫助用戶識別、歸類圖像和視頻,這樣在視頻檢索中,可以通過描述目標的移動、攝像機運動或者目標之間的關系得到具有相似時間和空間關系的一組視頻。在基于MPEG-7的視頻檢索中,每個鏡頭的關鍵幀和鏡頭的視覺特征被抽取并以MPEG一7標準描述存人數據庫,對應的碼流儲存在視頻數據庫中,通過瀏覽檢索結果能準確定位相應的碼流。儲存的視頻可以根據視頻內容以視頻、片段、場景、鏡頭分層次管理、添加文本注釋,以實現在不同層面范圍內的檢索,提高檢索的速度和檢索的準確率。
為了將現有的標準統一起來,MPEG又開始了新的項目MPEG-21。MPEG-21重點是創一個開放的多媒體傳輸和消費的框架,通過將不同的協議、標準和技術結合在一起,從而使用戶對視頻、音頻的處理更加方便和有效,最終為多媒體信息的用戶在全球范圍內提供透明而有效的視頻通信應用環境。
目前,MPEG系列國際標準已經成為影響最大的多媒體技術標準,并對相關產業產生了重大的影響。我們有理由相信隨著MPEG系列標準的不斷發展必將極大地推動多媒體通信領域向前更快地發展。
由于嵌入式移動終端的顯示方式千差萬別,運算能力也有較大的差距,一般來說,其CPU的運算速度從幾MHz到幾百MHz,用戶對于檢索速度、視頻顯示的要求不同,此外,由于網絡帶寬的限制,嵌入式移動終端的視頻顯示要受到帶寬的影響,因此,相對于一般的基于關鍵幀的視頻檢索的實現方法,應用于嵌入式多媒體基于關鍵幀的視頻檢索的實現方法,其對關鍵幀的提取和檢索有其不同的特點。對于嵌入式多媒體,關鍵幀的提取需要按照不同的嵌入式移動終端的要求,進行分類性的特征提取,比如對于響應速度要求高的終端,其特征的提取就要簡化,以滿足實時性為第一要務,而對于要求能夠較快的進行精確匹配的終端,其特征的提取就要全面豐富,以便于能夠快速的找到請求的媒體片段。
本發明的目的在于克服現有技術的不足,提供一種嵌入式多媒體基于關鍵幀的視頻檢索的實現方法。
本發明解決其技術問題采用的技術方案包括以下步驟(1)視頻對象分割使用視頻對象分割程序對存放于服務器端的視頻數據進行視頻分析并分割成各個鏡頭,以獨立的鏡頭作為視頻序列的基本結構單元和檢索單元,并對每個鏡頭進行運動分析;(2)對視頻數據進行特征提取完成鏡頭分割后,基于運動分析,服務器端的視頻處理程序提取并跟蹤鏡頭中的對象,同時在每個鏡頭的內部抽取有效代表該鏡頭內容的關鍵幀,進一步進行顏色、紋理和形狀的底層特征提取,并建立索引;(3)輸入用戶描述在嵌入式設備終端,用戶通過瀏覽,選擇系統提供的關鍵幀實例或者由用戶自己提供關鍵幀到系統中,將該信息通過無線網絡傳輸到嵌入式設備的服務器端進行查詢,然后再通過不斷修改實例直至找到匹配目標;(4)基于關鍵幀的檢索服務器收到查詢請求和查詢數據后,對代表視頻鏡頭的關鍵幀進行靜態圖像檢索,在檢索到目標關鍵幀后將其所代表的視頻數據傳輸到用戶的嵌入式設備終端中。
作為本發明的一種改進,對于用戶常用的視頻片段,在服務器建立索引文件。
本發明與背景技術相比,具有的有益的效果是本發明的方法是經過視頻分析,將視頻數據分割成各個鏡頭,并對每個鏡頭進行運動分析,在鏡頭分割的基礎上,基于運動分析,提取并跟蹤鏡頭中的對象,同時在每個鏡頭的內部抽取有效代表該鏡頭內容的關鍵幀,以便進一步進行特征提取,以獨立的鏡頭作為視頻序列的基本結構單元和檢索單元。本發明是一種相似度檢索,存在一個反映信息庫中的對象與檢索要求相似程度的量,檢索的結果是按照相似程度的大小順序返回相似度最大的一組對象,同時要給出檢索結果集合的大小限制,能夠更有效的進行視頻檢索。


圖1是本發明的實施過程示意圖。
具體實施例方式
本發明是一種嵌入式多媒體基于關鍵幀的視頻檢索的實現方法,下面結合圖1說明其具體實施過程。
1)視頻對象分割經過視頻分析,將視頻數據分割成各個鏡頭,以獨立的鏡頭作為視頻序列的基本結構單元和檢索單元,并對每個鏡頭進行運動分析。
通常一段視頻數據可以劃分為幾個場景,每個場景又包含一個到多個鏡頭。而一個鏡頭是由一些連續圖像幀組成的,用于表示一個場景中在時間上和空間上連續的動作。因此,視頻可以看作是一個連續靜態圖像的序列,其中的每一幅靜態圖像就是圖像幀,是組成視頻的最小單位,而關鍵幀就是一幅能描述鏡頭主要內容的圖像幀。根據內容的復雜程度,一個鏡頭可由一個或多個關鍵幀表示。正如文本索引使用關鍵詞作為標識句子、段落、文檔的指針一樣,在視頻流信息中,關鍵幀起著與關鍵詞類似的作用,常用關鍵幀來標識場景、故事等高層語義單元。因此,視頻結構分析重點也是提取具有代表性的關鍵幀,利用關鍵幀代表一個鏡頭來與檢索圖像進行相似度計算。
鏡頭分割主要是根據視頻幀的物理特性來檢測鏡頭間的邊界。比如采用顏色直方圖作為特征,研究它隨著時間的變化特性,用以確定鏡頭的邊界。鏡頭分割技術把一段視頻分割為多個鏡頭,計算機可以基于鏡頭進行瀏覽。因此,基于鏡頭的分類和檢索對于視頻庫的管理和查詢非常重要。
2)對視頻數據進行特征提取在鏡頭分割的基礎上,基于運動分析,提取并跟蹤鏡頭中的對象,同時在每個鏡頭的內部抽取有效代表該鏡頭內容的關鍵幀,以便進一步進行特征提取。這時對于關鍵幀的檢索可以用靜態圖像檢索的技術,主要是在提取視頻的顏色、紋理、形狀等低層特征之后,依據這些特征和一定的檢索算法來檢索。
由于關鍵幀中往往只有低層次的圖像特征,并沒有語義分析的能力,因此我們還必須利用視頻中的文字或音頻信息來獲得高層的對象和語義信息。此外,視頻特有的運動特性我們也可以通過目標識別、運動跟蹤等技術獲取。這樣就可根據所提取的鏡頭、關鍵幀和對象的視覺特征等進行索引,然后利用相似性測度進行視頻檢索和查詢。
各種視頻處理技術正在不斷發展,隨著新技術的出現和完善,將會提取出更多的視頻特征,為視頻數據庫的建立以及檢索提供豐富的數據基礎。目前已經有很多成熟的技術來進行鏡頭檢測和關鍵幀的提取。而對象提取和跟蹤,則是視頻特征分析中最困難的部分,普遍的方法是利用運動信息進行處理先將每幀圖像分割成具有相似視覺特征(顏色、紋理等)的區域,然后根據各個區域的運動特征,按照一定的約束(例如區域之間的連通性),將它們合并成對象。國標標準MPEG-4便是以對象提取和合成作為焦點,提出了對視頻對象進行索引。而MPEG-7便是提出對各種視頻對象信息進行描述和查找。
3)輸入用戶描述通過瀏覽選擇系統提供的實例或自己提供關鍵幀來查詢,然后再通過不斷修改實例直至找到匹配目標;4)基于關鍵幀的檢索基于關鍵幀的檢索,是對代表視頻鏡頭的關鍵幀進行檢索。這種方法通過分析給定的一段視頻流中內容的變化以及攝像機和關鍵目標的運動來選取所需關鍵幀的數目,并按照一定的規則為鏡頭抽取關鍵幀。關鍵幀是用于描述一個鏡頭的關鍵圖像,因此可以采用類似圖像檢索的方法來進行檢索,一旦檢索到目標關鍵幀,用戶就可利用播放來看它代表的視頻片段。
關鍵幀的選取應與鏡頭內容的變化有關,變化劇烈的鏡頭應以較多的關鍵幀表示。最簡單的方法是選擇鏡頭的第一幀和最后一幀兩幅圖像,例如將每個鏡頭的第一幀選作關鍵幀,這種方法的運算量小,非常適合于內容活動性小或保持不變的鏡頭,但對于攝像機不斷運動的鏡頭,該方法抽取的關鍵幀無法有效地表達其主要內容。目前一般采用聚類算法進行關鍵幀選取,如在圖像的累積顏色或運動變化大于某一閾值時,就多選取一個關鍵幀,而對于閾值則可采用非監督的聚類方法來自動選取或從統計的觀點出發,假定鏡頭長度分布符合Weibull分布,以貝葉斯估計來獲得自適應的閾值。
用幾個關鍵幀來表示視頻鏡頭,則顏色、紋理和形狀等低級特征可直接從關鍵幀提取出來用于索引與檢索。其中顏色就是一種很重要的視覺信息屬性,與其它特征相比,顏色特征非常穩定,對于旋轉、平移、尺度變化甚至各種形變都不敏感,并且計算簡單,因此成為現有檢索系統中應用最廣泛的特征。如顏色特征的提取和檢索主要是利用顏色空間直方圖進行匹配(常見的顏色坐標空間有紅綠藍、色調、飽和度、亮度等),顏色直方圖簡單來說,就是統計圖像中具有某一特定顏色的象素點數目而形成的各顏色的直方圖表示,不同的直方圖代表不同圖片的特征,通過與用戶確定的圖像顏色直方圖的相似性匹配得到查詢結果,或者將圖像進行分割,形成若干子塊,然后利用選擇小塊來確定圖象中感興趣的對象的輪廊,通過建立復雜的顏色關系來查詢圖像。
最后,還需要注意的是,以上列舉的僅是本發明的具體實施例子。顯然,本發明不限于以上實施例子,還可以有許多變形。本領域的普通技術人員能從本發明公開的內容直接導出或聯想到的所有變形,均應認為是本發明的保護范圍。
權利要求
1.嵌入式多媒體基于關鍵幀的視頻檢索的實現方法,其特征在于,包括以下步驟(1)視頻對象分割使用視頻對象分割程序對存放于服務器端的視頻數據進行視頻分析并分割成各個鏡頭,以獨立的鏡頭作為視頻序列的基本結構單元和檢索單元,并對每個鏡頭進行運動分析;(2)對視頻數據進行特征提取完成鏡頭分割后,基于運動分析,服務器端的視頻處理程序提取并跟蹤鏡頭中的對象,同時在每個鏡頭的內部抽取有效代表該鏡頭內容的關鍵幀,進一步進行顏色、紋理和形狀的底層特征提取,并建立索引;(3)輸入用戶描述在嵌入式設備終端,用戶通過瀏覽,選擇系統提供的關鍵幀實例或者由用戶自己提供關鍵幀到系統中,將該信息通過無線網絡傳輸到嵌入式設備的服務器端進行查詢,然后再通過不斷修改實例直至找到匹配目標;(4)基于關鍵幀的檢索服務器收到查詢請求和查詢數據后,對代表視頻鏡頭的關鍵幀進行靜態圖像檢索,在檢索到目標關鍵幀后將其所代表的視頻數據傳輸到用戶的嵌入式設備終端中。
2.根據權利要求1所述的嵌入式多媒體基于關鍵幀的視頻檢索的實現方法,其特征在于,對于用戶常用的視頻片段,在服務器建立索引文件。
全文摘要
本發明涉及嵌入式多媒體技術領域,旨在提供一種嵌入式多媒體基于關鍵幀的視頻檢索的實現方法。該方法包括視頻對象分割、對視頻數據進行特征提取、輸入用戶描述和基于關鍵幀的檢索的步驟。本發明是一種相似度檢索,存在一個反映信息庫中的對象與檢索要求相似程度的量,檢索的結果是按照相似程度的大小順序返回相似度最大的一組對象,同時要給出檢索結果集合的大小限制,能夠更有效的進行視頻檢索。
文檔編號H04N7/26GK1851710SQ200610051628
公開日2006年10月25日 申請日期2006年5月25日 優先權日2006年5月25日
發明者陳天洲, 趙懿, 胡威, 謝斌 申請人:浙江大學
網友詢問留言 已有0條留言
  • 還沒有人留言評論。精彩留言會獲得點贊!
1
韩国伦理电影