<listing id="vjp15"></listing><menuitem id="vjp15"></menuitem><var id="vjp15"></var><cite id="vjp15"></cite>
<var id="vjp15"></var><cite id="vjp15"><video id="vjp15"><menuitem id="vjp15"></menuitem></video></cite>
<cite id="vjp15"></cite>
<var id="vjp15"><strike id="vjp15"><listing id="vjp15"></listing></strike></var>
<var id="vjp15"><strike id="vjp15"><listing id="vjp15"></listing></strike></var>
<menuitem id="vjp15"><strike id="vjp15"></strike></menuitem>
<cite id="vjp15"></cite>
<var id="vjp15"><strike id="vjp15"></strike></var>
<var id="vjp15"></var>
<var id="vjp15"></var>
<var id="vjp15"><video id="vjp15"><thead id="vjp15"></thead></video></var>
<menuitem id="vjp15"></menuitem><cite id="vjp15"><video id="vjp15"></video></cite>
<var id="vjp15"></var><cite id="vjp15"><video id="vjp15"><thead id="vjp15"></thead></video></cite>
<var id="vjp15"></var>
<var id="vjp15"></var>
<menuitem id="vjp15"><span id="vjp15"><thead id="vjp15"></thead></span></menuitem>
<cite id="vjp15"><video id="vjp15"></video></cite>
<menuitem id="vjp15"></menuitem>

使用祖先數據進行基因組分析的方法和系統的制作方法

文檔序號:570952閱讀:836來源:國知局
專利名稱:使用祖先數據進行基因組分析的方法和系統的制作方法
使用袓先數據進行基因組分析的方法和系統交叉引用本申請要求于2007年9月26日提交的美國臨時申請60/975,495的優先權,其全 部內容通過引用方式結合在此。
背景技術
人類基因組測序和人類基因組學中的其它最新發展表明任意兩個人之間的基因 組組成可具有超過99. 9%的相似性。但是個體間存在的相對較小數量的DNA變異會導致表 型性狀的差異,并與許多人類疾病、對各種不同疾病的易感性和對疾病治療的響應相關。個 體間的DNA差異出現在編碼和非編碼區,并包括在基因組DNA序列中的特定位點上的堿基 改變以及DNA的插入和缺失。出現在基因組單個堿基位置上的改變被稱為單核苷酸多態性 或 “SNP,,。盡管SNP在人類基因組中相對罕見,但是它們占個體間DNA序列變異的大多數,在 人類基因組中每1200個堿基對會出現大約1次(參見國際HapMap計劃,www. hapmap. org)。 隨著可獲得更多的人類遺傳信息,人們逐漸了解到SNP的復雜性。隨之,人們發現基因組中 SNP的出現與各種疾病和癥狀的存在和/或易感性相關。隨著這些相關性的發現和人類遺傳學中的其它進展,醫學和個人保健總體上會朝 向個性化的途徑發展,其中患者特別地根據他或她的基因組信息來進行適當的醫療和其它 選擇。有可能影響考慮的一個重要因素為個體的祖先數據(家系)或種族。例如,由于各 種可能的原因例如重組率的差異、選擇壓力或種群瓶頸(bottleneck),不同的群體可具有 不同的連鎖不平衡模式。因此,如果已對群體A進行了研究而在該群體中獲得了與表型相 關的遺傳變異的特定優勢比(odds ratio),并不能在群體B中也假定具有相同的優勢比。 因此,需要向個體和他們的保健提供者(care-giver)提供個體特定的個人基因組信息(包 括祖先數據)以最終提供個性化的醫療和其它決定。

發明內容
本發明提供了用于評估個體表型的基因型相關性的方法,包括a)獲得所述個體 的遺傳樣品;b)產生所述個體的基因組譜;C)通過比較所述個體的基因組譜和目前的人類 基因型-表型相關性數據庫來確定所述個體的基因型與表型之間的相關性;d)向所述個體 或所述個體的醫療保健管理者報告來自步驟(c)的結果;e)在附加的人類基因型相關性已 知時,用該附加的人類基因型相關性來更新人類基因型相關性的數據庫;f)通過將步驟C) 的個體基因組譜或其部分與附加的人類基因型相關性相比較并確定個體的附加的基因型 相關性來更新個體的基因型相關性;和g)向個體或個體的醫療保健管理者報告步驟f)的 結果。本發明進一步提供了評估個體的基因型相關性的商業方法,包括a)獲得個體的 遺傳樣品;b)產生個體的基因組譜;C)通過將個體的基因組譜與人類基因型相關性的數據 庫相比較來確定個體的基因型相關性;d)以加密方式向個體提供確定個體的基因型相關性的結果;e)在附加的人類基因型相關性已知時,用附加的人類基因型相關性來更新人類 基因型相關性的數據庫;f)通過將個體的基因組譜或其部分與附加的人類基因型相關性 相比較和確定個體的附加的基因型相關性來更新個體的基因型相關性;和g)向個體或個 體的醫療保健管理者提供更新個體的基因型相關性的結果。本發明的另一方面為產生個體的表型譜的方法,包括a)提供包括規則的規則 集,各規則表明至少一種基因型與至少一種表型之間的相關性;b)提供包括多個個體中的 每一個的基因組譜的數據集,其中各基因組譜包括多個基因型;c)定期地使用至少一條新 的規則來更新規則集,其中該至少一條新的規則表明之前未在規則集中相互關聯的基因型 和表型之間的相關性;d)將各新的規則應用于至少一個個體的基因組譜,因而對于該個體 將至少一種基因型與至少一種表型相關聯;和任選地e)產生包括個體的表型譜的報告。本發明還提供了一種系統,包括a)包括規則的規則集,各規則表明至少一種基 因型與至少一種表型之間的相關性;b)定期地使用至少一條新的規則來更新規則集的代 碼,其中該至少一條新的規則表明之前未在規則集中相互關聯的基因型與表型之間的相關 性;c)包括多個個體的基因組譜的數據庫;d)將規則集應用于個體的基因組譜以確定個體 的表型譜的代碼;和e)產生各個體的報告的代碼。
本發明還進一步提供了用于評估個體的基因型相關性的方法,包括(a)比較(i) 包括與表型相關的遺傳變異的第一連鎖不平衡(LD)模式和(ii)包括該遺傳變異的第二LD 模式,其中第一 LD模式為第一個體群體的LD模式和第二 LD模式為第二個體群體的LD模 式;(b)由(a)的比較確定第二群體中遺傳變異與表型相關的概率;(c)包括使用步驟(b) 的概率,由個體的基因組譜評估所述表型的基因型相關性;和(d)向所述個體或所述個體 的醫療保健管理者報告包括步驟(c)的基因型相關性的結果。在一些實施方式中,該方法 還進一步包括(e)使用附加的遺傳變異來更新所述結果。該概率可為優勢比(OR),其中OR可源自已知的OR。例如已知的OR可以為與第一 群體的表型相關的遺傳變異的0R,例如在科技期刊上公布的對于遺傳變異(例如SNP)的 OR。在一些實施方式中,第一群體和第二群體具有相似的LD模式。本發明還提供了評估個 體的基因型相關性的方法,包括(a)確定第一個體群體中多個遺傳變異中的每一個的原 因遺傳變異概率;(b)確定作為第二個體群體中所述多個遺傳變異中的每一個的概率的步 驟(a)中的各所述概率;(c)包括使用步驟(b)的概率從個體的基因組譜評估基因型相關 性;和(d)向個體或個體的醫療保健管理者報告包括來自步驟(c)的基因型相關性的結果。 在一些實施方式中,該方法還進一步包括(e)使用附加的遺傳變異來更新所述結果。已知的遺傳變異(例如SNP)可為具有在科技期刊中公布的OR的遺傳變異。該概 率可為優勢比(OR),且步驟(a)的各遺傳變異可以接近于與第一群體中的表型相關的已知 遺傳變異。例如,各遺傳變異可與已知的遺傳變異連鎖不平衡。在此公開的方法和系統的一些實施方式中,基因型相關性作為GCI評分報告。第 二群體通常具有不同于第一群體的家系,且所述個體具有第二群體的家系。在一些實施方 式中,原因遺傳變異是未知的。遺傳變異可為單核苷酸多態性(SNP)。本發明的另一方面為以加密或非加密的方式在網絡上進行傳輸,上述的方法和系 統。報告可以通過在線入口、通過紙件或通過電子郵件進行。使用的基因組譜可被產生和 來自遺傳樣品。第三方可產生基因組譜、獲得遺傳樣品,或既獲得樣品也產生基因組譜。遺傳樣品可為DNA或RNA,且從選自下述的生物樣品獲得血液、頭發、皮膚、唾液、精液、尿液、 糞便、汗液和口腔樣品。基因組譜可存放在加密的數據庫或保險庫中。此外,基因組譜可為 單核苷酸多態性譜,且在一些實施方式中,基因組譜可包括截短、插入、缺失或重復。基因組 譜可通過使用高密度DNA微陣列、RT-PCR、DNA測序或多種技術的組合產生。 本發明的方法還包括包含任何HapMap群體(YRI、CEU、CHB、JPT、ASW、CHD、GIH、 LWK、MEX、MKK、TSI)的群體或任何其它的群體,例如但不限于非裔美國人、高加索人、德系猶 太人、西班牙系猶太人(S印haradic Jewish)、印度人、太平洋島民、中東人、德魯茲人、貝都 因人、南歐人、斯堪的納維亞人、東歐人、北非人、巴斯克人、西非人或東非人。通過引用加入本說明書中提到的所有出版物和專利申請均通過引用的方式結合在此,就好像每 篇出版物或專利申請均特定地和個別地說明通過引入方式結合在此一樣。附圖簡述

圖1為顯示本發明的方法方面的流程圖。圖2為基因組DNA質量控制措施的例子。圖3為雜交質量控制措施的例子。圖4為來自具有測試的SNP和效應評價的公開文獻的典型基因型相關性的表。 A-I)表示單個基因座的基因型相關性;J)表示兩個基因座的基因型相關性;K)表示三個基 因座的基因型相關性;L)為A-K中使用的種族和國家縮寫的索引;M)為A-K中的表型名稱 縮寫(ShortPhenotype Name)縮略詞的索引、遺傳率和遺傳率的參考文獻。圖5A-J為具有效應評價的典型基因型相關性的表。圖6A-F為典型基因型相關性和估計的相對危險度的表。圖7為示例報告。圖8為用于分析和通過網絡傳送基因組譜和表型譜的系統的示意圖。圖9為表明本發明的商業方法方面的流程圖。圖10為示意圖,表明所公布的具有特定優勢比的CEU(高加索人家系/種族)的 SNP不能假定在具有不同的祖先背景的不同群體(YRI,約魯巴人家系/種族,參見HapMap
M (http://hapmap.org/hapmappopulations.html.en))中t百同。
具體實施例方式本發明提供了基于存儲的個體或個體組的基因組譜來產生表型譜的方法和系統, 以及基于存儲的基因組譜容易地產生原始的和更新的表型譜的方法和系統。通過從由個體 獲得的生物樣品確定基因型來產生基因組譜。得自個體的生物樣品可以是可從中獲得遺傳 樣品的任何樣品。樣品可來自口腔拭子、唾液、血液、頭發或任何其它類型的組織樣品。然 后可從生物樣品確定基因型。基因型可以是任何遺傳性變型或生物標志物,例如單核苷酸 多態性(SNP)、單倍體型或基因組序列。基因型可以是個體的完整基因組序列。基因型可由 產生成千或上百萬的數據點的高通量分析獲得,例如對于大多數或所有已知的SNP的微陣 列分析。在另一些實施方式中,還可以通過高通量測序來確定基因型。基因型形成個體的基因組譜。基因組譜被數字化地存儲,且方便地在任何時間點 訪問以產生表型譜。通過應用使基因型與表型相關或關聯的規則來產生表型譜。可以基于表明基因型與表型之間的相關性的科學研究來制定規則。該相關性可由一個或多個專家組 成的委員會評議(curated)或確定。通過將規則應用于個體的基因組譜,可以確定個體的 基因型與表型之間的相關性。個體的表型譜將具有這一確定性。該確定可為個體的基因型 與給定的表型之間的正相關性,從而個體具有給定的表型或將會產生該表型。或者,也可確 定為個體不會具有或不會產生給定的表型。在其它的實施方式中,該確定可以是危險因子、 估計值或者個體具有或將產生表型的概率。可以基于多種規則進行確定,例如,可以將多種規則應用于基因組譜以確定個體 基因型與特定表型的關聯。確定過程也可以包括特定于個體的因素,例如種族、性別、生活 方式、年齡、環境、家族病史、個人病史和其它已知表型。特定因素的并入可以通過修正現有 的規則來包括這些因素。或者,可由這些因素產生單獨的規則,且在已應用現有的規則之后 應用到個體的表型確定中。表型可以包括任何可測定的性狀或者特性,例如對于某種疾病的易感性或者對于 藥物治療的反應。可以包括的其它表型是軀體和精神性狀,例如,身高、體重、頭發顏色、目艮 睛顏色、曬斑敏感性、尺碼、記憶力、智力、樂觀程度、整體性情。表型也可以包括與其他個體 或生物體的遺傳比較。例如,個體可能對他們的基因組譜與名人的基因組譜之間的相似性 感興趣。他們也可能使他們的基因組譜與其它生物體(例如細菌、植物或其它動物)進行 比較。在本發明的另一方面中,組合并分析了關于多種遺傳標記與一種或多種疾病或狀 態的關聯的信息以獲得遺傳綜合指數(GeneticComposite Index、GCI)評分(例如PCT公 布NO.W02008/067551中描述的,其通過引用方式結合在此)。這一評分包括了已知的危險 因子以及其它信息和假設,例如,等位基因頻率和疾病的流行度。GCI可以用于定量評估 疾病或者狀態與一系列遺傳標記的綜合效應的關聯。GCI評分可以用于基于現有科學研 究向未受過遺傳學訓練的人提供有關與相關群體相比其個體患病風險的可靠的(例如,穩固的)、可理解的和/或直觀的認識。GCI評分可以用于生成GCI Plus評分,如PCT公布 No. W02008/067551中所述。GCI plus評分可包括所有的GCI假設,包括狀態的風險(例如, 終生風險)、年齡限定的流行度和/或年齡限定的發病率。然后個體的終生風險可以計算 為與個體GCI評分除以平均GCI評分成比例的GCI Plus評分。平均GCI評分可以由具有 相似家系背景的個體組確定,例如一組高加索人、亞洲人、東印度人或者其他具有共同家系 背景的組。所述組可以由至少5、10、15、20、25、30、35、40、45、50、55或60個個體組成。在 某些實施方式中,平均值可以由至少75、80、95或100個個體確定。GCI Plus評分可以通 過確定個體的GCI評分,用平均相對風險去除該GCI評分,并乘以狀態或表型的終生風險來 確定。例如,使用來自PCT公布No. W02008/067551的數據(例如圖22和/或圖25以及圖 24的信息)來計算GCI Plus評分(例如圖19)。本發明包括使用此處描述的GCI評分,本領域普通技術人員將會容易地認識使用 GCI評分或其變化來代替在此描述的GCI評分。在一個實施方式中,對于各感興趣的疾病 或者狀態生成GCI評分。可以集中這些GCI評分以形成個體的風險譜。GCI評分可被數 字化存儲,從而在任何時間點均可容易地使用它們來產生風險譜。風險譜可以按照大的疾 病分類進行分解,例如,癌癥、心臟病、代謝紊亂、精神紊亂、骨病或者老年病(age on-set disorder)。大的疾病分類可以進一步被分解成子類。例如,對于如癌癥的大的分類,可以例如按類型(肉瘤、癌瘤或者白血病等)或者按組織特異性(神經、乳腺、卵巢、睪丸、前列 腺、骨、淋巴結、胰腺、食道、胃、肝、腦、肺、腎等)列出癌癥的子類。在另一個實施方式中,對個體產生GCI評分,向他們提供容易理解的關于個體獲 得至少一種疾病或狀態的風險或對于至少一種疾病或狀態的易感性的信息。在一個實施方 式中,對于不同的疾病或狀態生成多項GCI評分。在另一實施方式中,可以通過在線入口訪 問至少一項GCI評分。或者,可以以紙件形式提供至少一項GCI評分,后續的更新也以紙件 形式提供。在一個實施方式中,向注冊用戶提供對于至少一項GCI評分的訪問,該注冊用戶 是預訂服務的個體。在一個替代的實施方式中,向非注冊用戶提供訪問權限,其中他們可以 具有訪問他們的GCI評分中的至少一項的受限的訪問權限,或者他們可以允許生成他們的 GCI評分中的至少一項的初始報告,但是僅通過付費訂制才生成更新的報告。在另一實施方 式中,醫療保健管理者和提供者,例如護理人員、醫生和遺傳顧問,也可以具有訪問個體GCI 評分中的至少一項的權限。。 總之,對于個體所確定的相關表型的集合組成該個體的表型譜。表型譜可以通過 在線入口訪問。或者,表型譜可以按照在特定時間存在的形式以紙件形式提供,后續的更新 也以紙件形式提供。表型譜也可以通過在線入口提供。該在線入口可以任選地為加密的在 線入口。表型譜的訪問權可以提供給注冊用戶,該注冊用戶為訂制生成表型與基因型之間 的相關性的規則、確定個體的基因組圖譜、將規則應用于基因組圖譜和生成個體的表型譜 的服務的個體。訪問權也可以提供給非注冊用戶,其中他們可以具有訪問他們的表型譜和 /或報告的有限權限,或者可以允許生成初始報告或表型譜,但是只有通過付費訂制才生成 更新的報告。醫療保健管理者和提供者,例如護理人員、醫生和遺傳顧問也可以具有表型譜 的訪問權。在本發明的另一方面中,可以為注冊用戶和非注冊用戶生成基因組譜,并且進行 數字存儲,但是對于表型譜和報告的訪問可以限于注冊用戶。在另一變型中,注冊用戶和 非注冊用戶都可以訪問其基因型譜和表型譜,但是非注冊用戶具有受限制的訪問權限或者 允許生成有限的報告,然而注冊用戶具有完整的訪問權限并且可以允許生成完整報告。在 另一實施方式中,注冊用戶和非注冊用戶最初可以具有完全的訪問權限或者完整的初始報 告,但僅注冊用戶可以訪問基于其存儲的基因組譜更新的報告。也可以有基本注冊模式。基本注冊可以提供表型譜,其中注冊用戶可以選擇將所 有現有規則應用于他們的基因組譜,或者將現有規則的子集應用于他們的基因組譜。例如, 他們可以選擇僅應用可處置(actionable)的疾病表型的規則。基本注冊可以在注冊等級 內具有不同水平。例如,不同的水平可以取決于注冊用戶想要與他們的基因組圖譜關聯的 表型數目,或者取決于可以訪問他們的表型譜的人員的數目。基本注冊的另一水平可以將 特定于個體的因素,例如早已知道的表型(如年齡、性別或者病史)并入他們的表型譜。基本注冊的再另一個水平可以允許個體生成對于疾病或狀態的至少一項GCI評 分。如果由于用于生成至少一項GCI評分的分析中的變化而導致至少一項GCI評分的任 何變化,這一水平的變型形式可以進一步允許個體指定生成對于疾病或者狀態的至少一項 GCI評分的自動更新。在一些實施方式中,可以通過電子郵件、語音信息、文本信息、郵遞或 傳真向個體通告自動更新。注冊用戶也可以生成具有他們的表型譜以及關于表型的信息(例如關于表型的遺傳和醫療信息)的報告。例如,報告中可以包括群體中表型的流行度、用于相關的遺傳 變異、引起表型的分子機制、對于表型的治療方法、對于表型的治療選擇和預防性行動。在 其它實施方式中,報告還可以包括例如個體的基因型與其他個體(如名人或者其他知名人 士)的基因型之間的相似性的信息。關于相似性的信息可以是,但不限于同源性百分比、相 同變異的數目和可能相似的表型。這些報告可以進一步包括至少一項GCI評分。如果在線訪問報告,則報告也可以提供連接到具有關于表型的進一步信息的其他 位置的鏈接、連接到具有相同表型或者一個或多個相似表型的人的在線支持小組和留言板 的鏈接、聯系在線遺傳顧問或醫生的鏈接或者連接到安排遺傳顧問或醫師的電話或現場預 約的鏈接。如果報告是紙件形式,則信息可以是上述鏈接的站點位置或者遺傳顧問或醫生 的電話號碼和地址。注冊用戶也可以選擇哪些表型包括在他們的表型譜中和哪些信息包括 在他們的報告中。表型譜和報告也可以被個體的醫療保健管理者或提供者取得,例如護理 人員、醫生、精神病醫生、心理學家、治療專家或者遺傳顧問。注冊用戶也能夠選擇是否表型 譜和報告或者其部分內容由個體的醫療保健管理者或提供者得到。本發明也可以包括注冊的高級水平。注冊的高級水平在生成初始表型譜和報告 之后數字化地保持其基因組譜,并且注冊用戶能夠利用由最近的研究得到的更新的相關性 生成表型譜和報告。在另一實施方式中,注冊用戶能夠利用由最近的研究得到的更新的相 關性生成風險譜和報告。由于研究揭示出基因型與表型、疾病或者狀態之間的新的相關性, 基于這些新的相關性將產生新的規則,并且新的規則能夠應用于已經存儲和保持的基因組 譜。新的規則可以關聯先前未與任何表型關聯的基因型、使基因型與新的表型相關聯、修正 現有的相關性或者基于新發現的基因型與疾病或狀態之間的關聯提供調整GCI評分的基 礎。可以通過電子郵件或者其它電子方式告知注冊用戶新的相關性,并且如果是感興趣的 表型,他們可以選擇用新的相關性更新他們的表型譜。注冊用戶可以選擇為每次更新付費、 為在指定時間期限(例如,3個月、6個月或者1年)內的多次更新或無限次更新付費的注 冊方式。另一注冊水平可以是,無論何時基于新的相關性產生了新的規則,注冊用戶使他們 的表型譜或者風險譜自動更新,而不是個體選擇何時更新他們的表型譜或風險譜。在注冊的另一方面,注冊用戶可以向非注冊用戶介紹以下服務生成表型與基因 型之間的相關性規則,確定個體的基因組譜,將規則應用于基因組譜,并且生成個體的表型 譜。注冊用戶通過介紹可以使注冊用戶得到優惠的服務訂制價格或者使其現有的注冊升 級。被介紹的個體可以在有限時間內免費訪問或者享受折扣注冊價格。可以對于人類和非人類個體生成表型譜和報告以及風險譜和報告。例如,個體可 包括其它的哺乳動物,例如牛、馬、羊、犬或貓。如在此所使用的,注冊用戶是通過購買或支 付一項或多項服務而訂制服務的人類個體。服務可以包括,但不限于以下一種或者多種確 定他們自己或另一個體(例如注冊用戶的孩子或寵物)的基因組譜;獲得表型譜;更新表 型譜和獲得基于他們的基因組譜和表型譜的報告。。在本發明的另一方面,可以從個體聚集得出“區域部署(field-cbployed) ”機制以 生成個體的表型譜。在優選實施方式中,個體可以具有基于遺傳信息生成的初始表型譜。例 如,生成包括對于不同表型的危險因子以及建議的治療或預防措施的初始表型譜。例如,表 型譜可以包括對于關于某一狀態的可利用的藥物治療的信息和/或對于飲食變化或鍛煉 方案的建議。個體可以選擇去看醫生或遺傳顧問或者通過網絡入口或電話接觸醫生或遺傳顧問以討論他們的表型譜。個體可以決定采取某種行動路線,例如,采用特定的藥物治療、 改變他們的飲食等。 而后,個體可以隨后提交生物樣品以評估其身體狀態的變化和危險因子的可能變 化。個體可以通過直接將生物樣品提交給生成基因組譜和表型譜的機構(或者相關機構, 例如由生成遺傳分布圖和表型譜的實體定約的機構)確定該變化。或者,個體可以利用“區 域部署”機制,其中個體可以將他們的唾液、血液或者其它生物樣品提交到其家庭處的檢測 裝置中,由第三方進行分析,且數據經傳輸以包括在另一表型譜中。例如,個體可以接收基 于其遺傳數據的初始表型報告從而向具有增大的心肌梗死(MI)終生風險的個體報告。該 報告也可以具有預防措施的建議以降低MI的風險,例如降膽固醇藥物和飲食改變。個體可 以選擇接觸遺傳顧問或醫生以討論該報告和預防措施并且決定改變他們的飲食。在采用新 的飲食一段時間之后,個體可以去看他們的個人醫生以測量其膽固醇水平。可以將新的信 息(膽固醇水平)傳送(例如,通過Internet)給具有基因組信息的實體,并且新的信息用 于生成具有心肌梗死和/或其它狀態的新的危險因子的個體的新表型譜。個體也可以使用“區域部署”機制或者直接機制以確定其對于具體藥物治療的個 體反應。例如,個體可以測量其對于藥物的反應,并且該信息可以用于確定更有效的治療。 可測定的信息包括,但不限于代謝產物水平、葡萄糖水平、離子水平(例如,鈣、鈉、鉀、鐵)、 維生素、血細胞計數、體重指數(BMI)、蛋白質水平、轉錄物水平、心率等,這些信息能夠通過 容易利用的方法確定并且能夠包括在算法中以與初始基因組譜結合來確定修正的整體風 險評估評分。術語“生物樣品,,是指可從中分離個體的遺傳樣品的任何生物樣品。在此使用的“遺傳樣品”是指從個體獲得的或源自個體的DNA和/或RNA。在此使用的術語“基因組”是指人類細胞核中發現的整套染色體DNA。術語“基因 組DNA”是指人類細胞核中天然存在的一個或多個染色體DNA分子,或染色DNA分子的部分。術語“基因組譜”是指關于個體基因的一組信息,例如是否存在特定的SNP或突 變。基因組譜包括個體的基因型。基因組譜還可以是個體的基本上完整的基因組序列。在 一些實施方式中,基因組譜可為至少60%、80%或95%的完整的個體基因組序列。基因組 譜可為大約100%的完整的個體基因組序列。提到基因組譜時,“其一部分”是指完整基因 組的基因組譜的子集的基因組譜。術語“基因型”是指個體DNA的特定的遺傳組成。基因型可包括個體的遺傳性變 型和遺傳標記。遺傳標記和遺傳性變型可包括核苷酸重復、核苷酸插入、核苷酸缺失、染色 體轉位、染色體復制或拷貝數變異。拷貝數變異可包括微衛星重復、核苷酸重復、著絲粒重 復或端粒重復。基因型還可以是SNP、單倍體型或二倍體型(diplotype)。單倍體型可指基 因座或等位基因。單倍體型還被稱作統計學關聯的單個染色單體的一組單核苷酸多態性 (SNP)。二倍體型是一組單倍體型。術語單核苷酸多態性或“SNP”是指在染色體上相對于存在于人類種群中一基因座 上的含氮堿基的同一性表現出變異(例如至少1個百分點(1%))的特定基因座。例如,在 一個個體在給定基因的特定核苷酸位置上可能具有腺苷(A)的情況下,另一個體可能在這 一位置上有胞嘧啶(C)、鳥嘌呤(G)或者胸腺嘧啶(T),從而在這個特定位置上存在SNP。此處使用的術語“SNP基因組譜”是指整個個體全基因組DNA序列的SNP位置上給定的個體DNA的堿基含量。“SNP譜”可指整個基因組譜,或可指其部分,例如可與特定的基 因或特定的基因組相關的更局部的SNP譜。術語“表型”用于描述個體的定量性狀或者特征。表型包括,但不限于醫學和非醫 學狀態。醫學狀態包括疾病和紊亂。表型也可以包括身體性狀如發色、生理性狀如肺容量、 精神性狀如記憶保持、情緒性狀如憤怒控制能力、種族特征如種族背景、家系特征如個體出 身位置以及年齡特征如年齡期待或不同表型的發病年齡。表型也可以是單基因的,其中據 認為一個基因可能與表型相關聯;或者是多基因的,其中一個以上的基因與表型相關聯。
“規則”用于定義基因型與表型之間的相關性。規則可以通過數值定義相關性,例 如通過百分率、危險因子或者置信度評分。規則可以包括多個基因型與表型的相關性。“規 則集”包括一個以上的規則。“新規則”可以是表明其規則目前尚不存在的基因型與表型之 間的相關性的規則。新規則可以將未關聯的基因型與表型相關聯。新規則也可以將已經與 表型相關聯的基因型與先前不關聯的表型相關聯。“新規則”也可以是由其它因素(包括 另一規則)修正的現有規則。現有規則可以由于個體的已知特征,例如種族、家系、地理、性 另IJ、年齡、家族史或其它先前確定的表型,而進行修正。如在此所使用的,“基因型相關性”指個體基因型(例如某一突變或多個突變的存 在)與傾向于發生一種表型(例如特定疾病、狀態、身體狀態和/或精神狀態)的可能性之 間的統計相關性。在特定基因型存在下觀察到特定表型的頻率決定了基因型相關性的程度 或者出現特定的表型的可能性。例如,正如在此所詳述的,導致載脂蛋白E4同種型的SNP 與傾向于早發型阿爾茨海默氏病相關。基因型相關性也可以指其中不傾向于產生表型的相 關性或者負相關性。基因型相關性也可以表示個體具有表型或者傾向于發生表型的評估。 可以由數值表示基因型相關性,例如百分數、相對風險因子、效應評價或者置信度評分。術語“表型譜”是指與個體的一個基因型或者多個基因型相關的多個表型的集合。 表型譜可以包括通過將一條或多條規則應用于基因組譜所產生的信息或者有關應用于基 因組譜的基因型相關性的信息。可以通過應用將多個基因型與表型關聯的規則生成表型 譜。概率或評估可以表示為數值,例如百分數、數字的危險因子或者數字的置信區間。概率 也可以表示為高、中或低。表型譜也可以表明表型是否存在或者產生表型的風險。例如,表 型譜可以表明藍眼睛的存在或者發生糖尿病的高風險。表型譜也可以表明預測的預后、治 療效果或者對醫學狀態的治療的反應。術語風險譜是指對于一種以上的疾病或狀態的GCI評分的集合。GCI評分基于對 個體基因型與一種或多種疾病或狀態之間的關聯的分析。風險譜可以顯示按疾病分類分組 的GCI評分。進一步,風險譜還可以顯示如何隨個體年齡或者多種危險因子的調整而預測 GCI評分的變化的信息。例如,對于特定疾病的GCI評分可以考慮飲食變化或者采取的預防 措施(停止吸煙、服藥、雙側根治性乳房切除術、子宮切除術)的效應。GCI評分可以顯示為 數值計量、圖形顯示、聽覺反饋或者任何前述方式的組合。在此使用的術語“在線入口,,是指個體通過計算機和互聯網網站、電話或者允許對 信息進行類似訪問的其它方式方便地訪問的信息源。在線入口可以是加密網站。該網站可 以提供與其它加密和非加密網站的鏈接,例如連接具有個體的表型譜的加密網站的鏈接或 者連接非加密網站(如共有特定表型的個體的留言板)的鏈接。除非特別表明,本發明的實施可以利用本領域技術人員能力范圍內的分子生物學、細胞生物學、生物化學和免疫學的常規技術和使用說明。這些常規技術包括核酸分離、 聚合物陣列合成、雜交、連接和使用標記物的雜交檢測。合適的技術的特定的例子在此例 證和作為參考。但是,也可以使用其它等效的常規方法。其它的常規的技術和描述可參 見標準實驗室手冊和教科書,例如 GenomeAnalysis :A Laboratory Manual Series (Vols. I-IV), PCR Primer :ALaboratory Manual, Molecular Cloning :A Laboratory Manual (均 來自 Cold Spring Harbor Laboratory Press) ;Stryer, L. (1995)Biochemistry (4th Ed.) Freeman, New York ;Gait,"Oligonucleotide Synthesis :APractical Approach,,1984, IRL Press, London, Nelson 禾口 Cox (2000) ;Lehninger, Principles of Biochemistry 3rd Ed. ,W. H. Freeman Pub. ,New York, N. Y.;禾口 Berg 等人(2002) Biochemistry, 5th Ed., W. H. Freeman Pub.,New York, N. Y.,其全部通過引用方式結合在此。本發明的方法包括分析個體基因組譜以向個體提供關于表型的分子信息。正如在 此所詳述的,個體提供生成個人基因組譜的遺傳樣品。通過使基因組譜與已確立和驗證的 人類基因型相關性的數據庫相比較,查詢個體基因組譜有關基因型相關性的數據。已確立 和驗證的基因型相關性的數據庫可以來自同行評議(peer-reviewed)的文獻,并且由本領 域中一個或多個專家(例如遺傳學家、流行病學家或者統計學家)的委員會進一步評判,并 進行驗證。在優選實施方式中,規則基于經驗證的基因型相關性制定,并應用于個體的基因 組譜以生成表型譜。個體基因組譜的分析結果(表型譜)以及解釋和支持性信息一起提供 給個體或個人的醫療保健管理者,從而給予對個體保健進行個性化選擇的能力。本發明的方法在圖1中詳細描述,其中首先生成個體的基因組譜。個體基因組譜 將包括有關基于遺傳變異和遺傳標記的個體基因的信息。遺傳變異是基因型,其組成基因 組譜。這些遺傳變異或者遺傳標記包括,但不限于單核苷酸多態性、單和/或多核苷酸重 復、單和/或多核苷酸缺失、微衛星重復(通常具有5 1,000重復單元的小量核苷酸重 復)、二核苷酸重復、三核苷酸重復、序列重排(包括易位和重復)、拷貝數變異(在特定基 因座上的缺失和增加)等。其它遺傳變異包括染色體重復和易位以及著絲粒重復和端粒重
Μ. ο基因型還可包括單倍體型和二倍體型。在一些實施方式中,基因組譜可具有至少 100000,300000,500000或1000000個基因型。在一些實施方式中,基因組譜為個體的基本 完整的基因組序列。在其它的實施方式中,基因組譜為至少60%、80%或95%的個體的完 整基因組序列。基因組譜可為大約100%的個體的完整基因組序列。包含靶物質的遺傳樣 品包括但不限于未擴增的基因組DNA或RNA樣品或擴增的DNA (或cDNA)。靶物質可為包含 特別感興趣的遺傳標記的基因組DNA的特定區域。在圖1的102步驟中,個體的遺傳樣品從個體的生物樣品中分離出來。這樣的生 物樣品包括但不限于血液、頭發、皮膚、唾液、精液、尿液、糞便、汗液、口腔和不同身體組織。 在一些實施方式中,組織樣品可直接由個體收集,例如個體可使用拭子從他們的頰內側獲 得口腔樣品。其它的樣品例如唾液、精液、尿液、糞便或汗液也可由個體自己提供。其它生 物樣品可以由保健專業人員(例如抽血者、護士或者醫生)提取。例如,血液樣品可以由護 士從個體抽取。組織活檢可以由保健專業人員進行,并且保健專業人員也可以利用試劑盒 以有效地獲得樣品。可以移取小的柱面皮膚樣品或者使用針移取小的組織或流體樣品。在一些實施方式中,向個體提供具有用于個體生物樣品的樣品采集容器的試劑盒。試劑盒也可以提供個體直接采集其自身樣品的說明書,例如需提供多少頭發、尿、汗液 或者唾液。試劑盒也可以包括個體要求由保健專業人員提取組織樣品的說明書。試劑盒可 以包括可由第三方采集樣品的場所,例如可以將試劑盒提供給隨后從個體采集樣品的保健 機構。試劑盒還可以提供用于將樣品遞送至樣品處理機構的返回包裝,在該機構中遺傳物 質從生物樣品中分離(步驟104)。DNA或RNA的遺傳樣品可根據幾種已知的生化和分子生物學方法的任一種從 生物樣品中進行分離,例如參見Sambrook等人,Molecular Cloning :A Laboratory Manual (Cold Spring HarborLaboratory,New York) (1989)。還存在幾種用于從生物樣品 中分離DNA或RNA的市售的試劑盒和試劑,例如可從DNA Genotek,GentraSystems,Qiagen, Ambion和其它供應商購買的那些。口腔樣品試劑盒很容易購買到,例如從Epicentre Biotechnologies購買的MasterAmp Buccal Swab DNA提取試劑盒,且從血樣中提取DNA 的試劑盒也容易購買到,例如從Sigma Aldrich購買的Extract-N-Amp 。可以通過使用蛋 白酶消化組織和加熱、離心樣品和使用酚_氯仿來提取不想要的物質并使DNA留在水相中 來從其它的組織中獲得DNA。可使用乙醇沉淀法來進一步分離DNA。在一個優選的實施方案中,從唾液中分離基因組DNA。例如,使用可從DNA Genotek 購買的DNA自收集試劑盒技術,個體可采集用于臨床處理的唾液樣品。樣品可以便利地在 室溫下進行儲存和運輸。在將樣品轉移到用于處理的適合的實驗室之后,通過熱變性和蛋 白酶消化樣品(通常使用收集試劑盒供應商提供的試劑,在50°C下至少一個小時)來分離 DNA。然后離心樣品,使用乙醇沉淀上清液。DNA沉淀懸浮于適于后續分析的緩沖液中。在另一個實施方式中,RNA可用作遺傳樣品。特別地,表達的遺傳變異可從mRNA =中識別。術語“信使RNA”或“mRNA”包括但不限于前mRNA轉錄物、轉錄物加工中間體、準備 用于一個基因或多個基因的翻譯和轉錄的成熟mRNA或者源自mRNA轉錄物的核酸。轉錄物 加工可以包括剪接、編輯和降解。如在此所使用的,源自mRNA轉錄物的核酸是指mRNA轉錄 物或其子序列最終充當其合成模板的核酸。因此,由mRNA反轉錄的cDNA、從cDNA擴增的 DNA、從擴增的DNA轉錄的RNA等都是源自mRNA轉錄物。可以使用本領域已知的方法從幾 種身體組織中的任意一種分離RNA,例如使用從PreAnalytiX獲得的PAXgene 血液RNA系 統從未分級的(unfractionated)全血中分離RNA。典型地,mRNA將用于反轉錄cDNA,cDNA 隨后被使用或進行擴增以用于基因變異分析。基因組譜分析之前,遺傳樣品通常會從DNA或從RNA反轉錄的cDNA進行擴增。可 通過一些方法來擴增DNA,其中許多方法使用PCR。參見例如PCR Technology principles and Applications forDNA Amplification(Ed. H. A. ErIich, Freeman Press, NY, N. Y., 1992) ;PCR Protocols :A Guide to Methods and Applications (Eds. Innis ^Α Academic Press, San Diego, Calif.,1990) ;Mattila 等人,Nucleic AcidsRes. 19,4967(1991); Eckert φ A, PCR Methods and Applications 1,17(1991) ;PCR(Eds. McPherson φ A, IRL Press, Oxford);和美國專利 No. 4,683,202,4,683,195,4,800,159 4,965,188 和 5,333,675,其全部通過引用方式結合在本文中。其它合適的擴增方法包括連接酶鏈反應(LCR)(例如Wu和Wallace,Genomics 4,560 (1989),Landegren 等人,Science 241,1077 (1988)和 Barringer 等人· Gene 89 117(1990))、轉錄擴增(Kwoh 等人,Proc. Natl. Acad. Sci. USA86 :1173_1177 (1989)和 W088/10315)、自主序列復制(Guatelli 等人,Proc. Nat. Acad. Sci. USA,87 1874-1878 (1990)和W090/06995)、目標多聚核苷酸序列的選擇性擴增(美國專利 No. 6,410,276)、共有序列引物聚合酶鏈反應(CP-PCR)(美國專利No. 4,437,975)、任機引 物聚合酶鏈反應(AP-PCR)(美國專禾Ij No. 5,413,909,5,861,245)、基于核酸的序列擴增 (NABSA)、滾環擴增(RCA)、多重替換擴增(MDA)(美國專利No. 6,124,120和6,323,009)和 環對環擴增(C2CA) (Dahl 等人 Proc. Natl. Acad. Sci 101:4548-4553(2004))。(參見美國 專利No. 5,409,818,5,554,517,和6,063,603,其全部通過引用方式結合在本文)。還可使 用的其它的擴增方法描述在美國專利No. 5,242,794,5,494,810,5,409,818,4,988,617, 6,063,603和5,554,517中和美國專利申請序列號No. 09/854,317中,其全部通過引用方式 結合在本文中。 使用幾種方法中的任意方法來進行步驟106中基因組譜的產生。可以使用幾種 方法中的任一種來進行基因組譜的產生。本領域中已知幾種方法可識別遺傳變異,它們包 括但不限于通過幾種方法的任意一種的DNA測序、基于PCR的方法、片段長度多態性分析 (限制性片段長度多態性(RFLP)、分裂片段長度多態性(CFLP))、使用等位基因特異性的 寡核苷酸作為模板的雜交方法(例如TaqMan分析和微陣列,其進一步在此描述)、使用引 物延伸反應的方法、質譜(例如MALDI-T0F/MS方法)等,例如Kwok,Pharmocogenomicsl 95-100(2000)中描述的。其它的方法包括侵入物方法,例如單重(monoplex)和二重 (biplex)侵入物分析(例如可從Third WaveTechnologies,Madison,WI獲得的,且描述于 Olivier 等人,Nucl. AcidsRes. 30 :e53 (2002)中)。在一個實施方式中,高密度DNA陣列被用于SNP識別和譜產生。這樣的陣列是可 從 Affymetrix 和 Illumina 獲得的(例如參見 Affymetrix GeneChip 500K 測試手冊, Affymetrix, Santa Clara, CA (在此引入作為參考);Sentrix humanHap650Y 基因型微球 芯片,Illumina, San Diego, CA)。例如,可通過使用Affymetrix Genome Wide Human SNP 陣列 6· 0 對多于 900000 個的SNP進行基因分型來產生SNP譜。或者,可以通過使用Affymetrix GeneChip Human Mapping 500K Array Set確定通過全基因組采樣分析的多于500000個SNP。在這些測定 中,人類基因組的子集使用限制性酶消化的、接頭連接的人類基因組DNA通過單引物擴增 反應來擴增。如圖2所示,然后可以確定連接的DNA的濃度。而后擴增的DNA斷裂,并且在 繼續步驟106前確定樣品的質量。如果樣品符合PCR和片段化標準,則對樣品進行變性、標 記和隨后與涂覆的石英面上特定位置的小DNA探針組成的微陣列進行雜交。監測隨擴增的 DNA序列變化的與各探針雜交的標記物的量,從而產生序列信息和最終的SNP基因分型。根據廠商的指導來使用Affymetrix GeneChip 500K陣列。簡而言之,簡要地說, 首先用NspI或StyI限制性內切核酸酶消化分離的基因組DNA。然后消化的DNA與分別與 NspI或StyI限制酶切DNA退火的NspI或StyI接頭寡核苷酸連接。然后連接后的包含接 頭的DNA通過PCR進行擴增以產生在約200至1100堿基對之間的擴增DNA片段,這由凝膠 電泳所證實。符合擴增標準的PCR產物進行純化和定量以進行片段化。PCR產物用DNase I進行斷裂以達到最佳的DNA芯片雜交。斷裂之后,DNA片段應小于250堿基對,并且平均 為約180堿基對,這通過凝膠電泳證實。然后使用末端脫氧核苷酸轉移酶以生物素化合物 標記符合片段化標準的樣品。接著將標記的片段變性,而后雜交到GeneChip 250K陣列中。雜交之后,在掃描前按三步的處理過程對陣列進行染色,所述的三部處理過程由下列步驟 組成抗生蛋白鏈菌素藻紅蛋白(SAPE)染色,隨后是利用生物素化的抗抗生蛋白鏈菌素抗 體(山羊)的抗體擴增步驟,和用抗生蛋白鏈菌素藻紅蛋白(SAPE)的最終染色。在標記之 后,陣列用陣列保持緩沖液覆蓋,然后用例如Affymetrix GeneChip Scanner 3000的掃描 儀進行掃描。在AffymetrixGeneChip Human Mapping 500K Array Set 掃描后,按照制造商的 指導進行數據分析,如圖3所示。簡要地說,使用GeneChip操作軟件(GCOS)獲得原始數 據。也可以通過使用Affymetrix GeneChip Command Console 獲得數據。獲得初始數據 后用GeneChip基因分型分析軟件(GTYPE)進行分析。為了本發明的目的,排除GTYPE調 用率(call rate)小于80%的樣品。然后用BRLMM和/或SNiPer算法分析對樣品進行檢 驗。排除BRLMM調用率小于95%或者SNiPer調用率小于98%的樣品。最終,進行關聯分 析,并且排除SNiPer質量指數小于0. 45和/或哈迪-溫伯格(Hardy-Weinberg) ρ-值小于 0. 00001的樣品。
替代DNA微陣列分析或在DNA微陣列分析以外,可通過其它基于雜交的方法檢測 遺傳變異如SNP和突變,例如使用TaqMan方法和其變型。TaqMan PCR、反復TaqMan和實時 PCR(RT-PCR)的其它變型(例如 Livak 等人,Nature Genet.,9,341-32 (1995)和 Ranade 等 人Genome Res.,11,1262-1268 (2001)中描述的)也可用于在此公開的方法中。在一些實施 方式中,特定遺傳變異(例如SNP)的探針被標記形成TaqMan探針。該探針通常為大約至 少12、15、18或20個堿基對長度。它們可為大約10-70、15-60、20-60或18-22個堿基對長 度。探針在5’末端標記有報告標記物,例如熒光團和在3’末端標記有該標記物的猝滅劑。 報告標記物可為當處于鄰近猝滅劑的位置(例如探針的長度)時其熒光被抑制或猝滅的任 何熒光分子。例如,報告標記物可為熒光團例如6-羧基熒光素(FAM)、四氯熒光素(TET)或 其衍生物,和猝滅劑四甲基若丹明(TAMRA)、二氫環吡咯并吲哚三肽(MGB)或其衍生物。當報告熒光團和猝滅劑處于鄰近位置(由探針長度分隔)時,熒光被猝滅。當探 針與目標序列(例如樣品中包含SNP的序列)退火時,具有5’到3’核酸外切酶活性的DNA 聚合酶(例如Taq聚合物)可延長引物,核外切酶活性切除探針,從而將猝滅劑與報告熒光 團分離,因而報告熒光團可發熒光。該過程可以重復,例如在RT-PCR中。TaqMan探針通常 與位于被設計用于擴增序列的兩個引物之間的目標序列互補。因此,PCR產物的聚積可與 釋放的熒光團的聚積相關,這是因為各探針可與新產生的PCR產物進行雜交。釋放的熒光 團可被測量,因而存在的目標序列的量可被確定。用于高通量基因分型的RT-PCR方法可被 使用。還可通過DNA測序來識別遺傳變異。可以使用DNA測序對個體基因組序列的主 要部分或者全部進行測序。通常,常用的DNA測序是基于聚丙烯酰胺凝膠分級分離以解 析鏈端片段群(Sanger 等人,Proc. Natl. Acad. Sci. USA 74:5463-5467(1977))。已經開 發出來的和繼續進行開發的替代方法提高了 DNA測序的速度和簡便性。例如,高通量和 單分子測序平臺可從 454 Life Sciences (Branford,CT) (Margulies 等人,Nature 437 376-380 (2005)) > Solexa (Hayward, CA)、Helicos Biosciences Corporation (Cambridge, MA)(美國申請序列號No. 11/167046,于2005年6月23日提交)和Li-Cor Biosciences (Lincoln,NE)(美國申請序列號 No. 11/118031,于 2005 年 4 月 29 日提交)商購得到,或者正由它們進行開發。在步驟106中產生個體的基因組譜之后,該譜在步驟108中被數字化地存儲,該 譜可以加密的模式被數字化存儲。基因組譜被編碼成計算機可讀形式,以作為數據集的部 分進行存儲,并可作為數據庫進行存儲,其中基因組譜可“儲蓄(banked) ”,并可之后再次使 用。數據集包括多個數據點,其中各數據點涉及個體。各數據點可以具有多個數據元素。一 個數據元素為一獨特的標識符,用于識別個體的基因組譜。它也可以是條形碼。另一數據 元素為基因型信息,例如SNP或個體基因組的核苷酸序列。對應基因型信息的數據元素也 可包括在數據點中。例如,如果基因型信息包括微陣列分析識別的SNP,那么其它的數據元 素可包括微陣列SNP識別號、SNPrs號和多態性核苷酸。其它的數據元素可為基因型信息 的染色體位置、數據的質量量度、原始數據文檔、數據的圖像和提取強度得分。個體的特異性因素,例如身體數據、醫學數據、種族、家系、地理、性別、年齡、家族 史、已知表型、人口數據、暴露數據(exposuredata)、生活方式數據、行為數據和其它已知表 型,也可以被引入作為數據元素。例如,因素可包括但不限于個體的出生地、父母和/或祖 父母、親緣家系、居住地、祖先的居住地、環境條件、已知的健康狀況、已知的藥物相互作用、 家庭健康狀況、生活方式條件、飲食、運動習慣、婚姻狀態和身體測量數據(例如體重、身 高、膽固醇水平、心率、血壓、葡萄糖水平和本領域已知的其它測量)。個體的親戚或者祖先 (例如,父母和祖父母)的上述因素也可以加入作為數據元素,和用于確定個體的表型或癥 狀的風險。特定因素可以從調查表或者從個體的醫療保健管理者處獲得。然后,可以訪問來 自“儲蓄”的譜的信息并且按所需要進行使用。例如,在個體的基因型相關性的初始評估中, 將分析個體的全部信息(通常在整個基因組上的或者從整個基因組取得的SNP或其它基因 組序列)用于確定基因型相關性。在后續的分析中,可以按需要或適當地訪問來自存儲的 或儲蓄的基因組譜的全部信息或者其一部分。在步驟110中,基因型相關性是來自科技文獻的。遺傳變異的基因型相關性由已 經對是否存在一種或多種感興趣的表型性狀和對基因型譜進行了測試的個體的群體所進 行的分析確定。然后對基因型譜中各遺傳變異或多態性的等位基因進行檢測以確定是否特 定的等位基因的存在與感興趣的性狀相關聯。可以通過標準統計方法進行相關性分析,并 記錄遺傳變異與表型特征之間的統計學顯著的相關性。比如,可能確定,多態性A的等位基 因Al的存在與心臟病相關。作為進一步的例子,可能發現在多態性A的等位基因Al和多 態性B的等位基因Bl的組合存在與癌癥風險的增大相關。分析的結果可以在同行評議文 獻中公布,由其它研究組進行確認,和/或由專家委員會(例如,遺傳學家、統計學家、流行 病學家和醫生)進行分析,并且也可以進行驗證。圖4、5和6中為基因型與表型之間的相關性的實例,其中應用于基因組譜的基因 型與表型之間的規則基于這些相關性。例如,圖4A和B中,各行對應于表型/基因座/種 族,其中圖4C至I包括這些行中各行的相關性的進一步的信息。作為例子,在圖4A中,如 圖4M表型名稱縮寫的索引中所注明的BC的“表型名稱縮寫”為乳腺癌的縮寫。在BC_4(其 為基因座的類名)這一行中,基因LSPl與乳腺癌相關。如圖4C中所示,對于這一相關性確 認的公開的或者功能性的SNP為rs3817198,而公開的風險等位基因為C,非風險等位基因為Τ。公開的SNP和等位基因通過出版物(例如,圖4E-G中的基本的公開文獻)確認。在 圖4Ε的LSPl的實例中,基本的公開文獻為Easton等人,Nature 447 :713-720 (2007)。 可選地,可從存儲的基因組譜中產生相關性。例如,具有存儲的基因組譜的個體可 同時具有存儲的已知的表型信息。存儲的基因組譜和已知的表型的分析可產生基因型相關 性。作為一個例子,具有儲存的基因組譜的250位個體還具有之前他們被診斷為患有糖尿 病的存儲信息。進行他們的基因組譜的分析,并與未患有糖尿病的個體對照組進行比較。然 后確定出之前被診斷為患有糖尿病的個體比對照組具有更高的帶有特定遺傳性變型的比 率,且可在該特定的遺傳性變型和糖尿病之間確定基因型相關性。在步驟112中,基于遺傳性變型與特定的表型之間的確立的相關性來形成規則。 例如,規則可以基于例如表1中所列的相關的基因型與表型產生。基于相關性的規則可引 入其它的因素如性別(例如圖4)或種族(圖4和5)如圖4和5中的效應評價。由規則產 生的其它量度可以評估如圖6中的相對風險增加。效應評價和估計的相對風險增加可以來 自公開的文獻,或者由公開的文獻進行計算。或者,規則可以基于由存儲的基因組譜和先前 已知的表型產生的相關性。在一個優選的實施方式中,遺傳性變型為SNP。盡管SNP出現在單個位點時,攜帶 在某一位點處的特定SNP等位基因的個體通常可預測在其它的位點處攜帶特定的SNP等位 基因。SNP與使個體易發疾病或狀態的等位基因的相關性通過連鎖不平衡產生,其中在群體 中兩個或多個基因座上的等位基因發生非隨機關聯的頻率大于或者小于預計通過重組隨 機形成而得到的頻率。其它的遺傳標記或變異(例如核苷酸重復或插入)也可以與已經顯示為與特定的 表型相關的遺傳標記發生連鎖不平衡。例如,核苷酸插入與表型相關,并且SNP與核苷酸插 入發生連鎖不平衡。基于SNP與表型之間的相關性形成規則。也可以形成基于核苷酸插入 與表型之間的相關性的規則。可以將任一規則或者兩個規則應用于基因組圖譜,因為一個 SNP的存在可以給出某一危險因子,另一規則可以給出另一危險因子,并且當它們結合時可 以增大風險。通過連鎖不平衡,易發疾病的等位基因與SNP的特定等位基因或者SNP的特定等 位基因的組合共分離。沿著染色體的SNP等位基因的特定組合被稱為單倍體型,它們組合 出現的DNA區域被稱為單倍體區塊。盡管單倍體區塊可包括一個SNP,表示在個體之間表現 出低的單體型多樣性且通常具有低重組頻率的2個或多個鄰近的SNP的系列。可以通過鑒 定位于單倍體型區塊中的一個或多個SNP進行單體體型的鑒定。因此,SNP譜通常可用于 識別單倍體區塊,而不是必須識別在特定的單倍體區塊中的所有SNP。SNP單倍體模式和疾病、狀態或身體狀態之間的基因型相關性逐漸成為已知。對 于特定的疾病而言,將已知具有該疾病的一組人的單倍體型模式與無該疾病的一組人相比 較。通過分析許多個體,可以確定在群體中多態性的頻率,并且隨后這些頻率或基因型可以 與特定的表型(例如疾病或者狀態)相關聯。已知的SNP-疾病相關性的實例包括在與年 齡相關性黃斑變性中補體因子H的多態性(Klein等人,Science 308 =385-389, (2005)) 和鄰近與肥胖相關的INSIG2基因的變異(Herbert等人,Science :312 :279_283 (2006))。 其它已知的SNP相關性包括含⑶KN2A和B的9p21區中的多態性,例如與心肌梗塞相關 的 rsl0757274、rs2383206、rsl3333040、rs2383207 和 rsl0116277 (Helgadottir 等人,Science 316 1491-1493 (2007) ;McPherson 等人,Science 316 1488-1491 (2007)) SNP可為功能性的或非功能性的。例如,功能性的SNP對細胞功能有效,因此會產 生表型,而非功能性的SNP不具有功能,但可以與功能性SNP發生連鎖不平衡。SNP也可以 是同義的或者非同義的。同義的SNP是其中不同形式導致相同多肽序列的SNP,且為非功能 性SNP。如果SNP導致不同多肽,那么SNP是非同義的并且可以是或不是功能性的。用于識 別二倍體型(其2個或多個單倍體型)中的單倍體型的SNP或其它的遺傳標記可用于使表 型和二倍體型相關。有關個體的單倍體型、二倍體型和SNP譜的信息可為個體的基因組譜。
在優選的實施方式中,對于基于與表型關聯的另一遺傳標記形成連鎖不平衡的遺 傳標記產生的規則,該遺傳標記可以具有大于0. 5的r2或D’得分,該得分通常在本領域中 用于確定連鎖不平衡。在優選的實施方式中,得分大于0. 6、0. 7、0. 8、0. 90、0. 95或0. 99。 結果,在本發明中,用于將表型與個體的基因組譜關聯的遺傳標記可以相同或者不同于與 表型相關的功能性的或公開的SNP。例如,使用BC_4,測試SNP和公開的SNP是相同的,正 如測試的風險和非風險等位基因與公開的風險和非風險等位基因是相同的(圖4A和C)。 但是,對于BC_5,CASP8及其與乳腺癌的相關性,測試SNP與其功能性的或公開的SNP不同, 正如測試的風險和非風險等位基因對于公開的風險和非風險等位基因一樣。測試的和公開 的等位基因相對于基因組的正鏈定向,并且從這些列中可以推斷純合型風險或非風險基因 型,這可以生成用于例如注冊用戶的個體的基因組譜的規則。測試SNP可以為“直接(DIRECT),,或“標簽(TAG),,SNP (圖4E-G,圖5)。直接 SNP為與公開的或功能性SNP相同的測試SNP,例如對于BC_4。使用歐洲人和亞洲人的 SNP rsl073640,直接SNP也可以用于乳腺癌的FGFR2相關性,其中次要等位基因為A且 另一等位基因為G(Easton等人,Nature 447 1087-1093 (2007)) 也是在歐洲人和亞 洲人中的乳腺癌的FGFR2相關性的另一公開的或功能性的SNP為rsl219648 (Hunter等 人,Nat. Genet. 39 870-874(2007))。標簽SNP為測試SNP與功能性或公開的SNP不同 的SNP,如對于BC_5。標簽SNP還可用于其它的遺傳性變型,例如CAMTAl (rs4908449)、 9p21 (rsl0757274、rs2383206、rsl3333040、rs2383207、rsl0116277)、C0L1A1(rsl800012)、 FVL(rs6025)、HLA-DQAl(rs4988889、rs2588331)、eNOS (rsl799983)、MTHFR(rsl801133)禾口 APC(rs28933380)的 SNP。SNP 的數據庫可從例如 International HapMap if 劃(參見 www. hapmap. org, The International HapMap Consortium,Nature426 :789_796 (2003),禾口 The International HapMap Consortium,Nature437 :1299-1320 (2005))、Human Gene Mutation Database (HGMD)公開數據庫(參見www. hgmd. org)和單核苷酸多態性數據庫(dbSNP)(參 見誦.ncbi. nlm. nih. rov/SNP/)中公開獲得。這些數據庫提供了 SNP單倍體型,或使得能 夠確定SNP單倍體模式。因此,這些SNP數據庫使得能夠檢測作為大范圍的疾病和狀態(例 如癌癥、炎性疾病、心血管病、神經變性疾病和傳染病)的基礎的遺傳危險因子。這些疾病 或狀態可以是可處置的,其中當前存在其處理和治療方法。處理可以包括預防處理和改善 癥狀和狀態的處理,包括改變生活方式。還可以研究許多其它的表型,例如身體性狀、生理性狀、精神性狀、情緒性狀、種 族、家系和年齡。身體性狀可以包括身高、發色、眼睛顏色、軀體或者例如精力、耐力和敏捷 性的性狀。精神性狀可以包括智力、記憶能力或者學習能力。種族和家系可以包括家系或種族的鑒定,或者個體的祖先源于哪里。年齡可以是確定個體的實際年齡,或者是個體的遺 傳學特征使其相對于總的群體所處的年齡。例如,個體的實際年齡為38歲,但是其遺傳學 特征可以確定其記憶能力或身體健康狀態可能為平均28歲。另外的年齡性狀可以是個體 的預計壽命。其它的表型還可包括非醫學狀態,例如“娛樂”表型。這些表型可以包括與知名個 體的對比,例如,外國貴族、政治家、名人、發明家、運動員、音樂家、藝術家、商業人士和聲名 狼藉的個體(例如罪犯)。其它“娛樂”表型可以包括與其它生物體的對比,例如,細菌、昆 蟲、植物或者非人類的動物。例如,個體可能感興趣看看其基因組譜與其寵物狗或前任總統 的基因組譜對比會如何。 在步驟114中,規則被應用到存儲的基因組譜以產生步驟116的表型譜。例如,圖 4、5或6中的信息可能形成規則或測試的基礎,以應用于個體的基因組譜。規則可以包括 圖4中關于測試SNP和等位基因以及效應評價的信息,其中,效應評價的UNITS為效應評價 的單位,例如0R,或優勢比(95%置信區間)或者平均值。在優選實施方式中效應評價可以 是基因型風險(圖4C-G),例如對于純合子的風險(homoz或RR)、風險雜合子(heteroz或 RN)和非風險純合子(homoz或NN)。在其它實施方式中,效應評價可以為攜帶者風險,其為 RR或RN對NN。在再其它的實施方式中,效應評價可以基于等位基因、等位基因風險,例如 R對N。這里也存在兩個基因座(圖4J)或三個基因座(圖4K)的基因型效應評價(例如, 對于兩個基因座效應評價的9種可能的基因型組合RRRR、RRNN等)。在圖4H和I中還記 錄了公共HapMap中的測試SNP頻率。對于狀態的估計風險可基于美國專利公布No. 20080131887和PCT公布 NO.W02008/067551中列舉的SNP。在一些實施方式中,對于狀態的風險可基于至少1個 SNP。例如,對個體患阿爾茨海默病(AD)、結腸直腸癌(CRC)、骨關節炎(OA)或脫落性青 光眼(Xre)的風險的評估可基于1個SNP (例如rs4420638用于AD,rs6983267用于CRC, rs4911178用于OA和rs2165241用于XFG)。對于其它的狀態而言,例如肥胖(BMIOB)、格 雷夫斯病(GD)或血色素沉著癥(HEM),個體的估計風險可以基于至少1或2個SNP (例如 rs9939609 和 / 或 rs9291171 用于 BMIOB ;DRB1*0301DQA1*0501 和 / 或 rs3087243 用于 GD ; rsl800562和/或rsl29128用于HEM)。對于如但不限于心肌梗塞(MI)、多發性硬化(MS)或 牛皮癬(PS)的狀態,1、2或3個SNP可用于評估個體對于該狀態的風險(例如rsl866389、 rsl333049 和 / 或 rs6922269 用于 MI ;rs6897932、rsl2722489 和 / 或 DRB1*1501 用于 MS ; rs6859018、rsll209026和/或HLA00602用于PS)。對于評估個體患多動腿綜合征(RLS)或 乳糜瀉(CelD)的風險,可使用 1、2、3 或 4 個 SNP (例如 rs6904723、rs2300478、rsl026732 和 / 或 rs9296249 用于 RLS ;rs6840978、rsll571315、rs2187668 和 / 或 DQA1*0301 DQB1*0302 用于CelD)。對于前列腺癌(PC)或狼瘡(SLE)而言,可使用1、2、3、4或5個SNP來評估 個體患 PC 或 SLE 的風險(例如 rs4242384、rs6983267、rsl6901979、rsl7765344 和 / 或 rs4430796 用于 PC ;rsl2531711、rsl0954213、rs2004640、DRB1*0301 和 / 或 DRB1*1501 用 于SLE)。對于評估個體患黃斑變性(AMD)或風濕性關節炎(RA)的終生風險而言,可使用 1、2、3、4、5 或 6 個 SNP(例如 rsl0737680、rsl0490924、rs541862、rs2230199、rsl061170 和 / 或 rs9332739 用于 AMD ;rs6679677、rsll203367、rs6457617、DRB*010U DRB 1*0401 和 /或DRB 1*0404用于RA)。對于估計個體患乳腺癌(BC)的個體終生風險而言,可使用1、2、3、4、5、6 或 7 個 SNP (例如 rs3803662、rs2981582、rs4700485、rs3817198、rsl7468277、 rs6721996和/或rs3803662)。對于估計個體患克羅恩氏病(CD)或2型糖尿病(T2D)的 終生風險而言,可使用 1、2、3、4、5、6、7、8、9、10 或 11 個 SNP (例如 rs2066845、rs5743293、 rsl0883365、rsl7234657、rsl0210302、rs9858542、rsll805303、rsl000113、rsl7221417、 rs2542151 和 / 或 rsl0761659 用于 CD ;rsl3266634、rs4506565、rsl0012946、rs7756992、 rsl0811661、rsl2288738、rs8050136、rsllll875、rs4402960、rs5215 和 / 或 rsl801282 用 于T2D)。在一些實施方式中,作為用于確定風險的基礎的SNP可與上述SNP或其它SNP (例 如美國專利公布No. 20080131887和PCT公布No. W02008/067551中的)發生連鎖不平衡。個體的表型譜可包括多種表型。特別地,無論在有癥狀、癥狀前或無癥狀的個體 (包括一種或多種疾病/狀態的易感等位基因的攜帶者)中,通過本發明的方法評估病人 患疾病或其它狀態(例如,可能的藥物反應,包括代謝、功效和/或安全性)的風險使得能 夠對多種不相關的疾病和狀態的易感性進行預后或者診斷分析。因此,這些方法提供了對 于疾病或狀態的個體易感性的總體評價而不需要預先設想任何特定疾病或狀態的測試。例 如,本發明的方法使得能夠基于個體基因組譜對表1、圖4、5或6中所列的多種狀態中的任 何一種的個體易感性進行評估。評估優選提供了有關這些狀態中的2種或多種的信息,并 且更優選這些狀態中的3、4、5、10、20、50、100或者甚至更多種狀態的信息。在優選實施方 式中,將至少20條規則應用于個體的基因組譜而得到表型譜。在其它的實施方式中,將至 少50條規則應用于個體的基因組譜。表型的單一的規則可以應用于單基因的表型。多于 一條的規則也可以用于單一表型,例如多基因的表型或單一基因中的多個遺傳性變型會影 響具有表型的概率。個體患者的基因組譜的最初篩選之后,當知道附加的核苷酸變型時,通過與這些 附加的核苷酸變型(例如,SNP)的比較進行(或采用)個體基因型相關性的更新。例如, 步驟110可以由搜索科學文獻以尋找新基因型相關性的遺傳學領域的一名或多名普通技 術人員定期地進行,如,每天、每周或每月進行。然后,新基因型相關性可以進一步由本領域 中的一位或多位專家的委員會確認。而后,步驟112可以以基于新的確認有效的相關性使 用新規則定期地更新。新規則可以包括在現有規則之外的基因型或者表型。例如,未與任何表型關聯的 基因型被發現與新的或現有的表型相關。新規則也可以用于先前無基因型與其關聯的表型 間的相關性。新規則也可以確定用于已具有現有規則的基因型和表型。例如,現有基于基 因型A與表型A之間的相關性的規則。新的研究揭示了基因型B與表型A相關,因而產生 基于這一相關性的新規則。另一個例子為發現表型B與基因型A相關,并因此制定新規則。可以在發現基于已知的但沒有在公開的科學文獻中進行初始確認的相關性時制 定規則。例如,可能有人報道,基因型C與表型C相關。另外的出版物報道,基因型D與表 型D相關。表型C和D是相關的癥狀,例如表型C可以是呼吸急促,而表型D是較小的肺容 量。利用現有存儲的具有基因型C和D以及表型C和D的個體的基因組譜通過統計學方法, 或者通過進一步的研究可以發現和確認基因型C與表型D或者基因型D與表型C之間的相 關性。然后,可以基于新發現的和確認的相關性生成新規則。在另一實施方式中,可以研究 存儲的具有特定或相關表型的多個個體的基因型譜來確定這些個體共有的基因型,并且可 以確定相關性。基于這一相關性可以生成新規則。
也可以制定規則以修正現有規則。例如,基因型與表型之間的相關性可能部分地 由已知個體特征確定,例如,種族、家系、地理、性別、年齡、家族史或者個體的任何其它已知 表型。可以制定基于這些已知個體特征的規則并且引入現有規則中以提供修正的規則。選 擇應用修正的規則將取決于個體的特定個體因素。例如,規則可能基于當個體具有基因型 E時個體具有表型E的概率為35%。但是,如果個體為特定的種族,所述概率是5%。新規 則可以基于這一結果制定并且應用于具有該特定種族特性的個體。或者,可以應用確定值 為35%的現有規則,然后應用基于該表型的種族特征的另一規則。基于已知個體特征的規 則可以由科技文獻確定或者基于對存儲的基因組譜的研究確定。在產生了新規則時,可以 在步驟114中添加新的規則并將其應用于基因組譜,或者可以定期地應用它們,例如一年 至少一次。 疾病的個體風險的信息也可以隨著更高分辨率SNP基因組譜的技術進步得到擴 展。如上所述,使用用于掃描500,000個SNP的微陣列技術可以很容易地生成初始SNP基 因組譜。考慮到單倍體區塊的特性,這一數字可用于個體基因組中所有SNP的典型譜。但 是,在人類基因組中估計通常發生大約1000萬個SNP(InternationalHapMap計劃;www. hapmap. org)。隨著能夠以更高細節水平對SNP進行實用和經濟的解析(例如1,000,000、 1,500, 000,2, 000, 000,3, 000, 000或更多SNP的微陣列)的或者全基因組測序方面的技術 進步,可以生成更詳細的SNP基因組譜。同樣,計算機分析方法學方面的進展使得能夠獲得 更精細的SNP基因組譜的經濟分析和SNP-疾病相關性主數據庫的更新。在步驟116生成表型譜之后,注冊用戶或者其醫療保健管理者可以如步驟118中 通過在線入口或網站訪問他們的基因組譜或表型譜。也可以將包括表型譜和其它關于表型 譜和基因組譜的信息的報告提供給注冊用戶或其醫療保健管理者,如步驟120和122中所 述。可以將報告打印出來、存儲在注冊用戶的電腦里或者在線察看。圖7示出了示例的在線報告。注冊用戶可以選擇顯示單一表型或者多于一個的表 型。注冊用戶也可以具有不同的察看選項,例如,如圖7中所示“快速查看(Quick View)“ 選項。表型可以是醫學狀態并且在快速報告中的不同處理和癥狀可以鏈接至其它包含有 關處理的進一步信息的網頁。例如,通過點擊藥物,會導向包括關于劑量、費用、副作用和 功效的信息的網站。也可以將藥物與其它治療進行比較。網站也可以包括導向藥物制造 商的網站的鏈接。另一鏈接可以向注冊用戶提供生成藥物性基因組學(pharmacogenomic) 譜的選項,這將包括基于其基因組譜的信息如他們對于藥物的可能反應。也可以提供對于 藥物的替代方案的鏈接,例如預防性行為(如康體和減輕體重);并且也可以提供對于飲 食補充、飲食計劃的鏈接及對于附近的健身俱樂部、健康診所、保健及康復提供者、都市型 spa (day spa)等的鏈接。也可以提供教育和情報視頻、可利用的治療的概要、可能的療法和 一般性建議。在線報告也可以提供安排個人醫生或遺傳咨詢預約的鏈接或者訪問在線遺傳顧 問或醫生的鏈接,從而為注冊用戶提供詢問更多關于其表型譜的信息的機會。在線報告上 也可以提供在線遺傳咨詢和醫師詢問的鏈接。也可以以其它形式查看報告,例如對于單一表型的綜合觀察,其中提供了對于各 個類別的更多詳情。例如,可以存在關于注冊用戶出現表型的可能性的更詳細的統計;關于 典型癥狀或表型的更多信息,例如醫學狀態的代表癥狀或者身體非醫學狀態(如身高)的范圍;或者關于基因和遺傳性變型的更多信息,例如群體流行度,如在世界上或者在不同國 家中,或者在不同年齡范圍或性別中的群體流行度。在另一實施方式中,報告可以是“娛樂” 表型的報告,例如,個體基因組譜與知名個體(如阿爾伯特 愛因斯坦)的基因組譜的相似 性。報告可以顯示個體基因組譜與愛因斯坦的個體基因組譜之間的百分比相似性,并且可 以進一步顯示愛因斯坦的預測IQ和該個體的預測IQ。進一步的信息可以包括總群體的基 因組譜和其IQ與該個體和愛因斯坦的基因組譜和IQ比較的情況。在另一實施方式中,報告可以顯示已與注冊用戶的基因組譜相關聯的所有表型。 在其它的實施方式中,報告可以僅顯示確定與個體的基因組譜正相關的表型。個體可以 選擇以其它形式顯示表型的特定亞類,例如僅醫學表型或者僅可處置的醫學表型。例如, 可處置的表型及其相關的基因型可以包括克羅恩氏病(與IL23R和CARD15相關)、1型 糖尿病(與HLA-DR/DQ相關)、狼瘡(與HLA-DRBl相關)、牛皮癬(HLA-C)、多發性硬化癥 (HLA-DQAl)、格雷夫斯病(HLA-DRBl)、風濕性關節炎(HLA-DRBl)、2型糖尿病(TCF7L2)、乳 腺癌(BRCA2)、結腸癌(APC)、情景記憶(KIBRA)和骨質疏松癥(COLlAl)。個體還可選擇在 他們的報告中顯示表型的子類,例如,僅醫學狀態的炎性疾病或僅非醫學狀態的身體性狀。
交付并傳送至個體的信息可以是加密的和保密的,并且可以控制個體對這些信息 的訪問。由復雜基因組譜得到的信息可以作為管理部門批準的、可理解的、醫療相關的和/ 或具有高度影響的數據提供給個體。信息也可以是具有一般的意義,而與醫療無關。可以通 過幾種方式向個體加密地傳送信息,所述方式包括,但不限于入口界面和/或郵寄。更優選 地,信息通過入口界面加密地(如果個體如此選擇)向個體提供,其中個體對該入口界面具 有安全和保密的訪問權限。這一界面優選通過在線的、互聯網站入口提供,或者可選擇地, 通過電話或允許提供私密、安全和易于使用的訪問的其它方式。基因組譜、表型譜和報告通 過網絡的數據傳輸向個體或其醫療保健管理者提供。因此,圖8為顯示了可以通過其生成表型譜和報告的代表性示例邏輯設備的框 圖。圖8顯示了計算機系統(或者數字設備)800,其用于接收和存儲基因組譜、分析基因 型相關性、基于基因型相關性生成規則、將規則應用于基因組譜和產生表型譜和報告。計算 機系統800可以理解為能夠從介質811和/或網絡端口 805讀取指令的邏輯設備,該網絡 端口 805能夠任選地與具有固定介質812的服務器809相連。圖8中顯示的系統包括CPU 801、磁盤驅動器803、任選的輸入設備(例如鍵盤815和/或鼠標816)以及任選的監視器 807。與本地或遠方位置的服務器809的數據通信可以通過所示的通信媒介完成。通信媒 介可以包括傳送和/或接收數據的任何手段。例如,通信媒介可以是網絡連接、無線連接或 者互聯網連接。該連接可在環球網中提供通訊。可以想到,與本發明相關的數據可在該網 絡或連接中傳送以由某一方822接收和/或查看。接收方822可以為個體、注冊用戶、醫療 保健提供者或醫療保健管理者,但不限于此。在一個實施方式中,計算機可讀的介質包括適 于傳送生物樣品或基因型相關性的分析結果的介質。所述介質可以包括關于個體對象的表 型譜的結果,其中使用在此所描述的方法得到這一結果。個人入口將優選用作個體接收和評價基因組數據的基本界面。入口將使個體能夠 跟蹤其樣品從收集到測試的過程并能夠跟蹤結果。通過入口訪問,基于其基因組譜向個體 介紹常見遺傳病的相對風險。注冊用戶可以通過入口選擇將哪些規則應用于其基因組譜。在一個實施方式中,一個或多個網頁將具有表型的列表和靠近每個表型有一個方框,注冊用戶可以選擇方框以將其包括在他們的表型譜中。表型可以鏈接至與該表型有關 的信息,以幫助注冊用戶明智地選擇關于他們希望包括在其表型譜中的表型。網頁也可以 具有按疾病分組(例如可處置的疾病或不可處置的疾病)組織的表型。例如,注冊用戶可 以僅選擇可處置的表型,例如HLA-DQAl和乳糜瀉。注冊用戶也可以選擇顯示表型的癥狀前 或癥狀后治療。例如,個體可以選擇具有癥狀前治療的可處置表型(在進一步篩查以外), 對于乳糜瀉為無谷蛋白飲食的癥狀前治療。另一實例可以是阿爾茨海默氏病,癥狀前治療 為他汀類藥物、鍛煉、維生素和精神作用。血栓形成是另一實例,癥狀前治療是避免口服避 孕藥和避免長時間久坐。具有經批準的癥狀后治療的表型的實例為與CFH有關的濕性AMD, 其中個體可以進行對其狀態的激光治療。表型也可以按疾病或狀態的類型或種類進行組織,例如神經學、心血管、內分泌、 免疫等等。表型也可以分組為醫學和非醫學表型。在網頁上的表型的其它分類可以按照身 體性狀、生理性狀、精神性狀或情緒性狀進行。網頁可以進一步提供通過選擇一個方框而選 擇一組表型的分區。例如,選擇所有表型、僅與醫學相關的表型、僅非醫學相關的表型、僅可 處置的表型、僅不可處置的表型、不同的疾病組或者“娛樂”表型。“娛樂”表型可以包括與 名人或其他知名個體的對比,或者與其它動物或甚至其它生物體的對比。可用于對比的基 因組譜的列表也可以在網頁上提供以用于由注冊用戶選擇而與注冊用戶的基因組譜對比。在線入口也可以提供搜索引擎,以幫助注冊用戶瀏覽入口、檢索特定表型或者檢 索由其表型譜或報告所揭示的特定術語或信息。也可以由入口提供訪問搭配的服務和提供 的產品的鏈接。也可以提供連接到支持小組、留言板和具有共同或相似表型的個體的聊天 室的另外的鏈接。在線入口也可以提供連接到具有更多與注冊用戶表型譜中的表型有關的 信息的其它地址的鏈接。在線入口也可以提供允許注冊用戶與朋友、家人或醫療保健管理 者分享其表型譜和報告的服務。注冊用戶可以選擇在表型譜中顯示他們希望與其朋友、家 人或醫療保健管理者分享的表型。表型譜和報告向個體提供了個人化基因型相關性。向個體提供的基因型相關性能 夠用于確定個人保健和生活方式選擇。如果發現了在遺傳性變型與可進行治療的疾病之間 的強相關性,遺傳性變型的檢查有助于確定開始治療疾病和/或個體監測。在存在統計學 上顯著的相關性但不認為是強相關性的情況下,個體可以與個人醫生討論該信息并決定適 當、有益的行動方案。就特定基因型相關性而言可能有益于個體的潛在行動方案包括進行 治療處理、監測潛在的治療需要或治療效果或者在飲食、鍛煉和其它個人習慣/活動等方 面改變生活方式。例如,可處置表型(如乳糜瀉)可以進行無谷蛋白飲食的癥狀治療。同 樣,通過藥物基因組學,基因型相關性信息可應用于預測必須用特定藥物或藥物療程進行 治療的個體的可能反應,例如特定藥物治療的可能的效力或安全性。注冊用戶可以選擇將基因組譜和表型譜提供給其醫療保健管理者,例如醫生或遺 傳顧問。基因組譜和表型譜可以由醫療保健管理者直接訪問,由注冊用戶打印出一份以交 給醫療保健管理者,或者通過在線入口(例如通過在線報告上的鏈接)將其直接發送給醫 療保健管理者。這一相關信息的傳遞將使患者能夠與其醫生協調行動。特別是,在患者與其醫生 間的討論可以通過個人入口和連接到醫學信息的鏈接以及使患者的基因組信息結合到其 醫學記錄中的能力而成為可能。醫學信息可以包括預防和健康信息。通過本發明提供給個體患者的信息將能夠使患者做出對于其醫療保健的明智選擇。在這一方式中,患者能夠選 擇可以幫助他們避免和/或延遲其個體基因組譜(遺傳的DNA)具有較高可能導致的疾病。 另外,患者將能夠采用適合其個人本身的特定醫療需要的治療方案。個體也將具有訪問其 基因型數據的能力,如果他們發生疾病并需要這一信息幫助其醫生形成治療對策。基因型相關性信息也可與遺傳咨詢結合以用于向考慮生育的夫婦提出建議,以及 提出對于母親、父親和/或孩子的潛在遺傳關注。遺傳顧問可以向具有顯示特定狀態或疾 病的較高風險的表型譜的注冊用戶提供信息和支持。他們可以解釋關于該病癥的信息、分 析遺傳模式和復發風險并與注冊用戶討論可用選擇。遺傳顧問也可以提供支持性咨詢以向 注冊用戶推薦社區或國家支持服務。遺傳咨詢可以包括特定注冊計劃。在一些實施方式中, 遺傳咨詢可以安排在所請求的24小時內且可在如晚上、星期六、星期日和/或假日的時間 內提供。個體的入口也將便于傳遞初始篩查以外的附加信息。個體將被告知有關其個人 遺傳圖譜的新的科學發現,例如關于其目前或潛在狀態的新的治療或預防對策的信息。新 發現也可以傳遞給其保健管理者。在優選實施方式中,通過電子郵件向注冊用戶或其保健 提供者通告關于注冊用戶的表型譜中的表型的新基因型相關性和新研究。在其它實施方式 中,將“娛樂,,表型的電子郵件發送給注冊用戶,例如電子信件可以告知他們其基因組譜的 77%與阿伯拉罕·林肯的基因組譜相同以及進一步的信息通過在線入口提供。本發明也提供了一種用于生成新規則、修正規則、組合規則、定期用新規則更新規 則集、安全地維持基因組譜數據庫、將規則應用于基因組譜以確定表型譜和用于生成報告 的計算機代碼系統。計算機代碼告知注冊用戶新的或者修正的相關性和新的或者修正的報 告,例如具有新的預防和健康信息、關于開發中的新治療方法的信息或可獲得的新治療的 報告。商業方法本發明提供了基于比較患者的基因組譜和建立的醫學相關核苷酸變異的臨床來 源數據庫來評估個體的基因型相關性的商業方法。本發明還提供了使用存儲的個體基因組 譜來評估最初未知的新的相關性以產生個體的更新的表型譜的方法,其中無需個體再提交 另一份生物樣品。圖9為表明商業方法的流程圖。在個體因為多種常見人類疾病、狀態和身體狀態的基因型相關性而最初請求和購 買個人基因組譜時,在步驟101中部分地產生本發明的商業方法的收入流。請求和購買可 以通過許多來源進行,包括但不限于在線網絡入口、在線健康服務和個體的個人醫生或者 類似的個人醫療關注的來源。在替代的實施方式中,基因組譜可以免費提供,并且可以在隨 后的步驟(例如步驟103)中生成收入流。注冊用戶或者消費者做出購買表型譜的請求。響應于需求和購買向消費者提供采集試劑盒以用于采集在步驟103中進行遺傳樣品分離的生物樣品。當在線、通過電話或其 它消費者不易于親身獲得采集試劑盒的來源做出請求時,通過快遞提供采集試劑盒,例如 提供當日或隔夜交付的速遞服務。采集試劑盒中包括的是樣品的容器以及用于將樣品快速 遞送至生成基因組譜的實驗室的包裝材料。試劑盒也可以包括將樣品送至樣品處理機構或 實驗室的說明和(可以通過在線入口)訪問其基因組譜和表型譜的說明。正如以上所詳細說明的,可以從多種類型的生物樣品中的任何一種類型獲得基因組DNA。優選地,使用商購的采集試劑盒(例如從DNA Genotek購得的試劑盒)從唾液中分 離基因組DNA。唾液和這一試劑盒的使用使得能夠進行無損傷樣品采集,因為消費者很方便 在來自采集試劑盒的容器中提供唾液樣品,然后密封該容器。另外,唾液樣品可以在室溫下 儲存和運輸。在將生物樣品存放在采集或標本容器中后,在步驟105中消費者把樣品遞送至進 行處理的實驗室。典型地,消費者可以使用在采集試劑盒中提供的包裝材料通過例如同日 或隔夜快遞服務的快速遞送將樣品遞送/寄送至實驗室。 處理樣品并生成基因組圖譜的實驗室可以遵循適當的政府機構指導和規定。例 如,在美國,處理實驗室可以被例如食品與藥品管理局(FDA)或醫療保險和醫療補助服務 中心(Centers for Medicare andMedicaid Services) (CMS)的一個或多個聯邦機構和/或 一個或多個州立機構管理。在美國,可以依照1988年的Clinical LaboratoryImprovement Amendments (CLIA)授權或批準臨床實驗室。在步驟107中,如先前描述的實驗室對樣品進行處理以分離DNA或RNA的遺傳樣 品。然后,在步驟109中,對分離的遺傳樣品進行分析和生成基因組譜。優選地,生成基 因組SNP譜。如上所述,可使用幾種方法來產生SNP譜。優選地,高密度陣列(例如可從 Affymetrix或Illumina購買的平臺)被用于SNP的識別和譜的產生。例如,如以上更詳細 地描述的,使用Affymetrix GeneChip assay生成SNP譜。隨著科技的發展,可能存在可產 生高密度SNP譜的其它的技術供應商。在另一個實施方式中,注冊用戶的基因組譜是注冊 用戶的基因組序列。產生個體的基因組譜之后,優選在步驟111中將基因型數據加密和輸入,并在步 驟113中存儲到加密的數據庫或保險庫中,其中信息被存儲用于將來參考。基因組譜和相 關的信息可為保密的,按照個體和/或者他或她的個人醫生的指令對訪問這一私有信息和 基因組圖譜進行限制。其他人(例如個體的家人和遺傳顧問)也可以由注冊用戶許可訪問。數據庫或保險庫可以就地位于處理實驗室處。或者,數據庫可以位于獨立的場所。 在這一情況下,在步驟111中可以將由處理實驗室生成的基因組譜數據輸送到包括數據庫 的單獨的機構。在生成個體的基因組譜之后,隨后在步驟115中將個體的遺傳變異與已確定的醫 學上相關的遺傳性變型的臨床數據庫相對比。或者,基因型相關性可以不是醫學相關的但 仍包括在基因型相關性數據庫中,例如,如眼睛顏色的身體性狀,或者如與名人基因組譜的 相似性的“娛樂”表型。醫療相關的SNP可以通過科技文獻和相關的來源建立。非SNP遺傳變異也可與表 型建立相關性。一般而言,SNP與特定疾病的相關性是通過將已知患有疾病的人們的組的 單倍體模式與未患疾病的人們的組相比較而建立的。通過分析許多個體,可以確定群體中 的多態性頻率,反過來這些基因型頻率可與特定的表型相關聯,例如疾病或狀態。可選地, 表型可為非醫學狀態。相關的SNP和非SNP遺傳性變型還可通過分析存儲的個體基因譜而不是通過可得 到的公開文獻而確定。具有存儲的基因組圖譜的個體可以揭示先前已經確定的表型。可以 將對個體的基因型和揭示的表型的分析與沒有該表型的個體相對比以確定而后可以應用 于其它基因組譜的相關性。確定其基因組譜的個體可以填寫關于先前已經確定的表型的調查表。調查表可以包括有關醫學和非醫學狀態的問題,例如先前診斷的疾病、醫學狀態的家 族史、生活方式、身體性狀、精神性狀、年齡、社會生活、環境等。在一個實施方式中,如果個體填寫了調查表,他們就可以免費確定其基因組譜。在 一些實施方式中,個體定期填寫調查表以免費訪問其表型譜和報告。在其它實施方式中, 填寫了調查表的個體可以給予注冊升級,以便他們具有比其先前的注冊水平更高的訪問權 限,或者他們可以以較低的價格購買或更新注冊。
為了保證科學精確性和重要性,在步驟121中存放在醫學相關的遺傳性變型數據 庫中的所有信息首先由研究/臨床顧問組核準,同時如果在步驟119中被授權的話,由適當 的政府機構檢查和監督。例如在美國,FDA可以通過核準用于確認遺傳性變型(通常為SNP、 轉錄物水平或突變)相關數據的算法進行監督。在步驟123中,為了附加的遺傳性變型-疾 病或者狀態相關性,對科學文獻和其它相關來源進行監控,并且在確認它們的精確性和重 要性后,以及經過政府機構的檢查和批準后,這些附加的基因型相關性在步驟125中加入 主數據庫中。經核準和驗證的醫學相關遺傳性變型的數據庫與個體全基因組譜相結合將有利 地允許對大量疾病或狀態進行遺傳風險評估。在匯編個體的基因組譜之后,可以通過將個 體的核苷酸(遺傳)變型或遺傳標記與已經與特定表型(例如疾病、狀態或身體狀態)相關 聯的人類核苷酸變型的數據庫相比較而確定個體基因型相關性。通過將個體基因組譜與基 因型相關性的主數據庫相比較,可以告知個體是否發現他們對于遺傳危險因子是陽性或陰 性的以及程度如何。個體將收到有關大范圍的經科學驗證的疾病狀態(例如,阿爾茨海默 氏病、心血管病、凝血)的相對風險和/或患病體質數據。例如,可以包括表1中的基因型 相關性。另外,數據庫中的SNP疾病相關性可以包括,但不限于圖4中所示的那些相關性。 也可以包括圖5和6中的其它相關性。本發明的商業方法因此提供了對于大量疾病和狀態 的風險分析而無需預先了解那些疾病和狀態可能導致什么風險。在其它實施方式中,與全基因組個體圖譜相結合的基因型相關性為非醫學相關表 型,例如“娛樂”表型或例如發色的身體性狀。在優選的實施方式中,如上所述,將規則或規 則集應用于個體的基因組譜或SNP譜。將規則應用到基因組譜產生了個體的表型譜。因此,當發現和驗證新的相關性時,用附加的基因型相關性擴展人類基因型相關 性的主數據庫。在需要時或適當時,可以通過訪問來自存儲在數據庫中的個體基因組譜中 的相關信息進行更新。例如,獲知的新基因型相關性可以基于特定的基因變型。然后,可以 通過僅僅獲取和比較個體的完整基因組譜中僅該基因的部分而確定個體是否可能受該新 的基因型相關性的影響。優選對基因組查詢的結果進行分析和解釋以便以可以理解的形式呈遞給個體。然 后,在步驟117中,如上面詳細描述的通過郵寄或通過在線入口界面以安全、機密的方式向 患者提供初始篩查的結果。報告可以包括表型譜以及關于表型譜中表型的基因組信息,例如,關于所涉及的 基因的基本遺傳學信息或者遺傳性變型在不同群體中的統計學信息。可以包括在報告中的 基于表型譜的其它信息是預防對策、健康信息、治療方法、癥狀認識、早期檢測方案、介入方 案以及表型的進一步鑒定和分類。在個體基因組圖譜的初始篩查之后,進行或可以進行可 控的、適度的更新。
當新的基因型相關性出現并且被驗證和核準時,結合主數據庫的更新,對個體基 因組圖譜進行更新或者可獲得更新。基于新的基因型相關性的新規則可以應用于初始基因 組圖譜以提供更新的表型譜。在步驟127中通過將個體的基因組圖譜的相關部分與新的基 因型相關性相比較,可以生成更新的基因型相關性譜。例如,如果基于特定基因中的變異發 現新的基因型相關性,則可以就新的基因型相關性對個體基因組圖譜的該基因部分進行分 析。在這一情況下,一種或多種新的規則可被應用來產生更新的表型譜,而不是具有已經應 用的規則的整個規則集。個體的更新的基因型相關性的結果在步驟129中以加密的方式提 {共。
初始的和更新的表型譜可以是提供給注冊用戶或消費者的服務。可以提供基因組 圖譜分析的不同注冊水平及其組合。同樣地,注冊水平可以發生變化以向個體提供他們希 望接受的具有其基因型相關性的服務量的選擇。這樣,提供的服務等級將隨著個體購買的 服務注冊水平發生改變。注冊用戶的入門級注冊可以包括基因組譜和初始表型譜。這可以是基礎注冊水 平。在基礎注冊水平內可以有不同的服務等級。例如,特定的注冊水平可以提供對于遺傳 咨詢、在治療或預防特定疾病方面具有特別專業知識的醫生和其它服務選項的介紹。可以 在線或通過電話獲得遺傳咨詢。在另一實施方式中,注冊的價格可能取決于個體選擇用于 其表型譜的表型的數量。另一選項可能為是否注冊用戶選擇訪問在線遺傳咨詢。在另一情況中,注冊可以提供初始的全基因組的基因型相關性,同時在數據庫中 維持個體的基因組譜;如果個體如此選擇的話,這一數據庫可以是加密的。在這一初始分析 之后,后續分析和附加的結果可以在個體請求和另外付款時完成。這可以是高級注冊水平。在本發明商業方法的一個實施方式中,進行個體風險的更新并且在注冊基礎上可 以向個體提供相應信息。購買高級注冊的注冊用戶可以獲得更新。對于基因型相關性分析 的注冊可以根據個體偏好提供新基因型相關性的特定類型或亞類的更新。例如,個體可能 僅希望獲悉存在已知治療或預防過程的基因型相關性。為了幫助個體決定是否進行另外的 分析,可以向個體提供關于已可利用的另外的基因型相關性的信息。這一信息可以方便地 郵寄或發送電子郵件給注冊用戶。在高級注冊中,可以存在更多的服務等級,例如在基礎注冊中所提及的那些。可以 在高等級中提供其它的注冊模式。例如,最高等級可以向注冊用戶提供無限制的更新和報 告。當確定新的相關性和規則時,可以更新注冊用戶的譜。在這一等級中,注冊用戶也可以 允許無限制數目的個體進行訪問,例如家庭成員和醫療保健管理者。注冊用戶也可以無限 制地訪問在線遺傳顧問和醫生。在高等級內的下一注冊水平可以提供更多限制的方面,例如有限次數的更新。注 冊用戶可以在注冊期間內對其基因組譜進行有限次數的更新,例如,一年4次。在另一注冊 水平中,注冊用戶可以一周一次、一月一次或一年一次對其存儲的基因組譜進行更新。在另 一實施方式中,注冊用戶僅可以具有可以選擇更新其基因組譜的有限數目的表型。個人入口也將方便地使個體能夠維持對于風險或相關性更新和/或信息更新的 注冊,或者請求更新的風險評估和信息。如上所述,可以提供不同的注冊水平以使個體能夠 選擇各種水平的基因型相關性結果和更新,并且注冊用戶可以通過其個人入口選擇不同注 冊水平。
這些注冊選項中的任一項將對本發明商業方法的收入流作出貢獻。本發明商業 方法的收入流也通過添加新的消費者和注冊用戶而增加,其中新的基因組譜加入到數據庫 中。表1 具有與表型相關的遺傳性變型的代表性基因。


引入祖先數據本發明還提供了通過引入祖先數據使用基因組譜使表型相關的方法和系統,例如 在此描述的方法和系統。因此,評估個體的基因型相關性可被表達或報告為GCI評分,并可 在產生GCI評分中引入祖先數據。例如,用于確定GCI評分的OR可以基于個體的家系或種 族被改變。個體發生某些狀態的風險通常取決于個體的遺傳和環境。當試圖基于遺傳學估計 該風險時,目前的研究可能受到僅所有遺傳學標記或變異(例如SNP)中的一部分可被測量 的事實的限制。特別地,對于復雜的疾病而言,許多遺傳和環境因素的復雜相互作用會導致 狀態的發生,因此可能存在多種邊緣性地影響風險的遺傳變異,例如SNP。目前的全基因組 關聯(Whole-Genome-Association,WGA)研究通常獨立地考慮基因組中的各區域,并試圖 在所有其它的遺傳因素和環境因素保持為未知時回答該區域中特定的SNP中的突變是如 何影響該狀態的風險的。從算術上,這些研究主要估計了隨SNP變化的風險概率的邊緣分 布(這些分布在此稱為SNP的效應)。發生狀態的風險可能不僅受一種遺傳變異或SNP的影響,而是會受多種SNP或其 它遺傳變異和環境因素的影響。因此,如果兩個群體在基因組中具有不同的等位基因分布 并處于影響他們的環境因素之中的話,那么各群體中特定的遺傳變異(例如SNP)的效應可 能存在潛在的差異。當該SNP民另一 SNP、其它的遺傳變異或環境因素之間存在基因-基因或基因-環境相互作用時,尤其會出現這種情況。但是,即使當不存在相互作用時,其它的 遺傳和環境因素的不同“背景分布”也可能影響遺傳變異例如SNP的效應。因此,不局限于 理論,不同的群體對于相同的遺傳性變型(例如SNP)可具有不同的效應大小。但是事實上, 在其SNP效應大小已在多于一個群體中測量過的幾乎所有已知的狀態中,測量的效應或者 相互非常接近,或者彼此處于至少95%的CI內。因此,在一些實施方式中,可以在本發明中 使用的簡化的假設是遺傳變異(例如原因SNP)的效應大小事實上在所有的群體中是相同 的。不幸的是,即使假設效應大小在群種中相同,仍然存在原因遺傳變異可能未知的 限制,例如原因SNP不能被或未被基因分型。幸運的是,基因組中很接近的SNP或其它遺傳 變異可能是相關的,例如在LD中,因此即使原因SNP未進行測量,標簽SNP也可用作原因的 代替(參見例如圖10)。但是,由于各種可能的原因(例如重組率的變化、選擇壓力或種群 瓶頸),不同的群體可能會具有不同的連鎖不平衡模式。因此,在一些實施方式中,如果已對 群體A中進行了研究,從而在該群體中獲得了特定的優勢比,不能假定群體B中也具有相同 的優勢比。這個可由下面的例子說明(參見圖10)。例如,已在高加索人(CEU)群體中進行 了研究,并且已報道了 SNP中的一個(“公布的SNP”)具有大的效應大小。在該例子中,公 布的SNP屬于與原因SNP共同的LD區塊,因此,原因SNP和公布的SNP之間的r2(相關系 數的平方)為1 ;盡管布置不同,公布的SNP和原因SNP優選在CEU群中是相關的。但是, 在另一群體(在這種情況中為YRI,約魯巴人)中,有可能公布的SNP和原因SNP處于不同 的LD區塊中。在極端的情況中,他們具有r2 = 0,其中他們在該群體中相互獨立。在這種 情況下,如果在YRI群中進行了相同的研究,不會對公布的SNP中檢測到效應。因此,忽略 消費者優先的群體和最初研究的群體中的LD模式來評估YRI個體的風險是錯誤的。圖10 中的例子為一個極端的例子,但是在現實中,可能以較低極端性的結果存在相似的模式。因此,在一些實施方式中,本發明提供了評估個體基因型相關性的方法,包括比較 具有不同家系的群體之間的基因座。例如,取決于如LD模式的因素,第一群體中出現的優 勢比可以應用在第二群體中,或在第二群體中發生變化。例如,由于YRI具有比CEU低的 LD,對于AS (亞洲人)而言,使用的優勢比可按以下列順序為AS、YRI (約魯巴人)、CEU (高 加索人/歐洲人)家系/種族研究中的優勢比。在一些實施方式中,基因座特異性的家系 可用于混合的群體。在一些實施方式中,第一和第二群體的群體可包括但不限于任何其它的群體,例 如非裔美國人、高加索人、德系猶太人、西班牙系猶太人、印度人、太平洋島民、中東人、德 魯茲人、貝都因人、南歐人、斯堪的納維亞人、東歐人、北非人、巴斯克人、西非人、東非人。 除非特別說明,第一和第二群體的群體可包括但不限于任何HapMap群體(YRI、CEU、CHB、 JPT、ASW、CHD、GIH、LWK、MEX、MKK、TSI)。HapMap 群體的描述可參見 http //hapmap. ors/ hapmappopulations. html, en 禾口附件中。
在一些實施方式中,用于評估個體的基因型與表型之間的相關性的方法可包括 比較與表型相關的包括遺傳變異(例如SNP)的第一連鎖不平衡(LD)模式和包括遺傳變異 (例如SNP)的第二 LD模式,其中第一 LD模式為第一個體群體的LD模式和第二 LD模式為 第二個體群體的LD模式;通過比較,確定第二群體中與表型相關的遺傳變異的概率;和從 個體的基因組譜,通過使用概率來評估表型的基因型相關性;和向所述個體或所述個體的 醫療保健管理者報告包括所述基因型相關性的結果。例如,假定已針對第一群體A報告了公布的SNP P,其具有優勢比0R[P,A],且原因 SNP是未知的。同樣在該例子中,假定對于第二群體B,如果樣本大小足夠大的話,優勢比C 在A和B中是相同的,也就是0R[C,A] =0R[C,B]。因此,如果C的位置是已知的,且0R[C, A]是已知的,那么B中的LD模式可用于估計最佳的標簽SNP,以在群體中捕獲C。但是,在 一些實施方式中,C的位置是未知的,且C的優勢比也是未知的。但是,對于每個SNP S和值 X而言,概率可以計算為假定群體A中S和P之間的相關系數以及P為具有優勢比0R[P, A]的公布的 SNP,Prob[S = C,0R[C,A] = X] |r2(P,S),在 A,P,0R[P,A]]中,即 S 是優勢比 為X(假定無限的樣本大小)的原因SNP的概率。為了計算該概率,在實際的研究中,利用 優勢比S比優勢比C小的事實,并可以回答假定對于足夠大的樣本大小OR [S,A]應該接近X 時,發生此現象的概率是多少的問題。給定原因SNP的分布和他們的效應大小,標簽SNP的 預期效應大小可通過計算由不同的SNP作為原因得到的效應大小的期待值(加權平均值) 來確定。在圖10給出的例子中,既然LD區塊為完美的LD,CEU區塊中的所有SNP具有作為 原因的相同概率以及具有相同的效應大小分布(即log優勢比為正常分布,其中置信區間確定其標準差)。但是,當YRI中公布的SNP意在標記原因時,該SNP的預期優勢比為公布 的優勢比和1之間的加權平均值,其中權重對應涉及的LD區塊的長度。因此,在一些實施方式中,OR的改變可由下述方法確定包括但不限于在第一個 體群體或參照群體(例如上述例子中描述的CEU)中對多個遺傳變異中的每一個確定原因 遺傳變異概率(例如OR)。然后OR可被用于從另一個體群體或參照組(例如YRI)的個體基 因組譜評估基因型相關性,從而向所述個體或所述個體的醫療保健管理者報告包括來自步 驟(c)的所述基因型相關性的結果。因此,用于計算其作為原因遺傳變異(例如原因SNP) 的概率的各遺傳變異通常與第一群體中表型相關的已知遺傳變異(例如公布的遺傳變異, 例如公布的SNP)接近。在一些實施方式中,用于計算其作為原因遺傳變異(例如原因SNP) 的概率的各遺傳變異與已知的或公布的遺傳變異發生連鎖不平衡。例如,再次假定已在第一群體A中報告了公布的SNP P,其具有優勢比0R[P,A], 且原因SNP C是未知的,并假定對于第二群體B,如果樣本大小足夠大,A和B中的優勢比 C是相同的,即0R[C,A] = 0R[C, B]。例子中的另一假設為對于研究的群體和個體群體 而言,LD模式已知的。例如,盡管該例子可擴展到其它群體,但假定已對CEU群體(第一 群體)進行了研究,且所述個體屬于YRI群體(第二群體)。在每個位置上,假定存在風 險等位基因R和非風險等位基因N。給定的SNP中三種可能的基因型為RR、RN和NN。對 于給定的SNP S,基因型G(可為RR、RN或NN)和個體組I,組I中在SNP S處具有基因 型G的個體數目表示為F(S,I,G)。因此,公布的SNP P中對CEU群體測量的優勢比為
p(p CA G)F(P CT NN) OR(P,CEU,G) =其中CA和CT代表病例和對照群體。類似地,使用
f (S,I,G)來表示群體I中基因型G的頻率。對于SNP Si和S2對而言,假定個體在S2處具 有G2 (在CEU中),使用P^JSi,,G2)表示個體在SNP Si處具有基因型&的概率。使用 相似的符號來表示第二群體YRI。在一些實施方式中,算法被用于確定第二群體的0R,因此用于評估個體的基因型 與表型之間的相關性,例如通過使用GCI評分。例如,此處公開的算法的輸入和輸出可包括 下面提供的信息1) SNP (例如HapMap中公開的那些)和另一特定的SNP P (其為公布的SNP)的列表。2)來自上述SNP的在研究中測定的SNP的列表。3)對于公布的SNP P,假定已知下述之一(a)來自病例和對照研究的基因型計數,也就是每個基因型G的F(P,CA, G)值和 F(P,CT,G)值是已知的。(b)或者,假定對于SNP P,基因型的優勢比、它們的置信區間、病例和對照的總數 是已知的。4)對于每對SNP S” S2和每對基因型G” G2而言,為算法提供P^,G! | S2,G2)和 PYEI飯,| S2,G2)(該信息可從HapMap或其它參考數據集中獲得)。然后在假定研究中的個體數非常大(接近無窮多)的情況下,算法可以對鄰近P 的每個SNP S輸出SNP的預期優勢比。當樣本大小接近無窮的時候,算法會假定CEU(即第 一群體)和YRI (即第二群體)的原因C的優勢比接近相同的數目。
81
因此,此處公開的算法可包括下面的主要步驟(同時參見實施例5)1)基于參考數據集得到LD概率。2)如果它們不是作為輸入(可選的l_b),得到計數F(P,CA,G)、F(P,CT,G)。3)在CEU中,對于P處病例和對照的基因型頻率,采集n(n非常大,例如>> 1000000)個樣品。取樣是基于給出計數的^?乂六,①^⑴,^①的后驗分布。4)對于頻率的各種情況和對于各SNP S (a)基于P的頻率和基于PCEU計算f(S, CA, G)和f(S, CT, G)。(b)基于S中采樣的等位基因頻率產生F(S,CA, G)、F(S,CT, G)的情況。(c)基于F(S)和基于f(S)(后者為漸近意義上的p值)計算S的p值。(d)基于所有測量的SNP S來得到最小p值。如果其不是P,則拒絕該情況。(e)如果不拒絕該情況,那么該情況與基于f (S)的最小p值一起被保留;這將會 是該情況的原因SNP。5)之前的階段產生了一組原因SNPsCi,...,(;和它們相應的優勢比。對于各該原 因,假定YRI群具有相同的優勢比。(a)該信息與中的基因型頻率一起被用于估計每一基因型G的頻率 f*YRi (Ci j CA,G) o(b) LD信息被用于估計每一 SNP S的fYEI (S,CA, G),fYEI (S,CT, G),并基于這些頻 率來計算漸近的優勢比。(c)對于各SNP S,漸近的優勢比在所有情況中平均,從而產生預期的漸近優勢比。在一些實施方式中,祖先數據可用于評估個體他們的亞組,例如本發明提供了用 于評估個體的參考亞組的方法,包括獲得個體的遺傳樣品;產生個體的基因組譜;通過比 較個體的基因組譜與當前的種族、地理來源或家系的人類基因型相關性數據庫來確定個體 的一個或多個參考亞組;和向個體或個體的醫療保健管理者報告步驟c)中得到的結果。在一方面,參考數據集包括來自個體的多組基因分型數據,其中基本上整個基因 組被用于本發明中。在一個實施方式中,參考數據包括來自多個個體的基本上完整基因組 的基因分型數據。其中在一個實施方式中,基本上完整的基因組是指在覆蓋至少80%的 個體基因組中的遺傳標記被檢測到,包括但不限于至少81%、82%、83%、84%、85%、86%、 87%、88%、89%、90%、91%、92%、93%、94%、95%、96%、97%、98%、99% 或 100% 基因組 覆蓋。在另一個實施方式中,來自參考數據中包括的個體的至少75%的基因分型數據集包 括來自覆蓋各個體的基因組的至少80%的遺傳標記的信息。在進一步的實施方式中,來 自對照數據中包括的個體的大于75 % (包括但不限于大于76 %、77 %、78 %、79 %、80 %、 81 82%,83%,84%,85%,86%,87%,88%,89%,90%,91 92%,93%,94%,95%, 96%、97%、98%、99%或100% )的基因分型數據集包括來自覆蓋各個體的基因組的至少 80%的遺傳標記的信息。在一個實施方式中,參考數據集包括多個遺傳標記的信息,該遺傳標記包括但不 限于核苷酸重復、核苷酸插入、核苷酸缺失、染色體轉位、染色體復制、拷貝數變異、微衛星 重復、核苷酸重復、著絲粒重復或端粒重復或者SNP。在另一個實施方式中,參考數據集包 括基本上限于單個遺傳標記(例如SNPS或微衛星)的信息。其中,參考集中包括的遺傳標 記的至少80%為相同類型的,包括但不限于至少81%、82%、83%、84%、85%、86%、87%、說明書
80/87 88%、89%、90%、91%、92%、93%、94%、95%、96%、97%、98%、99% 或 100% 的遺傳標記。在另一個實施方式中,參考數據集基本上由整個基因組SNP基因分型數據組成。 在一些實施方式中,通過使用用于SNP的識別和譜產生的高密度DNA陣列的個體基因組的 分析得到SNP數據。這種陣列包括但不限于那些可從Affymetrix和Illumina購買的陣列 (參見 AffymetrixGeneChip 500K Assay Manual, Affymetrix, Santa Clara,CA (在此 引入作為參考);Sentrix humanHap650Y 基因分型微球芯片,Illumina, San Diego, CA)。 在一些實施方式中,參考集基本由使用Affymetrix Genome Wide Human SNP Array 6.0對 多于900000個SNP進行基因分型而產生的SNP數據組成。在替代的實施方式中,通過完整 基因組采樣分析的多于 500000 個 SNP 可使用 AffymetrixGeneChip Human Mapping 500K Array Set石角定。在另一個實施方式中,參考數據集包括有關各個體的種族、地理起源和/或 家系的信息,包括其基因型數據。在一個實施方式中,所述信息存在于參考數據集 中,例 如 HapMap 或 Genographic Proiect(https://www3. nationalgeographic, com/ RenoRraphic/)。在另一個實施方式中,所述信息是自我報告的,例如由注冊用戶或非注冊 用戶報告。在另一個實施方式中,注冊用戶可收到自我報告有關他們的種族、地理起源和/ 或家系的信息的獎勵。在另一個實施方式中,注冊用戶可收到自我報告有關他們的疾病狀 態的信息(例如有關他們可能顯示出癥狀或具有遺傳的預傾向的任何疾病或狀況的信息) 的獎勵。在另一個實施方式中,個體收到允許使用這一信息和在至少一個參考數據集中的 個體基因型的獎勵。在一些實施方式中,獎勵可以是金錢獎勵、提供服務的折扣、提供免費 服務、提供服務升級(例如提高注冊用戶狀態,從基礎類別升到高級會員類別)、對相關人 提供免費或打折服務,或向第三方供應商(例如Amazon、StarbuCkS、WebMD)提供打折、免費 或信用服務。在相關的實施方式中,公開涉及他們的種族、地理起源和/或家系或者疾病狀 態的注冊用戶或非注冊用戶可被告知該公開信息的可能用途和給予提供或撤回他們的告 知同意的機會。在一個實施方式中,參考數據集包括來自具有不同的種族、地理起源和/或家系 的多個個體的信息。在另一個實施方式中,參考數據集包括來自所述參考數據集中代表的 各種族、地理起源和/或家系的類的一個以上的個體。在另一個實施方式中,參考數據集包 括來自所述參考數據集中代表的各種族、地理起源和/或家系的類的5個以上的個體。在另 一個實施方式中,參考數據集包括來自所述參考數據集中代表的各種族、地理起源和/或 家系的類的10個以上的個體。在另一個實施方式中,參考數據集包括來自所述參考數據集 中代表的各種族、地理起源和/或家系的類的20個以上的個體。在另一個實施方式中,分析參考集中的組合數據以使種族、地理起源和/或家系 與至少一種疾病或狀態和遺傳標記關聯性相聯系。在另一個實施方式中,自我報告的種族、 地理起源和/或家系可用于標記特定的疾病或狀態用于風險分析。在另一個實施方式中, 個體的種族、地理起源和/或家系與他們的基因型相關,以用于具有相似或共有的種族、地 理起源和/或家系的個體的亞組內遺傳標記與疾病或狀態之間的關聯的進一步分析(例如 計算機上的(in silico)群體遺傳研究)。例如,已知具有共同的種族、地理起源和/或家 系的個體(例如德系猶太人)的某些組,他們的孩子患有例如泰-薩克斯病的幾率要高很 多。對自己確認為德系猶太人的個體的分析可以在分析個體的遺傳標記時考慮該信息以進行修正。在另一個實施方式中,參考數據集中的數據可分層為參考數據亞組。當作為整體 考慮時,群體可包括可能具有不同的等位基因頻率的多個亞組。群體中存在具有不同的等 位基因頻率的多個亞組可使關聯研究提供較少信息。在采樣的亞組中不同的基本等位基因 頻率可能與各組內的疾病或狀態無關,且它們可能導致連鎖不平衡或疾病相關性的錯誤結 論。將個體的基因型與參考數據亞組而不是整個參考數據集進行比較,可降低由假的等位 基因關聯造成的錯誤的幾率。各參考數據亞組中的數據可根據至少一種共有的特征(例 如共有的種族、地理起源和/或家系)進行組織。其數據包括在各亞組中的個體的基因型 可被進一步分析以確定指示特定的種族、地理起源和/或家系的共同遺傳標記。在替代的 實施方式中,參考集中組合的數據可用于與至少一種疾病或狀態相關的且還與至少一種種 族、地理起源和/或家系相關的遺傳標記。在一個實施方式中,個體的至少一種自我報告的種族、地理起源和/或祖先特征 被用于修正個體基因型的分析。修正的分析可集中在與疾病或狀態相關的遺傳標記上,其 同時也是至少一個自我識別的種族、地理起源和/或祖先亞組共有的。在替代的實施方式 中,基于個體的基因型來確定與個體的種族、地理起源和/或家系相關的信息。例如,個體 的基因型與至少一種參考數據集相比較,并用于確定有關個體的種族、地理起源和/或家 系的信息。然后將該信息引入個體基因型的分析,以用于與至少一種疾病或狀態相關聯。該 分析可以集中在與至少一種疾病或狀態相關聯的遺傳標記上,其也可以是至少一種種族、 地理起源和/或家系共有的。在另一個實施方式中,有關個體的種族、地理起源和/或家系的信息和來自個體 遺傳標記的分析的信息兩者都被用于確定個體共有特定的種族、地理起源和/或家系的幾 率。通過結合兩種類型的信息,從基因型分析獲得的信息可用于驗證個體的自我報告的種 族、地理起源和/或家系,和用于糾正任何錯誤。在一個實施方式中,有關個體的種族、地理 起源和/或家系的信息是自我報告的。在替代的一個實施方式中,有關個體的種族、地理起 源和/或家系的信息是評估得到的。評估個體的種族、地理起源和/或家系可提供連續的 手段以在復雜疾病或狀態的研究中評估群體的結構。基于個體自我報告的信息,可能在種 族、地理起源和/或祖先分組中存在相當數量的異質性。例如,可以基于公布的等位基因頻 率來估計個體種族、地理起源和/或祖先比例(例如歐洲、北非、土著居民等)。估計的種 族、地理起源和/或祖先比例的例子可用于代替自我報告的信息來研究至少一種遺傳標記 與至少一種疾病或狀態之間的關聯。然后遺傳風險模型可用于確定是否調節估計的個體種 族、地理起源和/或祖先比例比不調節種族、地理起源和/或祖先的模型或基于自我報告的 信息的模型能夠更好地擬合數據。然后提供最好的擬合的模型可用于確定個體獲得至少一 種疾病或狀態的風險。在另一個實施方式中,根據對個體完整基因組的貢獻,基于來自基因型和/或自 我報告的數據的個體的種族、地理起源和/或家系信息可用于算術地確定與個體最接近的 一個或多個參考亞組。例如,如果可以確定個體的基因型表明他/她共有表示多于一種種 族、地理起源和/或家系的遺傳標記。這種確定可包括可能性和任選地置信區間(例如存 在士Y),至少個體的親戚中的一個是來自特定的種族、地理和/或祖先起源。然后該確 定可用于告知個體在共有相似的種族、地理和/或祖先起源的個體中通常與至少一種疾病
84或狀態相關的遺傳標記以及他們獲得所述至少一種疾病或狀態的風險。在另一個實施方式 中,可以產生包括有關各種不同的種族來源、地理起源和/或祖先來源對個體整個基因組 的貢獻的信息的報告。例如,報告可以以百分比描述在個體的整個基因組中聚積的祖先來 源,例如20%來自非洲,30%來自亞洲,50%來自歐洲。在進一步的實施方式中,這種報告可 任選地包括置信區間(例如20 % 士 3來自非洲,30 % 士 5來自亞洲,50 % 士 2來自歐洲)。在另一個實施方式中,個體的確定的種族、地理起源和/或家系可用于基于特定 的基因座的分析確定個體獲得至少一種疾病或狀態的風險。在一個相關的實施方式中,可 以對表征個體從具有特定的種族、地理起源和/或家系的親屬遺傳所述基因座的可能性以 及在所述基因座的等位基因與至少一種疾病或狀態之間的關聯性的至少一個基因座產生 報告。在另一個實施方式中,可集合至少兩個基因座特異性的關聯結果來確定個體獲得至 少一種疾病或狀態的組合風險。在另一個實施方式中,可確定與之前的關聯研究中報告的那些個體具有不同的種 族、地理起源和/或家系的個體獲得至少一種疾病或狀態的風險。在另一個實施方式中,可 確定具有獨特或罕見的種族、地理起源和/或家系而使其難于或不可能發現用來比較個體 的基因型的參考數據亞組的個體獲得至少一種疾病或狀態的風險。例如,個體可能想知道 他/她獲得與他的種族、地理起源和/或家系直接相關的遺傳疾病的風險。一些尤其罕見 的疾病,例如眼咽肌肉萎縮癥,僅在群體中小的局部的組中被發現。具有這一特性的疾病通 常可追溯到單個發作者或有限數目的之前的疾病攜帶者。對于具有這一特性的疾病而言, 如果可以確定個體與最初的發作者或疾病攜帶者無關,那么該個體通常可從風險組中排除 出去。在一個實施方式中,對具有共同的遺傳背景或共同的種族、地理起源和/或家系的其 它個體進行一個或多個關聯研究是有利的。其中,個體的種族、地理起源和/或家系通過評 估或通過自我報告信息確定。這些研究可結合個體的基因型、種族、地理起源和/或家系以 及至少一種疾病或狀態的情況的信息。可以比較來自至少兩個研究的結果以確定是否在遺 傳標記的等位基因與至少一種疾病或狀態之間觀察到相似的關聯。結果可取決于研究的各 群體中的相關結構和等位基因頻率以及它們之間的關系。此外,所述研究可用于識別與對 所述至少一種疾病或狀態的易感性相關的遺傳標記。在一個實施方式中,缺乏至少一個遺 傳標記的至少一個等位基因可用于排除個體患至少一種疾病或狀態的風險。在替代的實施 方式中,對于至少一個遺傳標記存在至少一個等位基因可用于將個體劃分為具有患至少一 種疾病或狀態的風險。下面的實施例用于闡明和解釋本發明。本發明的范圍不受這些實施例的限制。 實施例實施例1 :SNP譜的產生和分析向個體提供試劑盒(例如從DNA Genotek購買的)中的樣品管,個體將唾液樣品 (大約4ml)置于該管中,其中基因組DNA將會從唾液樣品中提取。唾液樣品被送至CLIA授 權的實驗室用于加工和分析。樣品通常置于易于向個體提供的收集試劑盒的運輸容器中通 過隔夜郵寄方式被送至機構。在一個優選的實施方式中,基因組DNA從唾液中分離出來。例如,使用來自DNA Genotek的DNA自我收集試劑盒技術,個體收集用于臨床處理的大約4ml唾液的樣本。將樣品送至合適的實驗室用于處理之后,通過熱變性和蛋白酶消化樣品來分離DNA,通常使用收 集試劑盒廠商提供的試劑,在50°C下進行至少一個小時處理。然后離心樣品,使用乙醇沉淀 上清液。DNA沉淀懸浮于適于后續分析的緩沖液中。根據公知的方法和/或收集試劑盒廠商提供的那些方法,個體的基因組DNA從唾 液樣品中分離出來。一般而言,樣品首先被熱變性和蛋白酶消化。然后,離心樣品,保留上 清液。然后使用乙醇來沉淀上清液,得到含大約5-16 yg的基因組DNA的沉淀。將DNA沉 淀懸浮在10mM Tris pH 7. 6,ImM EDTA(TE)中。使用陣列廠商提供的儀器和說明,通過將 基因組DNA和市售的高密度SNP陣列(例如可從Affymetrix或Illumina購買的)進行雜 交來產生SNP譜。個體的SNP譜被存放加密的數據庫或保險庫中。通過與建立的、醫療相關的SNP (其在基因組中的存在與特定的疾病或狀態相關) 的臨床得到的數據庫進行比較,查詢患者的數據結構的風險給予SNP。數據庫包括特定的 SNP或SNP單倍體型與特定的疾病或狀態之間的統計學相關性的信息。例如,如實施例III 所示,載脂蛋白E基因中的多態性產生了該蛋白質的不同同型體,其反過來與發生阿爾茨 海默病的統計學相關性相關。另一個例子是,具有凝血蛋白因子V(被稱為因子V Leiden) 變型的個體具有增加的凝血傾向。表1示出了其中與疾病或狀態表型相關的SNP的許多基 因。數據庫中信息的科學精確性和重要性已被研究/臨床咨詢委員會認可,并可由政府機 構監督。隨著科學界出現更多的SNP疾病相關性,數據庫被不斷更新。通過在線入口或郵件安全地向患者提供個體的SNP譜的分析結果。向患者提供解 釋和支持性信息,例如對于實施例IV中的因子VLeiden顯示的信息。對個體的SNP譜信息 的安全訪問(例如通過在線入口)將有助于與患者的醫生進行討論,并給予個體個性化醫 療的選擇。實施例2 基因型相關性的更新響應于初始確定個體基因型相關性的的請求,產生了基因組譜,建立了基因型相 關性,并向個體提供了結果,如實施例I所示。初始確定個體的基因型相關性之后,在另外 的基因型相關性已知時,后續的更新的相關性被確定或可被確定。注冊用戶享有高級水平 的注冊且他們的基因型譜被保留在加密的數據庫中。更新的相關性是在存儲的基因型譜上 進行的。例如,最初的基因型相關性(例如上述實施例I中描述的)可能已經確定特 定的個體不具有ApoE4,因此不具有早發性阿爾茨海默病的傾向,和該個體不具有因子V Leiden。在該初始確定之后,新的相關性可能成為已知的和確立的,從而在特定基因(假設 基因XYZ)中的多態性與特定的狀態(假定狀態321)相關。這一新的基因型相關性被添加 到人類基因型相關性的主數據庫中。然后通過首先從加密的數據庫中存儲的特定個體的 基因組譜中找到相關的基因XYZ數據來向特定的個體提供更新。特定個體的相關基因XYZ 數據與基因XYZ的更新的主數據庫信息相比較。特定個體對狀態321的易感性或遺傳傾向 從該比較中確定。該確定的結果被添加到特定個體的基因型相關性。向特定個體提供有關 特定個體是否對狀態321具有易感性或遺傳傾向的更新的結果,同時提供解釋和支持性信 肩、o實施例3 :ApoE4基因座和阿爾茨海默病的相關性已經表明,阿爾茨海默病(AD)的風險與載脂蛋白E(APOE)基因中的多態性有關,該多態性產生了三種APOE的同種型,被稱為ApoE2、ApoE3和ApoE4。同種型之間在在APOE 蛋白質中的殘基112和158位置上的1或2個氨基酸不同。ApoE2包含112/158cyS/cyS ; ApoE3包含112/158cys/arg ;和ApoE4包含112/158arg/arg。如表2所示,阿爾茨海默病 在較早年齡的發作的風險隨著APOE ε 4基因拷貝數而增加。同樣,如表3所示,AD的相對 風險隨著APOE ε 4基因拷貝數而增加。表2 =AD 風險等位基因的流行度(Corder 等人,Science 261 :921_3,1993)
APOE ε 4拷貝 流行度I阿耳茨海默氏病的風險~ 發作年齡 ~~O73% 20%84 表3 具有 ΑροΕ4 的 AD 相對風險(Farrer 等人,JAMA 278 1349-56,1997) 實施例4 因子V Leiden陽件患者的信息以下信息是可能提供給具有顯示出存在因子V Leiden基因的基因組SNP分布圖 的個體的信息的示例。該個體可具有在初始報告中可以提供信息的基礎注冊。什么是因子V Leiden ?其是指存在由一個人的父母遺傳的特定基因。因子V Leiden是凝血需要的蛋白 質因子V(5)的變型。具有因子V缺失的人更可能嚴重流血,而具有因子V Leiden的人的 血液凝血傾向增加。攜帶因子V Leiden基因的人們形成血凝(血栓形成)的風險比群體中的其它人 高5倍。但是許多具有該基因的人從不出現血凝塊。在英國和美國,群體的5%攜帶一個或 多個因子V Leiden基因,這遠多于將實際患血栓癥的人的數量。你如何會有因子V Leiden ?因子V的基因是從一個人的父母遺傳的。正如所有遺傳性特征,一個基因遺傳自母親而一個遺傳自父親。由此,可能遺傳兩個正常基因或者一個因子V Leiden基因和一 個正常基因或者兩個因子VLeiden基因。具有一個因子V Leiden基因將導致稍高的發生 血栓癥的風險,但是具有兩個基因導致大得多的風險。因子V Leiden的癥狀是什么?除非你出現凝血(血栓形成),否則沒有任何癥狀。什么是危險信號?最常見的問題是在腿部的血凝塊。腿部腫脹、疼痛和發紅顯示出這一問題。在更 稀有的病例中,可能出現肺部血凝塊(肺血栓癥),其導致呼吸困難。根據血凝塊的尺寸, 這一病癥的嚴重程度從幾乎不能被察覺到患者發生嚴重的呼吸困難。在甚至更稀有的病例 中,血凝塊可能發生在手臂或其它身體部位。由于這些凝塊形成在輸送血液至心臟的靜脈 而不是形成在動脈(其從心臟輸出血液)中,因子VLeiden不會使冠狀動脈血栓形成的風 險增大。什么可以避免血凝塊?因子V Leiden僅輕微增大導致血凝塊的風險,并且許多具有這一狀態的人永不會 發生血栓癥。一個人可以做許多事情來避免導致血凝塊。避免以同一姿勢久站或久坐。當 長途旅行時,重要的是有規律地鍛煉——必須使血液不“靜置不動”。熬夜或吸煙將極大地 增大出現血凝塊的風險。攜帶因子V Leiden基因的婦女不應該服避孕丸,因為這將顯著增 大患血栓癥的機會。攜帶因子V Leiden基因的婦女也應該在妊娠前咨詢其醫生,因為這也 會增大血栓形成的風險。醫生如何發現你具有因子V Leiden ?因子V Leiden的基因可在血液樣品中發現。腿部或胳膊的凝血可通常通過超聲檢查進行檢測。在將一種物質注入血液中以使血凝塊顯現后,血凝塊也可由X射線檢測。在肺里 的血塊更難于找到,但是通常醫生將使用放射性物質去測試肺內血流的分布和流至肺內的 空氣的分布。這兩種分布模式應該相匹配——不匹配表示存在血凝塊。如何處理因子V Leiden ?具有因子V Leiden的人們不需要進行治療,除非他們的血液開始凝結,在這種情 況下,醫生將開出稀釋血液(抗凝血的)藥物,例如華法林(例如,芐丙酮香豆素鈉)或者肝 素以防止進一步的血凝塊。治療通常將持續三至六個月,但是如果存在幾個血凝塊,則可能 需要更長時間。在重癥的情況下,藥物治療的過程可能無限期地持續;在極稀有的情況下, 血凝塊可能需要手術移除。在孕期如何處理因子V Leiden ?攜帶2個因子V Leiden基因的女性在孕期需要接受肝素促凝藥物的治療。相同 的治療適用于本身先前有血凝塊或者有血凝家族史的僅攜帶一個因子V Leiden基因的婦 女。所有攜帶因子V Leiden基因的女性在孕期的后半段中可能需要穿著特殊的長筒 襪以防止血凝塊。產后,她們可開抗凝藥物肝素。MM出現血凝塊的風險隨年齡增大,但是在對100名攜帶該基因的人進行的隨年齡的調查中,發現僅少數曾患過血栓癥。國家遺傳顧問學會(The National Society for Genetic Counselors(NSGC))可以提供你所在地區中遺傳顧問的列表以及關于建立家族史 的信息。在www. nsgc. org/consumer上搜尋他們的在線數據庫。實施例5 產牛具有不同家系的個體的優勢比1.基于參考數據集得到LD概率。計算在SNP S1, S2處具有基因型對(GpG2)的HapMap個體的數目,以產生兩個SNP 的聯合分布。使用Bayes法則合并各SNP的邊緣分布來估計Ρ·^” G11 S2, G2) (CEU為公布 的或第一群體)和Pyei (S1, G11 S2, G2) (YRI為第二群體,個體的祖先)。2.如果它們不作為輸入給Ml (可詵的Ι-b),得到i十數F(P,CA, G) ,F (P, CTG)。如果計數不作為輸入給出,下述方程組用于得到它們F (P, CA, NN) +F (P, CA, NR) +F (P, CA, RR) = NF (P, CT, NN) +F (P, CT, NR) +F (P, CT, RR) = M 在上述方程中,UB(P,CEU,G)為公布SNP P的基因型G的優勢比的置信區間上限。 M和N分別為研究中對照和病例的數目。存在具有6個變量的6個方程。列舉所有的F(P,CA, NN)和F(P,CA, RN)值。對 于各對值而言,確定其它變量的2-4方程是通過解一組線性方程得到的,最后兩個方程用 于確認。運行時間由N2決定。3.在CEU中采集在P處的病例和對照的基因型頻率的η個(η非常大,例如>> 1000000)情況。采樣是基于給定計數的f (P,CA, Gl,f (P,CT, G)的后驗分布。假定f (P)(看到F(P)的幾率)可在多項分布的假定下進行計算。通過假定在可 能的f (P)值上的均勻先驗,已知概率Prob (f (P) IF(P)) α Prob (F(P) | f (P))。MCMC方法被 用于使用Gibbs采樣器從該分布中采樣。4.對于頻率的各種情況和各SNP S a)基于ρ的頻率和P,來計算f (S,CA, G)和f (S,CT, G)公式=TJ、P,CA’G)PceiAS,G IP’G’)用于估計該情況中的S處的頻率。
G'
相似的公式可用作對照。b)基于S的采樣等位基因頻率來產生F (S,CA, G),F (S,CT, G)的情況。這是通過 假定代表S處的基因型的多項隨機變量進行的。c)基于F(S)和基于f (S)來計算S的ρ值(后者為漸近意義上的ρ值)。
基于F(S),Armitage-Trend檢驗被用于計算ρ值。為了計算漸近的ρ值,假定N 個病例和N個對照的樣本大小,具有與預期匹配的計數,例如F(S,CA, G)假定為Nf(S,CA, G)。d)基于所有測量的SNP S的F(S)得到最小ρ值。如果這不是P,那么該情況被拒 絕。e)如果該情況不被拒絕,那么基于f (S)保持該情況和最小ρ值;這是該情況的原 因 SNP。5.之前的階段產生了一組原因SNPsC1,. . .,Cn和它們相應的優勢比。對于各該原 因而言,假定YRI群體具有相同的優勢比。a) i亥信肩、和Ci^ YRI中的某因型頻率一fe被用干估i十毎一某因型G的頻率 ^YRllC1, CA,G)。為此,解下述方程 因為fYKI(S,CT,G)被假定從對照群體(HapMap)中已知,所以在該方程中存在三個 缺失的變量。因此上組方程組為一組線性方程,且可被有效地解出。b) LD信息被用于估計每一 SNP S的fYKI (S,CA, G),fYEI (S,CT, G),并基于這些頻率 來計算漸近的優勢比。這是通過與步驟4(a)相似的方式進行的。c)對于各SNP S而言,漸近的優勢比為所有情況的平均值,產生了預期的漸近優 勢比。然后該優勢比可用于確定個體的基因型相關性。盡管在此顯示和描述了本發明的一些優選實施方式,本領域普通技術人員明白這 些實施方式僅在于提供一些例子。在不偏離本發明的情況下,本領域技術人員可以做出一 些變化、改變和替換。可以明 白的是,對本發明實施方式的各種不同的替換可用于實施本發 明。下面的權利要求限定了本發明的范圍,這些權利要求和它們的等同物的范圍內的方法 和結構包括在此。
權利要求
一種用于評估個體的基因型與表型之間的相關性的方法,包括(a)比較(i)包含與表型相關的遺傳變異的第一連鎖不平衡(LD)模式,其中所述第一LD模式為第一個體群體的模式;和(ii)包含所述遺傳變異的第二LD模式,其中所述第二LD模式為第二個體群體的模式;(b)通過(a)中的所述比較確定在所述第二群體中所述遺傳變異與所述表型相關的概率;(c)包括使用步驟(b)中的所述概率由所述個體的基因組譜來評估所述表型的基因型相關性;和(d)向所述個體或所述個體的醫療保健管理者報告包括來自步驟(c)的所述基因型相關性的結果。
2.根據權利要求1所述的方法,其中在步驟(b)中,所述概率為等位基因或基因型優勢 比(OR)。
3.根據權利要求2所述的方法,其中所述OR源自已知的0R,其中所述已知的OR用于 與所述第一群體的所述表型相關的所述遺傳變異。
4.根據權利要求2所述的方法,其中所述第一群體和所述第二群體具有相似的LD模式。
5.一種用于評估個體的基因型與表型之間的相關性的方法,包括(a)在第一個體群體中確定多個遺傳變異中每一個的原因遺傳變異概率;(b)確定作為第二個體群體中所述多個遺傳變異中的每一個的概率的步驟(a)中的各 所述概率;(c)包括使用步驟(b)中的所述概率由所述個體的基因組譜來評估基因型與表型之間 的相關性;和(d)向所述個體或所述個體的醫療保健管理者報告包括來自步驟(c)的所述基因型與 表型之間的相關性的結果。
6.根據權利要求5所述的方法,其中步驟(a)中的所述概率為OR。
7.根據權利要求5所述的方法,其中步驟(a)的各所述遺傳變異接近于與所述第一群 體中的表型相關的已知遺傳變異。
8.根據權利要求7所述的方法,其中步驟(a)的各所述遺傳變異與所述已知遺傳變異 連鎖不平衡。
9.根據權利要求1或5所述的方法,其中所述基因型與表型的相關性作為GCI評分報告。
10.根據權利要求1或5所述的方法,其中所述第二群體與所述第一群體的家系不同。
11.根據權利要求1或5所述的方法,其中所述個體屬于所述第二群體的家系。
12.根據權利要求1或5所述的方法,其中所述原因遺傳變異為未知的。
13.根據權利要求1或5所述的方法,其中所述遺傳變異為單核苷酸多態性(SNP)。
14.根據權利要求1或5所述的方法,其中所述報告包括通過網絡傳輸所述結果。
15.根據權利要求1或5所述的方法,其中所述報告通過在線入口進行。
16.根據權利要求1或5所述的方法,其中所述報告通過紙件或電子郵件進行。
17.根據權利要求1或5所述的方法,其中所述報告包括加密形式報告。
18.根據權利要求1或5所述的方法,其中所述報告包括非加密形式報告。
19.根據權利要求1或5所述的方法,其中產生所述基因組譜是通過第三方進行的。
20.根據權利要求1或5所述的方法,其中所述基因組譜是從遺傳樣品產生的。
21.根據權利要求20所述的方法,其中第三方獲得所述遺傳樣品。
22.根據權利要求20所述的方法,其中所述遺傳樣品為DNA。
23.根據權利要求20所述的方法,其中所述遺傳樣品為RNA。
24.根據權利要求20所述的方法,其中遺傳樣品從選自血液、頭發、皮膚、唾液、精液、 尿液、糞便、汗液和口腔樣品的生物樣品獲得。
25.根據權利要求1或5所述的方法,其中所述基因組譜被存放在加密的數據庫或保險 庫中。
26.根據權利要求1或5所述的方法,其中所述基因組譜為單核苷酸多態性譜。
27.根據權利要求1或5所述的方法,其中所述基因族譜包括截短、插入、缺失或重復。
28.根據權利要求1或5所述的方法,其中所述基因組譜使用高密度DNA微陣列產生。
29.根據權利要求1或5所述的方法,其中所述基因組譜使用RT-PCR產生。
30.根據權利要求1或5所述的方法,其中所述基因組譜使用DNA測序產生。
31.根據權利要求1或5所述的方法,進一步包括(e)使用附加的遺傳變異更新所述結果。
32.根據權利要求1或5所述的方法,其中權利要求1或2所述的群體包括任意的 HapMap 群體(YRI、CEU、CHB、JPT、ASW、CHD、GIH、LWK、MEX、MKK、TSI),或任意其它的群體,例 如但不限于非裔美國人、高加索人、德系猶太人、西班牙系猶太人、印度人、太平洋島民、中 東人、德魯茲人、貝都因人、南歐人、斯堪的納維亞人、東歐人、北非人、巴斯克人、西非人或 東非人。
全文摘要
本發明提供了通過分析個體的基因組譜(genomic profile)和使用祖先數據來確定基因型和表型之間的相關性而評估個體的基因型與表型之間的相關性的方法和系統。
文檔編號C12Q1/68GK101842496SQ200880114465
公開日2010年9月22日 申請日期2008年9月26日 優先權日2007年9月26日
發明者D·A·斯特普漢, E·哈爾珀林, J·韋塞爾, M·卡爾吉爾 申請人:納維哲尼克斯公司
網友詢問留言 已有0條留言
  • 還沒有人留言評論。精彩留言會獲得點贊!
1
韩国伦理电影