美國俄勒岡大學研究團隊發佈了一項突破性成果。他們利用ChatGPT同源技術,攻克了生物進化研究難題,開發出全球首個面向群體遺傳學的語言模型。該人工智慧(AI)工具可解析DNA序列中的突變規律,幾分鐘就可追溯基因對的共同祖先,為重建生物進化史提供了全新模式。相關論文刊登於新一期《美國國家科學院院刊》。

這項技術受大語言模型啟發,採用改進版GPT-2架構,但訓練資料並非自然語言,而是基於細菌、齧齒類、蚊媒及靈長類等多物種的進化類比資料。模型通過學習DNA序列中“A、T、C、G”四種堿基構成的“遺傳語言”,識別出類似文本錯別字的突變模式,這些隨世代累積的變異正是追溯血緣關係的分子路標。
在傳統群體遺傳學中,依賴概率統計的推斷方法雖精度可靠,但面臨計算效率瓶頸。尤其在應對大規模基因組資料時,解析單個染色體可能耗時數日,且難以處理片段缺失的不完整序列。新模型將繁重的統計運算前置到訓練階段,實際應用時僅需數分鐘即可完成傳統方法需數小時的任務,速度提升達數十倍。測試表明,其在推算基因“認祖”這一核心指標上,已媲美現有最優統計方法。
該技術對公共衛生研究具有直接價值。研究團隊正將其應用於瘧疾防控領域,通過分析蚊蟲種群中抗藥性基因的演化軌跡,揭示殺蟲劑選擇壓力下的進化動態。而理解抗性基因何時出現、如何擴散,正是制定可持續防控策略的關鍵。模型對非完整資料的相容性,恰好解決了野外採樣常見的基因序列碎片化難題。
團隊計畫進一步拓展模型功能,從當前雙譜系分析向多譜系全基因樹重建邁進。儘管傳統方法已能實現部分功能,但機器學習路線有望在處理海量資料方面展現獨特優勢。目前團隊正致力於優化演算法,以捕捉更複雜的進化信號。這項跨學科探索不僅為遺傳學注入新方法,也為AI在生命科學領域的深度應用提供了新路徑。
這項研究最厲害之處,是科學家把“讀文章”的技術拿去“讀基因”。之前科學家看基因變化,就像拿著放大鏡一個堿基一個堿基地數,慢而且累,遇到殘缺不全的基因資料就無能為力。但現在這個AI幾乎一眼就能看出DNA序列裡哪些地方寫錯了,還能通過這些錯誤反推出生物的祖先是誰,甚至推出什麼時候“分家”的。這對現實世界有個很直接的用處:比如對付蚊子。它能快速算出蚊子身上的抗藥基因是哪年出現的、是怎麼在蚊群裡傳開的。知道了抗藥基因的擴張路線,才能及時調整殺蟲劑,不讓蚊子產生耐藥性。可以說,該技術把原本要算好幾天的進化題縮短到了幾分鐘,讓人們可以從更亂、更碎的生物樣本裡挖出有用的進化線索,真正做到了“把AI從聊天室帶進了實驗室”。
扫一扫在手机上阅读本文章