基因治療領域正蓬勃發展,而腺相關病毒(AAV)載體是目前最常用的基因傳遞工具之一。然而,設計出高效且安全的AAV載體仍然是一個巨大的挑戰。近年來,機器學習(ML)在蛋白質工程領域嶄露頭角,為加速AAV載體設計提供了新的可能性。其中,預訓練嵌入模型,例如基於蛋白質序列的大型語言模型,被廣泛應用於預測蛋白質的性質和功能。然而,這些模型在AAV載體設計中的應用效果如何?它們的局限性又在哪裡?一項最新的研究深入探討了這些問題,並以AAV載體可行性預測為例,揭示了預訓練嵌入模型在機器學習輔助蛋白質設計中的潛在瓶頸。
預訓練嵌入模型在AAV載體設計中的應用
預訓練嵌入模型通過在大規模蛋白質序列數據上進行訓練,學習蛋白質序列的潛在表示。這些表示可以捕捉蛋白質的結構和功能信息,並被用於預測蛋白質的各種性質,例如穩定性、結合親和力以及表達水平。在AAV載體設計中,研究人員利用這些模型來預測AAV衣殼蛋白的變異對病毒感染能力和免疫原性的影響,從而篩選出更具潛力的候選載體。
具體而言,研究人員通常會將AAV衣殼蛋白的序列輸入到預訓練嵌入模型中,獲得每個序列的嵌入向量。然後,他們將這些向量作為輸入,訓練一個機器學習模型(例如支持向量機或神經網絡)來預測AAV載體的可行性,例如病毒滴度、轉染效率或免疫反應。
研究揭示的局限性
儘管預訓練嵌入模型在AAV載體設計中展現出一定的潛力,但上述研究揭示了其固有的局限性。研究人員發現,預訓練嵌入模型在預測AAV載體可行性方面的表現並不總是令人滿意。尤其是在面對與訓練數據集差異較大的新型AAV變異體時,模型的預測準確性會顯著下降。
這項研究指出,預訓練嵌入模型的局限性主要來自以下幾個方面:
數據偏差:
預訓練嵌入模型通常在包含大量天然蛋白質序列的數據集上進行訓練。然而,AAV衣殼蛋白的序列空間非常廣闊,並且包含許多非天然的變異體。如果訓練數據集中缺乏這些變異體的代表性,模型就難以準確預測它們的性質。
模型泛化能力:
預訓練嵌入模型可能過度擬合訓練數據集中的特定模式,而缺乏對新數據的泛化能力。這導致模型在預測與訓練數據集差異較大的AAV變異體時表現不佳。
缺乏結構信息:
預訓練嵌入模型主要基於蛋白質序列信息進行訓練,而忽略了蛋白質的結構信息。然而,AAV衣殼蛋白的結構對其功能至關重要。缺乏結構信息可能會限制模型的預測能力。
數據與事實佐證
該研究團隊使用了多種AAV血清型的衣殼蛋白序列,並利用不同的預訓練嵌入模型(例如ESM-1b、ProtBERT)生成嵌入向量。他們發現,在預測病毒滴度方面,模型的準確性在不同血清型之間存在顯著差異。對於訓練數據集中代表性較高的血清型,模型的預測準確性相對較高,而對於代表性較低的血清型,模型的預測準確性則明顯下降。此外,研究人員還發現,即使使用相同的預訓練嵌入模型,不同的機器學習算法也會導致不同的預測結果,這表明模型本身並非唯一的限制因素。
結論與研判
總體而言,這項研究表明,預訓練嵌入模型在機器學習輔助AAV載體設計中具有一定的潛力,但其應用受到固有的局限性限制。為了提高模型的預測準確性,研究人員需要解決數據偏差、模型泛化能力以及缺乏結構信息等問題。
未來的研究方向可能包括:
擴展訓練數據集:
收集更多AAV衣殼蛋白的序列數據,特別是包含非天然變異體的數據,以提高模型的代表性。
開發更強大的模型:
設計能夠更好地捕捉蛋白質結構和功能信息的預訓練嵌入模型。
結合多種信息:
將序列信息、結構信息以及實驗數據整合到機器學習模型中,以提高預測準確性。
儘管目前預訓練嵌入模型在AAV載體設計中仍存在一些挑戰,但隨著技術的不斷發展,我們有理由相信,機器學習將在未來加速AAV載體的設計和優化,為基因治療領域帶來新的突破。
Newsflash | Powered by GeneOnline AI
For any suggestion and feedback, please contact us.
原始資料來源: GO-AI-6號機 Date: March 26, 2026


