單細胞多組學數據整合新突破:scButterfly與MaxFuse的應用與挑戰

單細胞多組學技術的快速發展,使得研究人員能夠在單個細胞層面同時分析多種生物分子,例如基因表達、染色質可及性和蛋白質表達。然而,由於技術限制和實驗成本,往往難以獲得完整的多組學數據。因此,如何利用現有的數據來準確地補全缺失的模態(例如,從RNA-seq數據預測ATAC-seq數據),成為一個重要的研究方向。近期,多項研究針對這一問題提出了新的解決方案,包括scButterfly和MaxFuse等方法,旨在提升跨模態基因補全的準確性和可靠性。

單細胞跨模態轉譯:scButterfly的雙重對齊變分自編碼器方法

《自然通訊》(Nature Communications)期刊近期發表了一篇名為 “scButterfly: a versatile single-cell cross-modality translation method via dual-aligned variational autoencoders” 的研究論文,介紹了一種名為scButterfly的全新單細胞跨模態轉譯方法。該方法利用雙重對齊變分自編碼器(dual-aligned variational autoencoders)來實現從一種模態到另一種模態的數據轉換。

scButterfly的核心優勢在於其能夠充分利用訓練集中多種模態的信息,同時將測試數據從一種模態轉譯到另一種模態。研究人員通過對比實驗證明,scButterfly在跨模態轉譯方面顯著優於現有的基準方法,同時能夠很好地保留細胞異質性。此外,scButterfly在多種場景下都表現出良好的性能,包括:

  • 不同數據集之間測序協議差異大
  • 用於訓練的多組學數據未配對或稀疏
  • 待轉譯的單模態數據來自不同的批次或包含新的細胞類型

研究團隊利用包含RNA和ATAC數據的BMMC數據集進行了測試。他們隨機選擇三個位點用於模型訓練,並在剩餘的位點上分別轉譯RNA和ATAC圖譜,這些位點包含獨立於訓練批次的批次。對於剩餘的位點,研究人員使用原始RNA和ATAC圖譜的整合作為基準,並評估了原始RNA與預測的ATAC圖譜以及原始ATAC與預測的RNA圖譜的整合效果。由於scButterfly-C不需要額外的細胞註釋,因此被用於轉譯,以確保通用性。

通過對轉譯後的圖譜進行降維和細胞聚類,研究人員使用調整互信息(AMI)、調整蘭德指數(ARI)、同質性分數(HOM)和歸一化互信息(NMI)等指標評估了性能。結果表明,scButterfly在跨驗證實驗的每個fold中都顯著優於基準方法,同時保留了細胞異質性。此外,研究人員還收集了六個額外的聯合分析RNA和ATAC數據的數據集,包括使用SNARE-seq從成年小鼠大腦皮層分析的MCC數據集。

scButterfly不僅能夠保留原始數據中細微的細胞類型,還可以通過細胞類型特異性的富集分析揭示有價值的生物學見解。此外,研究還展示了scButterfly在以下方面的廣泛潛力:

  • 為單模態數據實現整合多組學分析
  • 增強低質量的單細胞多組學數據
  • 自動註釋scATAC-seq數據的細胞類型
  • 實現從表觀基因組到轉錄組再到蛋白質組的連續轉譯
  • 為預測單細胞擾動反應開闢了可能的途徑

弱連接模態的整合:MaxFuse的挑戰與機遇

《自然生物技術》(Nature Biotechnology)期刊發表的另一篇研究論文 “Integration of spatial and single-cell data across modalities with weakly linked features” 則關注於弱連接模態的整合問題。現有的大多數方法都設計用於具有大量連接特徵且表現出強跨模態相關性的情況,即“強連接”。例如,在scRNA-seq和scATAC-seq之間,基因組中的每個基因都可以連接,並且基因活性和RNA表達之間的相關性通常足夠高,足以實現精確整合。

然而,對於弱連接的情況,例如靶向蛋白質檢測與轉錄組或表觀基因組檢測(如scRNA-seq或scATAC-seq)之間,由於連接特徵的數量較少和/或連接特徵的模態間相關性較弱,跨模態整合尤其具有挑戰性。隨著空間蛋白質組學技術的廣泛應用,這種情況變得越來越普遍,這些技術與RNA和ATAC測序互補,以實現更完整的組織表徵。

MaxFuse方法旨在解決弱連接模態的整合問題。研究人員通過全面的基準測試揭示了現有最先進方法在這種困難情況下的局限性。MaxFuse的一個重要潛在應用是推算空間蛋白質組數據集中未測量的特徵(例如,轉錄本)。研究人員通過人工刪除CODEX數據中的蛋白質特徵,對抗體panel大小的逐步縮小(補充圖12)和區域水平的基因推算相關性(補充圖13)對整合質量的影響進行了基準測試。

跨模態學習的挑戰與未來展望

儘管scButterfly和MaxFuse等方法在跨模態數據整合方面取得了顯著進展,但仍然存在一些挑戰需要克服。例如,批次效應是影響跨模態對齊的一個關鍵因素。一項針對空間轉錄組學中組織學和基因表達的大規模跨模態學習基準測試(HESCAPE)表明,基因表達編碼器是強表徵對齊的主要決定因素,並且在空間轉錄組學數據上預訓練的基因模型優於未經空間數據訓練的模型和簡單的基準方法。然而,下游任務評估顯示出一個顯著的矛盾:

雖然對比預訓練始終提高基因突變分類性能,但與未經跨模態目標訓練的基準編碼器相比,它會降低直接基因表達預測。

此外,跨模態數據整合的另一個挑戰是如何處理不同模態之間的複雜關係。例如,在神經影像學中,tau蛋白病理學與皮質萎縮和澱粉樣蛋白積累之間存在複雜的關係。研究人員利用深度學習模型,通過學習生物標記之間的潛在生物學關係,實現了tau蛋白病理學空間分佈的準確推算。然而,研究結果表明,基於FDG-PET的推算優於其他模態,並且採用多模態方法(例如,FDG + PiB和FDG + T1w)並未提高預測準確性。

總結與研判

單細胞多組學數據的整合和補全是生物醫學研究中的一個重要方向。scButterfly和MaxFuse等方法的出現,為解決跨模態數據整合問題提供了新的思路和工具。然而,在實際應用中,研究人員需要根據具體的研究問題和數據特點,選擇合適的方法,並充分考慮批次效應、模態間關係等因素。

未來,隨著單細胞多組學技術的進一步發展和計算方法的不断完善,跨模態數據整合將在以下方面發揮更重要的作用:

  • 揭示複雜疾病的分子機制
  • 開發更精準的診斷和治療方法
  • 加速新藥的研發
  • 深入理解細胞命運決定和組織發育過程

總體而言,跨模態數據整合是單細胞生物學研究的一個重要發展方向,具有廣闊的應用前景。儘管目前還存在一些挑戰,但隨著技術的進步和研究的深入,相信這些挑戰將會逐步得到解決,為生物醫學研究帶來更多的突破。

Newsflash | Powered by GeneOnline AI
For any suggestion and feedback, please contact us.
原始資料來源: GO-AI-6號機 Date: November 2, 2025