近年來,學術造假問題日益嚴重,其中「論文工廠」(paper mills)扮演了關鍵角色。這些機構大量生產品質低劣甚至完全虛假的科學研究,嚴重威脅學術出版的誠信。澳洲昆士蘭科技大學(QUT)開發出一款突破性的機器學習工具,揭示了癌症研究領域中此問題的嚴重程度,發現超過 25 萬篇論文,約佔分析的所有癌症研究的 10%,帶有論文工廠製造的痕跡。

癌症研究中的學術造假:冰山一角

這項研究利用先進的自然語言處理技術,檢視了 1999 年至 2024 年初發表的超過 260 萬篇癌症研究文章。研究團隊訓練了一種名為 BERT 的深度學習模型,專門用於檢測已被標記為涉嫌造假的文章中,那些細微但獨特的文字特徵。

研究結果顯示,被標記為可疑的癌症研究論文比例在過去二十年中急劇上升,從 2000 年代初的約 1% 飆升至 2022 年的 16.4%。儘管 2023 年和 2024 年略有下降,但整體趨勢表明論文工廠活動日益猖獗,並在學術記錄中根深蒂固。更重要的是,這些造假論文滲透到各種期刊中,包括那些傳統上執行嚴格同行評審標準的高選擇性和聲譽卓著的期刊。

特定領域與癌症類型成高風險區

除了數量龐大之外,該研究還提供了關於學科和癌症亞型脆弱性的重要見解。分子癌症生物學和早期實驗室研究等領域,問題論文的密度異常高,這表明具有複雜實驗方法和高發表壓力的領域可能特別容易受到論文工廠的利用。胃癌、肝癌、骨癌和肺癌等特定癌症類型,則成為高風險區域,其特點是虛假研究的比例較高,這可能會扭曲後續的研究工作和臨床方向。

德國柏林自由大學東歐研究所的研究員 Anna Abalkina 指出,2024 年發表的論文中,約有 14% 可能與論文工廠有關,而在胃癌研究中,這個數字甚至超過 20%。她強調,期刊需要審查其論文集,以識別錯誤論文並採取糾正措施。

論文工廠的運作模式

昆士蘭科技大學公共衛生與社會工作學院的 Adrian Barnett 教授表示,論文工廠通常使用回收的文本、笨拙的措辭或捏造的數據和圖像來製造論文。他們很可能依賴樣板模板,這些模板可以通過分析文本模式的大型語言模型來檢測。

研究作者表示,為了防止論文工廠調整其模板,作者不會被告知其論文是否被標記。他們期望論文工廠會做出反應並進行創新,因為像他們這樣的檢測方法威脅到他們的收入。

對科學誠信的威脅與應對

美國西北大學凱洛格管理學院科學與創新中心博士後研究員 Reese A.K. Richardson 博士表示,癌症可能是最容易受到欺詐性研究影響的領域。他觀察到癌症研究中存在大量論文工廠活動,特別是在非編碼 RNA 及其在癌症中的作用方面。

面對這種威脅,專家們呼籲採取多管齊下的方法。印度阿米提大學阿米提商學院的 Mini Agrawal 博士表示,期刊必須採用強大的 AI 驅動篩查工具,加強同行評審,並促進研究倫理培訓。澳洲皇家墨爾本理工大學戰略洞察主任 Angel Calderon 認為,這也對研究人員所在機構的研究誠信提出了質疑。

目前,該研究模型已整合到一家主要出版商的三種期刊的在線提交系統中,並用於篩查與癌症相關的稿件。

結論與研判

這項研究有力地證明了論文工廠對癌症研究領域的滲透程度,以及對科學誠信的潛在危害。機器學習工具的應用,為大規模檢測學術造假提供了一種有效途徑。然而,研究人員也強調,這些發現並非已確認的研究欺詐案例,仍需由專業人士進行核實。面對論文工廠不斷演變的策略,學術界、出版商和資助機構需要共同努力,採取更嚴格的篩查和監管措施,以維護科學研究的可靠性和公信力,確保研究成果能夠真正促進癌症治療和預防的進展。此外,隨著生成式 AI 的興起,如何應對其可能帶來的造假挑戰,也將是未來學術界需要重點關注的問題。

Newsflash | Powered by GeneOnline AI
For any suggestion and feedback, please contact us.
原始資料來源: GO-AI-6號機 Date: February 1, 2026