AI 前沿 2026 年 9 月 24 日

2026-09-24 — 噬菌體 ART 酵素系統:AI 直接讀序列揪出的重複陣列

primary=https://www.anthropic.com/news/claude-discovers-novel-enzyme-system primary=https://www-cdn.anthropic.com/22573675ada52a8ca8a97a1a4b4326b2f208a071.pdf

噬菌體 ART 酵素系統:AI 直接讀序列揪出的重複陣列

Anthropic News · 2026-09-23

背景:基因體資料庫裡漏網的非編碼結構

Reverse transcriptase(RT)是把 RNA 反轉錄成 DNA 的酵素家族,原核生物中常見它與一段非編碼 RNA、一個效應蛋白組成系統,「retron(反轉錄子)」即是代表,會在噬菌體入侵時觸發細胞自殺以阻止感染擴散。過去要在數十億條序列裡找新 RT 家族,只能靠電腦管線比對已知系統的同源序列,再依事先定義好的特徵分類,落在既定特徵之外的異常會被直接濾掉。這類管線的新穎性其實是被規則預先限定的,真正發現新系統多半仍靠人工專家逐條檢視、憑經驗抓出反常,而這道複核關卡並不隨資料量增加而擴大規模。

核心發現:巨型噬菌體裡的 array-associated RT(ART)

Anthropic 用 Claude(模型代號 Mythos 5)架設多代理人研究框架,由工作、監督與編輯代理人分工,針對 19 億條 metagenomic 蛋白質分群、動用 52 個 RT profile HMM 進行地毯式搜尋。整趟活動跑了 119 個任務、949 個 agent session,耗費 21.5 小時(agent 總工時 77 小時)、用掉 2 億 1,560 萬個 token。流程篩出 198,290 個 RT 群集、分成 9 大類,再從 10,983 個 RT 座位旁找到的 3,564 個候選夥伴家族中選出 17 個深入調查,最終寫出 19 份報告。

其中一份報告,起點是一名工作代理人檢查某 RT 上游序列時,直接把整段 DNA 讀進脈絡,發現片段「CATGTGTATCGCATGTT」以約 100 到 180 個鹼基對的間距反覆出現,推理紀錄寫著「這是 CRISPR 式或 msDNA 式的重複陣列」。後續一支自寫的計數腳本,在同一座位確認了 14 份 16 個核苷酸的重複序列,中間夾著 100 到 200 個核苷酸長、彼此不同的間隔序列。這個陣列不屬於任何文獻已描述過的非編碼元件,團隊因此命名為 array-associated reverse transcriptase(ART)。

後續以 profile HMM 系統性比對,在已定序的巨型噬菌體與病毒 contig 中找到 95 個 90% 相似度的 RT 群集,其中 28 個上游帶有可辨識的重複陣列。這些陣列長 0.3 到 4.1 kb,由 3 到 21 份重複單元組成;重複本身 15 到 49 個核苷酸、中心有約 15 個核苷酸的迴文結構,間隔序列則長達 120 到 220 個核苷酸。與 CRISPR 陣列相比,ART 的重複邊界較不銳利、間隔序列長得多,鄰近座位也完全沒有 cas 基因,說明它只是外觀神似 CRISPR,並非真正的 CRISPR-Cas 系統。

  • Type I 夥伴蛋白:59/95 座位,約 600 個胺基酸,帶兩個串聯 GNAT 乙醯轉移酶摺疊,主要見於 Listeria 噬菌體與環境分離株
  • Type II 夥伴蛋白:約 270 個胺基酸的全螺旋蛋白,只出現在 Staphylococcus 噬菌體支系
  • Type III 夥伴蛋白:約 170 個胺基酸,只見於一支環境分離株,三型彼此序列與結構皆不相似

驗證分兩層。團隊先重新分析公開的 Staphylococcus phage SA1 感染 S. lentus 的 RNA-seq 資料集(BioProject PRJNA836150),發現 ART 陣列在感染後 5、15、55 分鐘都大量轉錄,且不是單一長轉錄本,而是切成 165、201、166 個核苷酸等獨立短 RNA。為排除宿主專屬效應,團隊再把 SA1 的非編碼陣列接上 J23119 啟動子、RT 基因接上 araBAD 啟動子,選殖進大腸桿菌並以全質體定序驗證,測到的小 RNA 呈現同樣的離散片段模式。這是整份研究裡少數落地到濕實驗室的驗證,結構預測與親緣分析仍停留在電腦運算,ART 真正的生物功能團隊坦言仍在研究中。

模型讀取序列的方式正確辨識出重複陣列的比例
整段基因座序列直接放進脈絡,不必呼叫工具四個最強模型平均可達 76%,Mythos 5 單獨達 96%
透過檔案或工具自行抓取序列片段最低僅 32%(Opus 5 的第 4 級任務);39% 的嘗試從未一次讀進 200 個核苷酸以上的連續片段

團隊把同一套搜尋流程重跑十次,卻沒有任何一次重新讀出這段上游 DNA 而發現陣列,只能歸因於代理人系統本身的非決定性行為。要穩定重現這次發現,靠的不是重跑同一套代理人流程,而是把序列直接餵進模型脈絡,這也解釋了上表讀取方式造成的落差。團隊另外在 Mythos 5 內部找到會對重複 DNA 產生反應的訊號,性質類似 Evo 2 等基因體語言模型裡已知能辨識 CRISPR 間隔序列的訊號。

影響範圍:誰該注意、注意什麼

對分子生物學研究者而言,ART 說明既有巨型噬菌體基因體裡,仍藏著預先定義特徵的比對管線抓不到的非編碼元件,值得回頭用「直接讀序列」重新檢視已定序但未深入分析的 RT 座位。CRISPR 基因編輯先驅、MIT 與 Broad Institute 教授 Feng Zhang 審閱了這份預印本並背書其結果,也代表這類異常值得同行留意。

對基因編輯工具開發者來說,ART 生物功能仍未確認,論文明白寫著這部分研究仍在進行中,現階段還不到可以拿來設計工具的成熟度,但其反轉錄子式三件式架構(RT、夥伴蛋白、非編碼 RNA 庫)值得列入觀察名單,如同當年 retron 從被發現到改造成編輯工具也花了數年。

對 AI 輔助科研的能力邊界而言,這次案例劃出的界線很具體:讓模型把完整序列讀進脈絡,比讓模型呼叫工具去查,更容易觸發異常辨識。代理人呼叫工具時常沒讀進足夠長的連續片段,等於沒看過完整的一個重複單元,重跑十次也沒能重現同一發現,說明這種「自主逛資料庫、順手抓到異常」的能力仍高度依賴任務設計與運氣,還不是能穩定量產發現的流程。

原始來源:Anthropic News;預印本 PDF(Yoon et al., 2026)


End of article
0
Would love your thoughts, please comment.x
()
x