當蛋白質成為可生成的語言:OpenCRISPR-1 改寫基因編輯工具的誕生方式
OpenCRISPR-1 顯示,生成式 AI 正把基因編輯從尋找天然工具,推向設計與驗證新候選分子的工程流程。
生成式模型最受矚目的應用,往往是文字、影像與程式碼;但對生命科學而言,更深遠的變化可能發生在「工具本身」的生成。研究團隊在《Nature》發表的 OpenCRISPR-1 研究,示範如何以蛋白質語言模型設計能在人類細胞中運作的 CRISPR–Cas 基因編輯器。這不只是把既有實驗流程自動化,而是讓模型直接參與候選生物分子的設計。

從天然搜尋,走向生成候選工具
傳統 CRISPR 工具多半源自微生物的天然防禦系統。研究人員會從自然界尋找可用的蛋白質,再依應用需求調整。不過,天然蛋白質是在原生環境中演化而來,移植到人類細胞時,活性、辨識範圍與非目標位置切割等特性未必同時理想。
OpenCRISPR-1 採取另一條路。研究團隊從超過一百萬組 CRISPR operon 建立資料集,利用大規模生物序列訓練模型,再生成與篩選 Cas9 類蛋白質及其引導 RNA。這套方法的關鍵,不是要求模型背出自然界已有的序列,而是學習維持結構與功能所需的序列規律,藉此探索自然演化未曾留下的候選組合。
根據論文,最後被選為 OpenCRISPR-1 的蛋白質 PF-CAS-182,與常用的 SpCas9 相差 403 個胺基酸突變。在針對一組已知目標與非目標位置進行的細胞實驗中,它的目標位置編輯活性與 SpCas9 相近,而已知非目標位置的中位數編輯率由 SpCas9 的 6.1%降至 0.32%。這個「約 95%下降」有明確的實驗範圍,不能直接解讀成所有細胞、目標或臨床情境都會得到同樣結果。

開放序列,讓結果能被延伸驗證
Profluent 已在 OpenCRISPR 專案頁 說明此編輯器由 Cas9 類蛋白質與引導 RNA 組成,並開放研究及商業用途。論文也提供 官方 GitHub 儲存庫,公開蛋白質與引導 RNA 序列,讓其他團隊能重現、比較或延伸這套設計。
開放並不等於技術已準備好直接進入醫療現場。論文呈現的是人類細胞實驗,也證明 OpenCRISPR-1 可用於鹼基編輯;但免疫反應、遞送方式、不同組織中的效果與長期安全性,仍需要更多研究。較合理的解讀是:AI 設計的基因編輯器已從電腦模擬跨進可實驗驗證的階段,而不是臨床應用已經完成。

真正的變化,是研發迴圈被重新安排
這項成果最值得注意的地方,不是「AI 取代演化」這類醒目口號,而是生物工具研發的順序正在改變。過去常見的流程是先發現天然分子,再測試它能做什麼;生成模型則讓團隊先界定想改善的特性,建立大量候選序列,最後回到細胞與生化實驗中逐一淘汰。
模型因此沒有取代實驗,反而把實驗資源集中到更有希望的候選者。未來真正的競爭力,可能不只來自更大的模型,也取決於高品質生物資料、可快速回饋的實驗平台,以及能否清楚界定安全與效能指標。OpenCRISPR-1 提供的不是終點,而是一個訊號:當蛋白質也能被當成可生成、可測試的語言,生命科學的設計空間便開始擴張。