隨著 2025 年諾貝爾化學獎對網狀化學領域的認可,金屬有機框架(MOFs)與共價有機框架(COFs)的研究再次成為材料科學的焦點。
共價有機框架(Covalent Organic Frameworks, COFs)是一類由輕元素通過強共價鍵連接形成的晶態多孔材料,自 2005 年被首次報道以來,因其多孔性、低密度、高比表面積、結構可調和化學穩定性,在氣體分離、催化、儲能、光電子學及藥物遞送等領域展現出巨大潛力。然而,與金屬有機框架(MOFs)相比,COFs的研究進展相對緩慢,實驗報道的 COFs 僅約 1, 250 種,而 MOFs 已超過 125, 000 種。這一差距的背后,既有合成結晶度的挑戰,也有數據積累和計算工具滯后的因素。
這種數據量的匱乏導致早期 AI 研究主要集中在 MOFs 上。然而,隨著假設 COF(hypoCOF)數據庫的建立(如 Berkeley COF, ReDDCOFFEE)以及高通量計算篩選(HTCS)的發展,AI 正在填補這一空白。雖然 MOFs 在 AI 輔助研究中起步更早、數據庫更龐大,但 COFs 憑借其無金屬組成、高化學穩定性和模塊化設計的獨特優勢,正迎來 AI 驅動的黃金時代。
本次分享,我們深度解讀發表于 JACS Au 的前瞻性綜述 《Digital Reticular Chemistry: How Artificial Intelligence Is Redefining COF Research》,梳理 AI 如何從性能篩選、合成智能到自主發現,全方位加速 COFs 材料的設計與應用,為關注多孔材料交叉研究的讀者提供參考。


01 從大規模篩選到數據高效的機器學習
在 MOF 領域,高通量計算篩選結合機器學習已發展得較為成熟。研究者建立了多個公開數據庫,并利用巨正則蒙特卡洛(GCMC)或分子動力學模擬生成訓練數據。COF 領域雖然起步較晚,但也陸續構建了若干假設結構數據庫,例如 Berkeley COF 數據庫(約 7 萬種)、ReDDCOFFEE(約 27 萬種)和 Genomic COF(約 47 萬種)。這些數據庫為機器學習提供了必要的樣本空間。

圖1 金屬有機框架(MOF)和共價有機框架(COF)研究從網狀化學到數字化學的演變:網狀化學傳統上依賴于實驗和人類直覺,而數字化學現在則利用大數據集、高通量分子模擬和機器學習模型,以實現材料的快速預測、篩選和逆向設計
早期工作多采用基于描述符的模型,即人為定義孔徑、表面積、元素組成等特征,再與模擬或實驗數據建立映射。這類方法在面對新任務時往往需要重新訓練,且依賴高質量的描述符設計。近來,研究者開始探索更高效或更通用的策略:
• 主動學習:
在 CH? 存儲篩選中,主動學習算法從 Genomic COF 的 44 萬余種結構中僅通過約 50 次 GCMC 模擬就識別出性能最優的材料,其甲烷可交付容量(222.2 v/v)超過了此前已知的最佳 Berkeley COF(216.9 v/v)。這種迭代采樣策略顯著降低了計算成本。
• 遷移學習:
針對 COF 數據不足的問題,研究者利用在 190 萬種多孔材料上預訓練的 Transformer 模型,再微調用于 COF 的 H? 吸附預測。結果表明,從 MOF 學習到的表征可以遷移至 COF,在數據有限時仍能保持較好的預測精度。
• 直接結構學習:
部分工作不再依賴人工描述符,而是將 COF 的晶體結構文件(CIF)或勢能面體素網格直接輸入神經網絡。例如,使用卷積神經網絡處理三維勢能網格,在預測 CH? 吸附時,僅用較少訓練樣本即達到甚至優于傳統隨機森林模型的精度。另一種方法將原子坐標和元素種類視為點云,利用深度學習直接從原始結構預測吸附量,同樣在 COF 案例中表現出良好性能。
不過需要指出,這些模型輸入的 CIF 通常代表理想化的周期性結構,未考慮實際二維 COF 中層間堆積無序或偏移的影響,這可能高估或低估實際的吸附性能。

02 AI賦能的多場景應用突破
• 氣體分離與存儲
ML 模型已成功應用于 COFs 的 CH?、H?、CO? 吸附性能預測。主動學習策略使得僅需模擬 50 種材料即可從近 45 萬種候選物中篩選出最優材料;遷移學習則實現了從 MOFs 到 COFs 的知識遷移,緩解了 COF 數據稀缺問題;而基于晶體結構直接輸入的深度學習方法(如 3D 體素化、點云表示),進一步擺脫了對人工設計描述符的依賴。

圖2 用于COFs中氣體分離和氣體儲存的機器學習方法:a)基于描述符的機器學習模型用于模擬COF膜;b)主動學習用于預測COFs中CH4的傳遞;c)遷移學習用于評估COFs的氫氣(H2)吸收能力;d)直接結構學習用于計算COFs對CH4的吸收
• 催化、光電子學與能源領域
AI在COF研究中另一個活躍的領域是催化、光電子學和能源相關應用,數據往往來自密度泛函理論(DFT)計算,成本較高,因此數據高效的機器學習顯得尤為重要。一個典型案例是 H?O? 光合作用 COF 光催化劑的發現。研究者首先基于 DFT 計算獲得分子描述符,訓練模型后對約 3.3 萬種 COF 進行篩選,隨后合成了排名靠前的候選材料。其中性能最佳的 TAPPy-COF 在可見光下的 H?O? 產率達到 7.0 mmol g?¹ h?¹,優于已有報道的 COF 光催化劑,且結構穩定。
在熒光 COF 的發現中,主動學習被用于直接指導實驗:貝葉斯優化算法在僅有少量初始數據的情況下,從 3 種三醛與 26 種二胺的組合空間中推薦了 15 種 COF 進行合成,結果發現兩種材料的熒光量子產率分別達到約 55% 和 45%,超越了此前的最好水平。這表明即使在化學空間相對較小、初始數據極少時,機器學習仍能有效識別異常高性能材料。

圖3 人工智能輔助的COF設計與發現,用于催化、光電子和能源應用:a)基于機器學習的光催化制備H202催化劑設計;b)利用人工智能輔助發現高熒光COFs;c)基于機器學習的串聯吸附式熱泵用分子篩膜MOF和COF對篩選
• 環境與生物醫學應用
在環境領域,短鏈 PFAS(如全氟丁酸)的水處理是一個難題。研究者用蒙特卡洛模擬計算了部分 COF 的吸附選擇性,再訓練晶體圖卷積神經網絡預測剩余結構,發現三嗪基 COF 對 PFBA 選擇性最高,而硼基 COF 雖然選擇性也不錯但水穩定性差。這類分析不僅提供了排序,還指出了值得優先研究的化學類型。

圖4 基于人工智能的COF篩選在環境和生物醫學中的應用:a)利用機器學習加速的高通量篩選,用于從水中去除短鏈全氟和多氟化合物(PFAS);b)深度神經網絡引導的COF篩選,用于5-氟尿嘧啶(5-FU)負載
在生物醫學方面,針對 5-氟尿嘧啶藥物負載的預測,深度神經網絡表明比表面積和孔徑是主要控制因素,并篩選出 COF-362 作為吸附焓最高的候選。不過作者也提到,藥物釋放過程通常需要分子動力學模擬,計算成本較高,未來若能結合加速 MD 的 AI 方法,將更有助于實際應用。

03 合成智能:
從條件優化到自主發現
近年來,COF 研究的一個顯著趨勢是將 AI 從單純的性能預測拓展到合成條件的優化與設計。傳統合成 COF 需要精確控制溶劑、催化劑、溫度、時間和化學計量比,這些參數通常依賴文獻經驗或反復試驗。
較早的工作聚焦于已知 COF 的條件優化。例如,在用于大氣集水 COF-323 的合成中,研究者利用基于 ChatGPT 的助手進行文獻檢索和實驗規劃,配合貝葉斯優化推薦微波合成條件。經過 82 次實驗,AI 引導的合成方案使 BET 表面積達到 926–1459 m²/g,約為此前報道最高值的兩倍,且在 10–40% 相對濕度下的水工作容量顯著提升。
更大規模的嘗試是將文獻中的合成知識系統化。研究者從 800 多篇 COF 論文中提取了 2709 個合成方案,包括連接體組合、溶劑、催化劑、溫度、時間及 PXRD 結果等,構建了一個可檢索的數據庫。采用檢索增強生成(RAG)的方法,對新的連接體對推薦合成條件。基準測試顯示,推薦溶劑和催化劑與文獻成功條件的一致性約為 83%,實驗驗證也成功合成了兩種新型氟化 COF。
更進一步,LLM加速合成技術(LFAST) 將大語言模型與機器人合成及高通量 PXRD 分析整合。面對一種被 118 篇論文報道但始終未獲得尖銳衍射峰的 COF(TpPa-SO?H),該系統實現了迄今最高的結晶度指數。隨后,系統在沒有文獻先例的情況下,提出并成功合成了一種全新 COF——COF-2000,展示了從推薦條件到自主發現的跨越。
另一項工作中,AI 被用于為特定性能目標選擇構筑基元。基于對 355 篇 COF 光催化論文的文本挖掘(提取超過 1.1 萬個化學關系),系統推薦了 TAPT 和 BTT 作為構筑單元,并合成了亞胺連接的 Imi-COF 和噻唑連接的 Thz-COF,后者在 H?O? 產率和結構穩定性上均更優。

圖5 人工智能輔助的人工引導型COF合成、發現與優化:a)人工智能與人工協作,對COF-323的合成條件進行迭代優化,以提高其結晶度和水吸附能力;b)人工智能與人工協作,用于合成新型氟化COFs;c)LFAST輔助的自動化COF合成與結晶度優化;d)具有光催化制氫目標性能的COFs的自主發現
不過作者也謹慎指出,仍需保持清醒。當前的 AI 模型大多基于完美的晶體結構(CIF 文件),當前大語言模型并未真正理解 COF 的成核與生長機制,其推薦主要基于文獻中的統計關聯,而非物理或化學機理。現實中的 COFs 往往存在層間堆積無序、缺陷和穩定性問題。此外,缺乏 “失敗實驗” 的數據,也讓 AI 對合成難度的評估存在偏差。
因此,AI 預測與文獻結果的高度一致性并不等同于真正的 “發現”,嚴格的實驗驗證和跨體系的基準測試仍然是必需的。未來的關鍵,在于建立包含失敗案例的標準化數據庫,開發能理解復雜拓撲結構的生成式 AI,并最終實現計算與實驗的閉環。

04 挑戰與未來方向
盡管上述進展令人鼓舞,該展望也明確指出了若干瓶頸:
• 數據質量與偏差:
失敗的合成、低結晶度或無定形產物很少被報道,導致訓練數據偏向成功案例,模型可能高估合成可行性。未來的數據庫應系統收錄負面結果,并增加標準化的合成與表征標簽。
• 結構表示與拓撲泛化:
大多數模型假設理想晶體結構,對二維 COF 的層間堆疊無序、柔性或缺陷缺乏有效描述。此外,常見拓撲結構(如 hcb、sod)容易被編碼,但較復雜的網絡(如 qom、ana)則難以推廣。改進拓撲感知表示將是提升生成模型可靠性的關鍵。
• 計算與實驗的閉環:
作者強調,未來的自主實驗室應實現 “設計—合成—表征—再設計” 的閉環,這需要計算科學家與實驗化學家的深度協作。同時,文本挖掘工具(如針對 COF 的 ChemicalTagger 或 MOF-ChemUnity)應擴展到捕捉穩定性限制、活化失敗等信息,以訓練更具 “合成意識” 的 AI 模型。
• 機器學習勢的發展:
目前針對 COF 的機器學習勢函數仍很有限,而 COF 的共價鍵特性、層間弱相互作用及結構柔性都需要專用勢能模型。結合量子力學計算、原子模擬和機器學習的多尺度方法有望更真實地預測吸附、擴散及結構響應。
總體來看,AI 在 COF 領域的角色正從加速計算篩選擴展到輔助實驗設計和合成規劃。但它的作用仍是輔助性的 —— 將研究者的精力從重復性試錯中解放出來,而非取代對化學本質的理解。對所有材料科學的前沿探索者來說,擁抱 “數字網狀化學”,意味著我們正站在下一個重大科學突破的門檻上。
文獻原文:
https://doi.org/10.1021/jacsau.6c00576
聲明:
本文所有內容旨在學術探討與信息交流,所有權利歸原作者所有。

從學術前瞻到產業落地,
晶泰科技的AI+材料研發布局
學術界的展望為我們勾勒了 AI 輔助 COF 研究的諸多可能性,但一個不容忽視的現實是:這些方法大多仍停留在計算篩選和有限實驗驗證階段。從 AI 推薦到實驗室可靠合成,中間還橫亙著數據碎片化、實驗通量不足、反饋周期長等障礙。要真正跑通 “預測—實驗—迭代” 的閉環,不僅需要更聰明的算法,也需要標準化的實驗數據生成能力和自動化的執行平臺。晶泰科技的算法體系以 AI 為核心,構建了 “干濕閉環” 的科研體系,在藥物、材料等多領域實現技術落地。
1. 核心算法布局:200+垂類AI化學模型打造“化學超級大腦”
依托百萬級化合物與反應數據庫,打造覆蓋分子生成、結構優化、反應預測、性質預判、條件篩選等全研發場景的 200 + 垂類 AI 化學模型,融合量子力學計算與機器學習能力,自由能微擾計算精度行業領先,可精準預判反應可行性、分子成藥性與材料理化性質,還能自主遍歷海量化學空間生成最優實驗方案,實時復盤數據修正參數。

2. 算法落地核心:“干濕閉環”實現AI與實驗雙向賦能
• 干實驗(AI 算力)指導濕實驗:
AI 提前預判最優反應路徑、篩選核心參數,讓自動化實驗精準靶向有效研發方向
• 濕實驗反哺干實驗:
自主實驗室產生的海量結構化真實數據持續訓練、迭代 AI 模型,實現越用越準的自進化效果,打通 “AI 預測 - 智能設計 - 自動化實操 - 數據迭代” 的閉環

3. 材料領域算法應用案例
• 高分子材料配方優化:
基于客戶歷史數據建立 AI 預測模型并推薦配方,硬件實現全流程自動化,通過表征結果自主推薦下一輪實驗,僅需 3-6 次迭代即可鎖定最佳配方,實現 AI + 高分子自動化合成的數據閉環
• MOF 材料研發:
將結構表征與性能測試直接關聯,構建以性能為導向的數據閉環,實現 MOF 材料從隨機試錯向理性設計與快速迭代的跨越
• 催化材料研發:
搭建全流程自動化高通量研發平臺,通過 XRD 樣品自動制備與表征,系統自動比對分析譜圖、判斷實驗是否達標,結合評價結果利用算法挖掘分子篩結構與催化性能的構效關系
• 電解液配方優化:
先利用通用 AI 模型提取并結構化公開文獻數據,再通過圖神經網絡構建高精度性質預測模型并智能采樣,最后由自動化工站執行方案并通過主動學習策略實時優化模型精度

圖 AI+機器人結合賦能材料科學研究
4. 算法數據支撐:AI4Science 數據基座與標準化數據基建
• 生物材料研發自主實驗室通過端到端自動化、復雜操作標準化和 AI4Science 數據基座,打通 “自動化實驗→數據沉淀→模型迭代→智能決策” 的 AI 研發閉環
• 自主研發為 AI 算法而生的數據基礎設施,將材料結構、配方、工藝等關鍵參數編碼化,構建專屬結構化實驗數據庫,解決傳統實驗數據碎片化、非結構化的難題

立即詢價
您提交后,專屬客服將第一時間為您服務