讓AI學會驗證,清華SIGS團隊開源代碼模型獲多項評測第一

2026-09-01 02:40:07 大公網 作者:毛丽娟

寫代碼的AI不少,但能像科學家一樣“先假設、再驗證、錯了就改、改完再驗”的AI,還真不多見。近日,清華大學深圳國際研究生院劉厚德教授、王立博博士後團隊正式開源了一款代碼大模型——VeriLoop Coder-E1(中文名:循證),這款模型專門解決真實軟件工程中的代碼修復問題。它的特別之處在於:不是讓AI悶頭寫代碼、寫錯了再重來,而是給它裝了一套“循證閉環”,每一輪生成的代碼都必須經過測試驗證,通不過就分析原因、修正錯誤,然後再驗證,直到產出可靠代碼。

該模型通過宿主側表層參數高效微調適配器與自驅式閉環智能體運行框架協同,將代碼生成、工具調用、測試反饋、錯誤修正和迴歸控制組織為可持續迭代的閉環,為代碼智能體由程序文本生成向倉庫狀態理解、修改執行與結果驗證演進提供新方案。

圖 1 傳統反覆修改與 VeriLoop 遞歸式自我改進路徑對比

該系統基於循證原理:循證不是用信息為既有結論提供裝飾或支持,而是讓證據能夠挑戰並改變系統當前的認識、行動或未來探究方式。團隊據此改良了遞歸式自我改進機制:系統不是反覆修改自身,而是經證據糾正的方法,改變未來如何發現、判斷和糾正錯誤,並且這一方法仍然允許被新的證據再次推翻。這意味着系統不會僅因“能改變自身”而實現改進,只有當證據開始改變它“未來如何改變自身”時,遞歸式自我改進才真正發生。

在公開軟件工程基準評測中,VeriLoop Coder-E1在驗證軟件工程基準(SWE-bench Verified)得分85.20、專業版軟件工程基準(SWE-bench Pro)得分62.38、終端任務基準(Terminal-Bench 2.0)得分76.40、軟件工程智能體基準(Deep SWE)得分33.63。

截至2026年7月27日,根據Hugging Face平台公開社區榜單收錄的團隊發佈(self-published)評測結果,VeriLoop Coder-E1在32B及以下開源模型中,前三項位列第一,軟件工程智能體基準位列第二;在全部開源模型中,四項分別位列第二、第一、第一和第五。比測對象中包括DeepSeek-V4-Pro、MiniMax-M3、GLM-5.2、Kimi-K3、Qwen3.6-27B等知名大模型版本。

圖 2 VeriLoop Coder-E1 四項軟件工程基準評測結果(截至2026年7月27日)

成果發佈後,第三方社區基於公開權重製作了適用於個人電腦、蘋果芯片設備及本地大模型推理工具的量化版本。截至2026年8月6日,兩項主要社區量化版本下載量分別為16120次和8541次,同期官方模型倉庫下載量為763次。

除代碼智能系統外,團隊還自主研發了面向智能硬件的多模態交互智能體“丸子”,實現將語音、視覺、記憶和性格設計為按需啓動的能力:用户説話時調用語音交互,需要理解周圍環境時開啓視覺,涉及過去信息時檢索或寫入記憶,並根據不同對象和場景加載相應的性格與表達方式。

在該技術方向,實驗室已獲得五項發明專利授權,相關專利形成了從模型底層穩定性、循證閉環推理到通用編程智能體執行控制與多模態交互的完整技術鏈條。