GCSA Agent在CyberGym取得91.3%成績 躋身全球領先AI網絡安全智慧體行列
2026-08-30 22:49:17 大公網 作者:石华
29 日,全球網絡安全聯盟(Global Cybersecurity Alliance,GCSA)宣佈,GCSA Agent在 CyberGym基準測試中取得 91.3% 的成功率,進入CyberGym “Leading Systems Above 90%” 領先系統區間。

CyberGym是由美國加州大學伯克利分校研究團隊開發的大規模真實世界網絡安全評測框架,共收錄1,507個歷史真實漏洞測試實例,覆蓋188個大型軟件項目,旨在評估AI智能體在真實漏洞分析場景中的實際能力。
與主要評估代碼理解、知識問答或靜態分析能力的傳統AI Benchmark不同,CyberGym要求 AI智能體直接面對真實的漏洞代碼環境。
在其核心Level 1測試中,AI Agent僅獲得漏洞描述以及尚未修復的碼庫,需要自主完成程式碼分析、漏洞定位、攻擊路徑推理、PoC構造和執行驗證。只有生成的PoC能夠在漏洞版本中成功觸發目標漏洞、同時無法在修復後的版本中重現,任務才被認定為成功。
因此,CyberGym所衡量的並不僅是AI是否“理解程式碼”,而是AI是否能夠真正完成從安全分析到漏洞重現和驗證的完整過程。

從大模型走向安全智慧體
本次CyberGym測試中,GCSA Agent基於Grok 4.5與Grok 4.6模型運行,最終取得 91.3% 的成功率。
這一結果也反映出AI網絡安全領域正在發生的一項重要變化:決定最終安全能力的,不再只是底層大模型本身。
真實漏洞研究通常需要連續完成漏洞描述理解、大規模程式碼檢索、攻擊面識別、漏洞假設建立、測試輸入生成、程序執行、反饋分析以及PoC反覆迭代等多個環節。
GCSA Agent圍繞這一完整過程構建智慧體化安全工作流。其目標並非簡單地利用大語言模型進行程式碼分析,而是讓 AI 能夠進入真實執行環境,圍繞安全問題自主形成假設、收集執行證據、執行測試,並最終以可重現結果驗證安全發現。
此次 CyberGym 測試,為這一能力提供了一個可量化的外部基準。
面向真實世界的漏洞研究能力
CyberGym的核心價值,在於縮小傳統AI測試與真實網絡安全研究之間的差距。
其評測環境會恢復軟件項目漏洞修復前的程式碼狀態,AI Agent可能需要在包含數千個文件、數百萬行程式碼的大型程式碼庫中自主定位問題,並最終生成能夠真正觸發漏洞的PoC。
更值得關注的是,CyberGym 的進一步研究已經顯示,這種智慧體化安全能力並不侷限於重現已知漏洞。
在開放式漏洞研究實驗中,AI Agent已發現多項此前未知的零日漏洞以及歷史上並未完全修復的安全修補程式,顯示出自主漏洞分析技術向真實漏洞發現能力遷移的潛力。
對 GCSA 而言,這也是更重要的發展方向。Benchmark 成績不是終點。GCSA 的目標,是進一步建立能夠服務真實網絡安全場景的 AI Security Agent,使其逐步參與漏洞發現、分析、驗證乃至後續修復的完整安全生命週期。
構建 AI 原生網絡安全能力
隨着人工智能加速軟體開發,AI 同樣正在改變漏洞研究與網絡攻防的方式。
面對規模越來越大、複雜度越來越高的軟體系統,下一代網絡安全體系將越來越依賴人類安全專家與自主AI智慧體之間的協作。
AI Security Agent有望幫助安全團隊:更早發現具有真實利用價值的軟件漏洞;在大型程式碼庫中自動分析複雜攻擊路徑;自動生成PoC,對漏洞進行執行級驗證;通過真實執行結果降低傳統安全檢測中的誤報;加快漏洞研判、驗證與修復效率;擴展專業安全團隊能夠覆蓋的軟體與系統規模。
GCSA Agent在CyberGym取得91.3%的成績,是GCSA構建 AI 原生網絡安全能力的重要階段性成果。未來,GCSA 將繼續推進自主漏洞分析、AI Security Agent 與智慧化網絡安全技術研究,將前沿人工智慧能力進一步轉化為真實世界中的安全能力,為構建更加安全、可信和具有韌性的數字環境提供技術支援。