中國大模型不斷突破 滬企StartLux 直接逼近DeepSeek-V4-Pro

2026-09-11 18:53:41 大公網 作者:李昌鸿

過去兩年以來,全球AI行業競爭日益激烈,他們不斷把模型做大:更多參數、更大算力、更長上下文,以及不斷刷新的Benchmark成績。但進入2026年,隨着基礎模型能力持續提升,全球AI競爭正在出現新的變量——如何讓模型以更高的訓練效率、更低的邊際成本持續變強,以及如何讓AI本身參與AI的研發過程。

中國AI企業也正在進入這場變化之中以驚人的優勢獲得了認可。最近在工信部中國信息通信研究院可信AI大模型基準測試MCP專項測試中,上海AI公司StartLux最近推出的StartLux-V1.0-27B-Preview綜合排名第二,超過DeepSeek-V4-Flash-0731,與1.6萬億參數的DeepSeek-V4-Pro差距約1個百分點,並在位置導航、瀏覽器自動化、金融分析等Agent任務中取得第一或並列第一的成績。該公司 第一代本地智能解決方案也預計將於年內推出。

StartLux-V1.0-27B-Preview提供了一個頗具代表性的樣本:它沒有繼續沿着單純擴大參數規模的路徑競爭,而是選擇從本地部署、後訓練效率和Agent真實任務能力切入,並進一步嘗試讓AI參與模型自身的研發。

Auto Research:70%實驗研發交給AI

StartLux-V1.0-27B-Preview定位為面向真實任務執行的本地 Agent 模型,"本地"解決它在哪裏運行,"Agent"解決它能不能工作。值得注意的是,市場其實不缺能下載到電腦裏的模型,缺的是能真正替用户工作的本地 AI。StartLux團隊表示,公司真正的壁壘,是讓模型和它工作的整套系統一起進化。

這就不得不提到StartLux的訓練方法。StartLux-V1.0-27B-Preview以Qwen3.6-27B為基座進行後訓練,把模型能力進一步集中到真實任務上,並在訓練過程中引入了AI訓練AI(AI for AI:Auto Research)的方法。這是內地首個採用該方法進行後訓練的本地Agent模型。

StartLux團隊認為Auto ResearchAI是指AI看完上一輪實驗結果以後,能不能自己判斷下一步值得試什麼。如果只是批量生成Synthetic Data,或者自動搜一組超參數,它只能叫自動化,而不是Research。真正的 Auto Research 應該能形成“假設—實驗—驗證—新假設”的閉環。Auto Research與知識蒸餾完全不同,蒸餾更像老師給答案、學生模仿;Auto Research 裏,強模型更像研究員,會設計實驗、出題、看結果、找失敗原因,再決定下一輪怎麼訓練。

例如金融分析,早期模型拿到一個看似合理的數據就容易直接算,但環境反饋會暴露日期、交易日或原始數據不一致的問題。Auto Research 會從這類失敗軌跡裏歸納問題,再補充“回查原始數據—確認目標條件—再計算”的任務和軌跡。它不是 AI 憑空發明一個新算法,而是 AI 自己從失敗裏決定下一輪該補什麼。AI 當然也會跑偏,所以只要出現某一類 Eval 漲了但泛化變差,或者明顯在鑽評分機制的漏洞,StartLux就會人為干預。

據團隊透露,在 StartLux 現有的研發體系中,大約 70% 的實驗研發工作由 AI 完成,包含提出實驗假設、生成或篩選數據、啓動訓練和 Eval、分析失敗軌跡,再根據結果決定下一輪試什麼。人類研究員主要負責最關鍵的那件事:決定研究方向和關鍵取捨。

對於企業和個人而言,本地Agent模型可能帶來兩種根本性的改變:成本與數據主權。當一個能力接近旗艦的Agent能夠在個人電腦上長期運行,企業不再需要為每一次推理向雲端付費、為每一次任務上傳核心數據。對於高頻調用、數據敏感、需要長時間執行的工作流——例如金融分析、代碼倉庫管理、私密文檔處理、長期研究任務——本地Agent意味着數據不出域、Token不受限、任務可以連續運行數小時,而非在雲端逐次計費。StartLux 聯合創始人羅永祥認為本地AI真正值得關注的不是“省下一次調用的錢”,而是當AI從偶爾使用的工具變成持續工作的基礎設施後,成本結構本身會發生變化。他表示:“過去企業使用AI,更像是在購買算力和調用次數;但當Agent開始長時間參與真實工作流,成本就不再只是一次調用多少錢,而是每天、每月、每年持續運行的總成本。本地部署的意義,是把一部分持續性的AI使用成本,從按調用付費,變成一次部署、長期運行。”

在羅永祥看來,這種變化最終也會體現為企業的成本結構。“如果過去模型能力的競爭,本質上是算力、數據和人才的投入競爭,那麼下一階段比拼的可能是誰能用同樣的人和算力,完成更多有效實驗。Auto Research的價值不只是讓實驗跑得更快,而是把研發資源從重複性的執行工作中釋放出。”

StartLux,中國AI的RSI先行者

Auto Research指向的正是RSI(Recursive Self-Improvement,遞歸式自我改進)這個當前全球AI研發的前沿—— AI 更深地參與自身研發與改進,並最終讓更強的 AI 參與創造下一代更強的 AI。

近期,RSI正匯聚全球頂級AI機構的核心注意力。過去一年,OpenAI、Anthropic等頭部實驗室都開始把AI從代碼助手進一步帶入模型研發本身:從編寫訓練代碼、生成數據,到運行實驗、分析Eval,再到探索由AI提出研究假設、決定下一輪實驗。OpenAI近期披露,其內部已經開始形成類似“自動化研究實習生”的AI工作體系:截至2026年8月,其研究組織中,每1個人類研究日對應約3.1個AI Agent工作日,AI Agent已經能夠承擔代碼編寫、實驗運行、結果分析等越來越長的研究任務。Anthropic也披露,Claude已經能夠編寫其公司超過80%的生產代碼,並進一步探索讓AI參與下一代AI系統的研發。讓AI深度參與AI的研發與改進,已成為國際前沿的明確共識。StartLux則將同一路徑落地在27B本地模型上,成為全球範圍內將RSI理念率先融入本地Agent後訓練體系的具體實踐者。

據瞭解,羅永祥曾任摩根士丹利亞洲董事總經理,在資本市場深耕接近30年。他過去的工作是判斷什麼值得投資;這一次,他從30年資本圈的老手,投入到RSI創業的新路上。在他看來,AI正在進入一個新的階段:一端是模型從雲端走向本地,另一端則是AI開始參與AI自身的研發,尤其是RSI,正在打開一個更具想象力的方向——讓 AI 更深地參與自身研發與改進,並最終讓更強的 AI 參與創造下一代更強的 AI。這也是他決定投身AI創業的重要原因之一。

按照規劃,StartLux將通過新模型架構、訓練算法和受控的本地參數更新機制,讓模型逐步具備在本地持續自我更新的能力。目前的StartLux-V1.0-27B-Preview可在消費級個人電腦上運行,團隊正推進模型的備案。第一代本地智能解決方案也預計將於年內推出。