AI科研重現率僅13.98%,吉利智充把大模型裝進補能網路
最近更新 · 2026-10-09 10:04 · 2 條來源
AI 正在兩條戰線上同時接受檢驗。一條在科研端:PaperBenchX 用 93 個真實論文重現任務衡量模型能否重跑科學工作流程;另一條在產業端:吉利把能源大模型裝進補能網路,試圖讓快充、溫控和電池管理變成可驗證的系統能力。兩條線索的共同點是,AI 的價值不再只是給出答案,而是能否可靠地跑通流程並對結果負責。[1][2]
論文重現成為AI科研試金石
UniPat AI 發布 PaperBenchX,從 93 篇研究論文建構 93 個重現任務,橫跨電磁、光子、化學、材料、生物、機器人等 12 個研究方向和 10 種領域原生科學環境,含 3168 條專家校驗的評分項,是國際上第一個多學科端到端論文結果重現的基準測試。Agent 拿到一篇真實論文、一個裝好對應科學軟體的容器化環境,以及一份說明要重現哪部分任務書。系統會在交卷後刪掉全部輸出、斷開網路,在隔離環境裡把工作流程從頭重跑一遍,評分器只相信重放產物。它考的不是猜答案,而是重建一條科學上成立的流程。[1]
完整重現率僅13.98%,驗證環節最薄弱
在 93 個論文重現任務裡,表現最強的 GPT-6 Astra 完整重現率只有 13.98%。階段得分顯示,建模和執行平均得分分別為 62.70% 和 61.84%,驗證只有 42.80%。這意味著 Agent 能完成部分建模、呼叫求解器並產生結果檔案,但這些結果不一定正確,也不一定能證明結果真正支持論文結論。軌跡分析還顯示,互動輪數越多,分數不一定越高;長時間執行往往意味著反覆嘗試、故障復原,或者在錯誤的模型設定上繼續計算。Fable 5 將 37.1% 的時間用於論文重建和程式碼實作,反而能以較少互動取得接近最佳的部分得分,說明前期論文理解、科學建模、參數選擇等決策是否合理,很大程度上決定後續計算會不會變成資源浪費。[1]
吉利智充:AI補能同時管速度、溫度和壽命
2026 年 9 月 23 日,吉利汽車集團正式發布新一代 AI 補能技術「吉利智充」,首次實現單槍峰值充電功率達 2250 千瓦,最高充電溫度始終保持在 65℃以內,電池循環壽命提升 20%。依託吉利與階躍星辰聯合開發的星睿 PowerMind 能源大腦,吉利智充建構「人、車、樁、雲、網、儲」一體化協同架構,其 AI 溫控技術可提前 30 秒預判電池內部溫度變化,一旦發現過熱跡象就智慧動態分配功率。吉利還推出全新一代神盾金磚電池超短刀系列,領克 10 搭載的 395 毫米版本最高充電倍率達 12C,370 毫米版本峰值充電倍率提高到 6C,並率先搭載於全新吉利銀河 E5。[2]
補能網路要把峰值功率變成穩定體驗
吉利浩瀚能源已融合極氪、領克、銀河的充電地圖,並向全社會新能源車主開放;截至目前已佈局超 2500 座充電站、超 1.2 萬把充電槍,覆蓋全國 232 個城市,其中超快充站超 1500 座,快充槍超過 7000 把。按規劃,到 2027 年底,吉利計劃建成超 2.2 萬座充電站、超 10 萬把充電槍,其中吉利智充站超 1.5 萬座,智充槍超 5 萬把,率先在全國實現「縣縣通」。這些數字說明,AI 補能不是單點技術,而要靠樁、車、雲、網、儲協同。經中汽中心實測,領克 10 在 SOC 從 10% 到 97% 的極速充過程中,峰值充電功率達 1093 千瓦,57% 時間充電溫度低於 55℃,全程最高溫度僅 64℃;其 AI 極速充功能常溫下 SOC 從 10% 到 70% 平均僅需 4 分 30 秒,從 10% 到 97% 平均僅需 8 分 40 秒。[2]
共同趨勢:AI進入可驗證競賽
PaperBenchX 把重現作為尺子,吉利把補能系統作為考場,二者都在把 AI 從演示推向驗證。科研端需要重新生成的證據,產業端需要溫度、壽命和網路調度等硬指標;只有流程可重跑、結果可核驗,AI 的能力才可能從個別任務擴展到更廣泛的科學與產業場景。後續值得關注的是,多學科端到端重現能否形成可比較的長期評測,以及 AI 補能方案能否在更大規模網路上保持安全、效率與電池健康之間的平衡。[1][2]
來源
- [1] ChatGPT踢到铁板了!能破解千禧数学难题,但论文复现率低至13.98%? · 2026-10-08 17:28 · www.qbitai.com
- [2] 吉利智充技术正式发布,重塑全球补能新标杆 · 2026-10-08 17:10 · www.qbitai.com