AI科研复现率仅13.98%,吉利智充把大模型装进补能网络
最近更新 · 2026-10-09 10:04 · 2 条来源
AI 正在两条战线上同时接受检验。一条在科研端:PaperBenchX 用 93 个真实论文复现任务衡量模型能否重跑科学工作流;另一条在产业端:吉利把能源大模型装进补能网络,试图让快充、温控和电池管理变成可验证的系统能力。两条线索的共同点是,AI 的价值不再只是给出答案,而是能否可靠地跑通流程并对结果负责。[1][2]
论文复现成为AI科研试金石
UniPat AI 发布 PaperBenchX,从 93 篇研究论文中构建 93 个复现任务,横跨电磁、光子、化学、材料、生物、机器人等 12 个研究方向和 10 种领域原生科学环境,含 3168 条专家校验的评分项,是国际上第一个多学科端到端论文结果复现的 Benchmark。Agent 拿到一篇真实论文、一个装好对应科学软件的容器化环境,以及一份说明要复现哪部分的任务书。系统会在交卷后删掉全部输出、断开网络,在隔离环境里把工作流从头重跑一遍,评分器只相信重放产物。它考的不是猜答案,而是重建一条科学上成立的流程。[1]
完整复现率仅13.98%,验证环节最薄弱
在 93 个论文复现任务里,表现最强的 GPT-6 Astra 完整复现率只有 13.98%。阶段得分显示,建模和执行平均得分分别为 62.70% 和 61.84%,验证只有 42.80%。这意味着 Agent 能够完成部分建模、调用求解器并生成结果文件,但这些结果不一定正确,也不一定能证明结果真正支持论文结论。轨迹分析还显示,交互轮数越多,分数不一定越高;长时间运行往往意味着反复尝试、故障恢复,或者在错误的模型设定上继续计算。Fable 5 将 37.1% 的时间用于论文重建和代码实现,反而能以较少交互取得接近最优的部分得分,说明前期论文理解、科学建模、参数选择等决策是否合理,很大程度上决定后续计算会不会变成资源浪费。[1]
吉利智充:AI补能同时管速度、温度和寿命
2026 年 9 月 23 日,吉利汽车集团正式发布新一代 AI 补能技术“吉利智充”,首次实现单枪峰值充电功率达 2250 千瓦,最高充电温度始终保持在 65℃以内,电池循环寿命提升 20%。依托吉利与阶跃星辰联合开发的星睿 PowerMind 能源大脑,吉利智充构建“人、车、桩、云、网、储”一体化协同架构,其 AI 温控技术可提前 30 秒预判电池内部温度变化,一旦发现过热迹象就智能动态分配功率。吉利还推出全新一代神盾金砖电池超短刀系列,领克 10 搭载的 395 毫米版本最高充电倍率达 12C,370 毫米版本峰值充电倍率提高到 6C,并率先搭载于全新吉利银河 E5。[2]
补能网络要把峰值功率变成稳定体验
吉利浩瀚能源已融合极氪、领克、银河的充电地图,并面向全社会新能源车主开放;截至目前已布局超 2500 座充电站、超 1.2 万把充电枪,覆盖全国 232 个城市,其中超快充站超 1500 座,快充枪超过 7000 把。按规划,到 2027 年底,吉利计划建成超 2.2 万座充电站、超 10 万把充电枪,其中吉利智充站超 1.5 万座,智充枪超 5 万把,率先在全国实现“县县通”。这些数字说明,AI 补能不是单点技术,而要靠桩、车、云、网、储协同。经中汽中心实测,领克 10 在 SOC 从 10% 到 97% 的极速充过程中,峰值充电功率达 1093 千瓦,57% 时间充电温度低于 55℃,全程最高温度仅 64℃;其 AI 极速充功能常温下 SOC 从 10% 到 70% 平均仅需 4 分 30 秒,从 10% 到 97% 平均仅需 8 分 40 秒。[2]
共同趋势:AI进入可验证竞赛
PaperBenchX 把复现作为尺子,吉利把补能系统作为考场,二者都在把 AI 从演示推向验证。科研端需要重新生成的证据,产业端需要温度、寿命和网络调度等硬指标;只有流程可重跑、结果可核验,AI 的能力才可能从个别任务扩展到更广泛的科学与产业场景。后续值得关注的是,多学科端到端复现能否形成可比较的长期评测,以及 AI 补能方案能否在更大规模网络上保持安全、效率与电池健康之间的平衡。[1][2]
来源
- [1] ChatGPT踢到铁板了!能破解千禧数学难题,但论文复现率低至13.98%? · 2026-10-08 17:28 · www.qbitai.com
- [2] 吉利智充技术正式发布,重塑全球补能新标杆 · 2026-10-08 17:10 · www.qbitai.com