动察 Beating AI 快讯,陈天桥旗下全新 AI 项目 Apodex 发布科学 Agent 评测 FrontierChallenge,用 97 个真实科学工作流测试 AI 能不能从头到尾把任务做完。12 个前沿模型参与测试,最好成绩也只有 20.6%。GPT-5.6 Sol + Codex 和 Grok 4.6 + Claude Code 并列第一,各完整通过 20 项。
测试还发现,Agent 经常没做完却说自己做完了。在使用 Claude Code 作为 Agent 框架的 10 组模型测试中,849 次失败任务里有 75.5% 最后仍声称已经完成。另一方面,所有参评系统在电化学和环境科学任务上的平均得分达到 94.9,但没有一个完整通过。
这套评测专门把「大部分做对」和「真正交付完成」分开。榜单比较的也是模型 + Agent 运行框架,不是单独比较裸模型。
官方同时提醒,每个系统每题只有一次运行,小幅分差不能直接理解成稳定的模型排名。
----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考 ----------交流群:https://t.me/dunwangyuanhuiwang