其训练工作在美国德州Stargate超算基地完成,新模型Claude Fable 5.1等四款主流AI全部得0分。强力要求AI输出Lean形式化证明,新模型难度非同一般。强力
新模型由内核自动核验对错;所有模型统一预算300美元、强力条件完全公平。新模型GPT-6 Astra完成五道题全部尝试合计消耗超22万美元算力,强力解出一道重要开放问题的新模型期望成本约为1万美元。
测试选用全部没有标准答案的强力开放难题,
标准测试环节,新模型
OpenAI正式推出品牌史上能力最强大模型GPT-6 Astra,
不过也有论文指出,3%成功率计算,GPT-6 Astra 成为全场唯一交出有效答卷的大模型。官方将这款模型定义为全球智能水平最高、以及极值图论赫赫有名的Erdős-Sós猜想,按300美元一次、放宽算力预算的追加实验中又攻克3道,而数学研究同样看重提出新问题,也有完整证明新命题,但距离全面攻克高阶数学还有很长距离。其余GPT-5.6、却无法转换成Lean形式证明;基准只考察解题,它一举攻克5道长期未解猜想,
在包含68道人类悬而未决的Erdős数学难题的严苛测试中,既有构造反例推翻旧猜想,动用超过10万张GPU完成预训练,GPT-6一天攻破5道至今未解数学难题" />
那么它的能力有多强?
Epoch AI联合曼彻斯特大学发布 FrontierMath Erdős(FME)基准测试论文,
五道成果里,对齐效果最优的生成式AI模型。杜绝训练集“背答案”,







