标准测试环节,强力这些题目数十年来困住无数顶尖数学家。新模型也是强力OpenAI首次大规模使用前代模型参与监督训练的旗舰产品。条件完全公平。新模型对齐效果最优的强力生成式AI模型。解出一道重要开放问题的期望成本约为1万美元。其中就包括Erdős18岁提出、即便OpenAI宣布“AGI时代到来了”,
测试选用全部没有标准答案的开放难题,
在包含68道人类悬而未决的Erdős数学难题的严苛测试中,68道难题依旧有63道没被解开,以及极值图论赫赫有名的Erdős-Sós猜想,
五道成果里,要求AI输出Lean形式化证明,GPT-6一天攻破5道至今未解数学难题" />
那么它的能力有多强?
Epoch AI联合曼彻斯特大学发布 FrontierMath Erdős(FME)基准测试论文,3%成功率计算,放宽算力预算的追加实验中又攻克3道,模型有可能想出正确思路,
GPT-6 Astra完成五道题全部尝试合计消耗超22万美元算力,GPT-6 Astra成功解决2道题目,其余GPT-5.6、按300美元一次、
其训练工作在美国德州Stargate超算基地完成,GPT-6 Astra 成为全场唯一交出有效答卷的大模型。
不过也有论文指出,
OpenAI正式推出品牌史上能力最强大模型GPT-6 Astra,
而标准基准测试本身只花了约2万美元,Claude Fable 5.1等四款主流AI全部得0分。












.jpg)










