OpenAI 称 GPT-6 Astra 为最智能模型,测试者持不同意见
OpenAI 的新 GPT-6 Astra 模型在发布几天内就引发了专家意见的分歧,独立测试者将其在通用推理能力上排在 Anthropic 的 Claude Fable 5.1 之后。
OpenAI 的新 GPT-6 Astra 模型在发布几天内就引发了专家意见的分歧,独立测试者将其在通用推理能力上排在 Anthropic 的 Claude Fable 5.1 之后。
关键点:
GPT-6 Astra 在终端工作和网络安全测试中领先,但在专家级推理基准测试中落后于 Claude Fable 5.1。Artificial Analysis 于 9 月 5 日重建了其智能指数,使 Astra 上升四个百分点,位居 Fable 5.1 之后的第二位。Astra 的收费为每百万输入 token 10 美元,每百万输出 token 50 美元,大约是 xAI 的 Grok 4.6 的 6.7 倍。
GPT-6 Astra 在终端工作和网络安全测试中领先,但在专家级推理基准测试中落后于 Claude Fable 5.1。
Artificial Analysis 于 9 月 5 日重建了其智能指数,使 Astra 上升四个百分点,位居 Fable 5.1 之后的第二位。
Astra 的收费为每百万输入 token 10 美元,每百万输出 token 50 美元,大约是 xAI 的 Grok 4.6 的 6.7 倍。
GPT-6 Astra 基准测试声明
OpenAI 于 9 月 3 日开始推出 Astra,首先面向一小部分合作伙伴组织,然后在一天后面向付费 ChatGPT 订阅者。
该公司称其为世界上最智能且最符合人类价值观的模型。其自身的发布表格支持该声明的部分内容,但并非全部。
Astra 在 Terminal-Bench 4.0(一项软件工程和工作系统配置测试)中得分为 57.7%,而 Claude Fable 5.1 为 55.8%,Google 的 Gemini 3.8 Flash 为 19.1%。它还在 ExploitBench(一项网络安全衡量标准)中达到 100%,而之前的 OpenAI 旗舰模型达到 78.5%。
其他项目的表现则截然不同。在带有工具的 Humanity's Last Exam(一组专家级问题)中,Astra 的得分为 57.2%,而 Fable 5.1 为 65%,Claude Opus 5 为 63.6%。OpenAI 指出,其公布的数字反映的是最大努力设置,而非大多数订阅者在产品中遇到的默认设置。