资讯
这个周末“首波测评”:OpenAI的GPT-6 Astra “几乎在所有方面”都表现“惊人的出色”
📋总体概括
OpenAI于9月3日发布GPT-6 Astra,48小时内早期测试者将其变成公开压力测试。结果显示明显分化:Astra在空间理解、机械操作与自主代理任务上为迄今最强,如逐街重建曼哈顿、24分钟重建杭州全城、一天完成12人联机射击游戏;但写作能力较前代退步,独立机构记录其在44种职业的GDPval-AA v2基准上下滑约80个Elo分。定价为每百万输入10美元、输出50美元,是GPT-5.6 Sol的2.5倍。OpenAI总裁宣称AGI时代到来,模型已通过ChatGPT各档位、API及微软Azure、AWS Bedrock渠道推出。
⚡关键信息
- ▸GPT-6 Astra于9月3日发布,48小时内经早期测试者公开压力测试,表现呈两极分化
- ▸空间与代理能力突出:逐街重建曼哈顿、24分钟重建杭州全城、一天内完成12人联机浏览器射击游戏
- ▸写作能力退步:在涵盖44种职业的GDPval-AA v2基准上下滑约80个Elo分,多名测试者明确批评
- ▸定价每百万输入token 10美元、输出50美元,为前代GPT-5.6 Sol的2.5倍
- ▸模型已向ChatGPT Plus/Pro/Business/Enterprise用户及API、Azure、AWS Bedrock渠道推出
🔥犀利点评
Astra是一次典型的「偏科式」升级:把算力押在空间重建和自主代理这些最能讲故事的场景上,写作却开倒车,还敢涨价2.5倍。Brockman急吼吼宣布AGI到来,更像为定价和融资造势——写作退步说明通用能力并未全面跃迁,所谓AGI仍是营销话术。真正的看点是代理任务能否撑起企业级付费,而不是玩家做出的炫技Demo。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文 →