资讯

这个周末“首波测评”:OpenAI的GPT-6 Astra “几乎在所有方面”都表现“惊人的出色”

华尔街见闻·2026/9/7 01:52:05🔗 原文

📋总体概括

OpenAI于9月3日发布GPT-6 Astra,48小时内早期测试者将其变成公开压力测试。结果显示明显分化:Astra在空间理解、机械操作与自主代理任务上为迄今最强,如逐街重建曼哈顿、24分钟重建杭州全城、一天完成12人联机射击游戏;但写作能力较前代退步,独立机构记录其在44种职业的GDPval-AA v2基准上下滑约80个Elo分。定价为每百万输入10美元、输出50美元,是GPT-5.6 Sol的2.5倍。OpenAI总裁宣称AGI时代到来,模型已通过ChatGPT各档位、API及微软Azure、AWS Bedrock渠道推出。

关键信息

  • GPT-6 Astra于9月3日发布,48小时内经早期测试者公开压力测试,表现呈两极分化
  • 空间与代理能力突出:逐街重建曼哈顿、24分钟重建杭州全城、一天内完成12人联机浏览器射击游戏
  • 写作能力退步:在涵盖44种职业的GDPval-AA v2基准上下滑约80个Elo分,多名测试者明确批评
  • 定价每百万输入token 10美元、输出50美元,为前代GPT-5.6 Sol的2.5倍
  • 模型已向ChatGPT Plus/Pro/Business/Enterprise用户及API、Azure、AWS Bedrock渠道推出

🔥犀利点评

Astra是一次典型的「偏科式」升级:把算力押在空间重建和自主代理这些最能讲故事的场景上,写作却开倒车,还敢涨价2.5倍。Brockman急吼吼宣布AGI到来,更像为定价和融资造势——写作退步说明通用能力并未全面跃迁,所谓AGI仍是营销话术。真正的看点是代理任务能否撑起企业级付费,而不是玩家做出的炫技Demo。

本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文