产业链技术市场评论分析· 4443· 约8分钟阅读

GPT-6踩刹车,Agent踩油门

A
AI编辑团队AI 原创内容
2026-09-08 03:26 发布· 本文由作者与AI协作完成
本内容由人工智能生成,仅供研究参考,不构成投资建议。
💡

一周之内,OpenAI一边宣布AGI可能已经开始、一边暂停前沿强化学习训练;腾讯、百度、字节的Agent集体杀入金融机构桌面;国产RISC-V CPU灵睿智芯P100三个月流片。三件事拼出同一条新叙事:AI的价值实现点,正从训练侧转向落地侧,算力结构随之重构。

一边是GPT-6 Astra发布会上「AGI可能已经开始」的豪言,一边是OpenAI主动暂停前沿强化学习训练的急刹车。同一周,腾讯的Agent开进银行券商保险的桌面,上海张江一家成立不到两年的芯片公司用三个月流片了服务器级CPU内核。这不是巧合。AI行业的故事正在换轴:从「谁的模型更强」,转向「谁能把模型装进别人的业务流程,以及用什么算力去跑」。

🏦 大厂Agent杀进金融,抢的是工位

金融人的桌面,正在变成大厂的新战场。

9月3日,腾讯正式推出WorkBuddy金融版,面向银行、券商、保险等机构上线80多个金融专家及专家团。覆盖的场景相当具体:对公信贷尽调、基金研究、保险代理人的客户经营。腾讯想做的,不是又一个聊天框,而是让Agent真正进入金融机构的业务流程。

这波动作是密集的。不到一个月前,百度刚给通用智能体GenFlow启用中文名库库AI,上线独立办公端,并选择金融作为从通用办公走向专业办公的第一个重点场景。更早,字节旗下扣子已经引入华泰证券广发证券国信证券等机构的金融Agent和Skill,把行情、财务数据、ETF筛选、基金对比这些能力直接搬进Agent平台。以广发证券为例,其提供的8项Skill覆盖财务对比、龙虎榜等投研场景。

大厂盯上金融,逻辑很直白。投行、投研、信贷、保险这些业务里,大量高成本的专业时间被消耗在查数据、翻公告、核口径、更新模型和做材料上。这些活枯燥、重复、但专业门槛高——只要Agent能接手一部分,就能直接转化为金融机构愿意付费的效率。

不过,三家瞄准的并不是同一块市场。据多位接近大厂Agent团队的人士观察,扣子库库AI目前的落点仍偏向C端,把专业金融能力装进Agent直接服务个人投资者;WorkBuddy金融版则明显押注B端机构,切入的是信贷员、研究员、保险代理人的日常工作流。一张简表能看清三家的牌面:

公司产品主攻客群切入方式
字节扣子偏C端券商机构Skill上架技能商店
百度库库AI通用转专业独立办公端,金融做首个专业场景
腾讯WorkBuddy金融版B端机构80多个金融专家直接进业务流程

但金融也是一块难啃的骨头。数据准确度、结论可溯源、执行权限,每一项都要经得起监管与审计的考验。一个在开放网络上表现不错的通用Agent,进入金融业务现场后未必依然可靠。这也解释了为什么至今大厂之间对「金融是否值得单独做一个Agent版本」仍未形成共识——腾讯赌值得,字节百度还在用通用产品试水。

⚠️ GPT-6的悖论:宣布AGI,同时踩刹车

OpenAI等到了一个可以宣布「AGI时代已经开始」的时刻。

9月3日,OpenAI正式发布GPT-6 Astra。发布会媒体简报上,总裁Greg Brockman说,如果几年后回看AGI究竟诞生于什么时候,「我认为可能就是现在,也可能就是这个模型」。这是一个足够激进的判断。按照官方数据,Astra在FrontierMath Tier 4得分97.6%,ARC-AGI-3最高得分99.9%,测试模型利用已知漏洞开发攻击代码的ExploitBench得分100%。

但把数字拆开看,Astra并没有在所有维度建立绝对优势。在OpenAI自己引用的Artificial Analysis综合智能指数中,Astra得分61.2,低于Anthropic旗下Claude Fable 5.1的65.7和Claude Opus 5的63.1;部分代码评测中,两者互有胜负。

更值得注意的是ARC Prize公布的细节:Astra用标准测试框架得分62.7%,测试成本约2.61万美元;换用OpenAI的Provider Adapter框架后,最高得分才冲到99.9%,成本约1.88万美元。后者的关键是能在多次调用之间保留隐藏推理状态,并通过压缩机制复用探索结果。换句话说,漂亮分数背后是大量工程化的测试成本——这本身就是对「AGI已经到来」叙事的一种冷静注脚。

评测项GPT-6 Astra参照
FrontierMath Tier 497.6%新高水平
ARC-AGI-3(标准框架)62.7%成本约2.61万美元
ARC-AGI-3(Provider Adapter)99.9%成本约1.88万美元
ExploitBench100%
Artificial Analysis综合指数61.2Claude Fable 5.1为65.7

真正的信号藏在发布之前。Astra发布前,OpenAI曾暂停两周前沿模型的强化学习训练,用于加固研究环境、补充监控和对齐评测;截至发布时,其规模最大的前沿强化学习训练仍处于暂停状态。原因说得很直白:模型的能力,正在逼近现有安全系统所能承受的边界。

一边宣布AGI已经到来,一边主动踩下刹车。这才是GPT-6发布背后最重要的信号——前沿竞争的评分项,正在从单纯的能力榜单,扩展到安全工程与成本控制。模型继续变强,已经不再是一件只有收益、没有代价的事情。

🔧 被GPU盖了一年的CPU,借Agent翻盘

当大模型在台上讲AGI,台下有一家芯片公司在讲另一个版本的算力故事。

成立近两年的中国芯片初创企业灵睿智芯,近日推出自主研发的服务器级RISC-V CPU内核P100。这是国内首个实现商用化的动态SMT4服务器级CPU内核——单个内核支持1至4线程动态调整,可根据负载实时切换。规格上也不含糊:超过20级深度乱序超标量流水线,取指和译码宽度均为8位,单周期可发出8条指令、执行10条指令,集成TAGE分支预测器与企业级RAS设计,支持错误检测、隔离及内核恢复。

节奏才是最大看点。COO徐越透露,基于P100的测试芯片已于8月中下旬在大陆先进工艺线上流片——从4月项目启动到流片仅用三个月,比行业平均速度快近40%。团队每人每月千元AI预算用于代码生成与验证,研发效率被AI工具链大幅拉升。

为什么是CPU?灵睿智芯的判断是:AI正从生成式推理迈向智能体时代。任务分解、工具调用与多智能体协作,均属控制流密集型任务,CPU成为主导。翻译一下:Agent每调一次工具、每做一次流程分支判断,撑起这些「调度」的恰恰是CPU,而不只是跑矩阵乘法的GPU。

资本已经用真金白银投票。灵睿智芯成立于2025年1月,总部位于上海张江,主力团队拥有10年以上IBM等大厂高端服务器处理器开发经验,已获近亿元天使轮和数亿元Pre-A轮融资,壁仞科技张江高科等十家机构参与。其中壁仞科技参与投资之外,双方还在共同优化CPU+GPU算力分配与管理方式——在GPU公司眼里,CPU不再是配角,而是Agent时代的另一半算力。

RISC-V服务器CPU也因此成为信创新选项。如果Agent时代真的到来,算力叙事将第一次从「GPU一家独大」走向「CPU与GPU按任务分工」——这是过去一年被算力洪流掩盖、如今正在浮出水面的结构性变化。

📉 三件事,拼出同一条新叙事

把三件事放在一起看,指向的是同一个转折:AI的价值实现点,正在从训练侧转向应用侧和执行侧。

第一层证据是钱往哪流。大厂Agent集体下沉金融,赌的是金融机构愿意为「接手专业时间」付费——这是继C端订阅之后,第一个被行业公认可能跑通规模化收入的B端场景。第二层证据是成本的显性化。GPT-6的一次ARC评测要花掉近两万美元,OpenAI甚至愿意为安全暂停最强的训练任务——当能力逼近边界,边际收益递减、边际代价上升,行业必须算账了。第三层证据是算力结构的松动。Agent时代控制流密集型任务占比上升,CPU重新拿到牌桌入场券,壁仞科技这样的GPU公司主动联手CPU初创,本身就说明纯GPU叙事不够用了。

一条新链路已经清晰:

对产业里的人来说,这意味着评估标准要换一套。看模型,不能只看榜单第一行,要看标准框架下的真实得分和单次成本;看Agent,不能只看演示Demo,要看它能否通过金融级的准确度、可溯源和权限考验;看算力,不能只看GPU出货,要看CPU+GPU协同调度是否成为Agent基础设施的标配。

据多位接近金融机构科技部门的人士反馈,机构方最关心的从来不是模型多聪明,而是错了谁负责、数据从哪来、权限谁来管。这三问,将决定Agent在严肃行业的渗透速度,比任何发布会都更有话语权。

小结

刹车和油门,从来不矛盾。OpenAI踩刹车,是因为能力逼近安全边界;大厂Agent踩油门,是因为商业化窗口已经打开;灵睿智芯的三个月流片,则提醒所有人——当任务结构改变,算力分工也会改变。2026年下半年,比「谁的模型更强」更值得盯的,是谁先在金融这类严肃行业跑通付费闭环,以及CPU能否在Agent时代重估自己的位置。AI的故事,正从实验室的榜单,搬进写字楼里那张真实的工作桌面。