资讯

“智能vs成本”这道送命题,被MiniMax破解了?

华尔街见闻·2026/8/28 16:01:41🔗 原文

📌 概要

<p style="text-align: left;">8月26日,中国AI大模型龙头企业MiniMax(稀宇科技)发布了其自港股上市以来首份半年报。</p> <p style="text-align: left;">财报显示,MiniMax的收入<strong>同比增长283.1%</strong>,其半年收入已达到2025年全年收入的<strong>1.5倍</strong>;毛利<stro

<p style="text-align: left;">8月26日,中国AI大模型龙头企业MiniMax(稀宇科技)发布了其自港股上市以来首份半年报。</p> <p style="text-align: left;">财报显示,MiniMax的收入<strong>同比增长283.1%</strong>,其半年收入已达到2025年全年收入的<strong>1.5倍</strong>;毛利<strong>同比增长 464.8%</strong>。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/f22a4148-0917-4cdb-b049-28d2fd3fd681.jpeg" title="" /></p> <p style="text-align: left;">财报会上,MiniMax创始人、董事会主席、CEO、CTO闫俊杰透露,8月,MiniMax的ARR破了<strong>8亿美元</strong>,B端收入占比冲到了<strong>80%</strong>,7月的Token消耗量是1月的<strong>20倍</strong>。</p> <p style="text-align: left;">除去数据,吸引我注意的,还有闫俊杰在昨晚的业绩会上说的一句话。他说:<strong>“只有最小化单位智能成本,才有可能最大化智能水平。”</strong></p> <p style="text-align: left;">要知道,过去两年,大模型基本就两条路:要么按照Scaling law堆参数冲智能,代价是成本高;要么是降低效率做普惠,但智能水平总差点意思。</p> <p style="text-align: left;">行业似乎默认这是鱼和熊掌,不可兼得。</p> <p style="text-align: left;"><strong>MiniMax为什么会选择一条与行业“反直觉”的路?这条路究竟能不能走通呢?</strong></p> <h2 style="text-align: left;"><strong>智能与成本,为何难以两全?</strong></h2> <p style="text-align: left;"><strong>Scaling Law</strong>驱动了AI过去几年的叙事:<strong>参数越大,智能越高</strong>。</p> <p style="text-align: left;">遵循着Scaling Law,目前模型的参数已经堆到了2-3T的级别,模型的智能也水涨船高,人人惊呼AGI即将到来。</p> <p style="text-align: left;">在繁荣背后,这个规则也埋下了一颗雷:<strong>当模型进入万亿参数量级,推理成本开始变得不容忽视</strong>。</p> <p style="text-align: left;">英伟达CEO黄仁勋在2026年GTC大会上做出判断:<strong>“训练支出作为主要成本驱动因素的时代已经结束了。推理才是现在的工作负载,而且它正在快速扩张。”</strong></p> <p style="text-align: left;">推理成本的膨胀,加上Agent工作负载的崛起,AI正在从一问一答走向多步骤自主执行。单次用户请求背后可能是十几次甚至几十次模型调用,这让整个行业的算力账单以指数级速度攀升。</p> <p style="text-align: left;">结果,行业逐渐分成了两派:</p> <p style="text-align: left;"><strong>一边是速度快、成本低,但智能表现中规中矩的小模型。</strong></p> <p style="text-align: left;">谷歌就是这条路的典型代表。2026年7月到8月,谷歌一口气推出了Gemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber三款轻量化模型。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/bdb7bffa-e285-4102-952c-f58020f3fe8e.jpeg" title="" /></p> <p style="text-align: left;">3.5 Flash-Lite是3.5系列中速度最快、成本最低的模型,专为高吞吐量工作负载和大型AI代理系统中的较小任务而设计。Gemini 3.6 Flash的输出Token使用量比前代减少了17%。</p> <p style="text-align: left;">但代价也很明显。谷歌至今仍未推出旗舰模型Gemini 3.5 Pro,这款原定于5月I/O大会上发布的产品,至今都没有见光。</p> <p style="text-align: left;"><strong>另一边是智商在线,但部署贵、成本开始变高的大模型。</strong></p> <p style="text-align: left;">国产大模型厂商正在这条路上狂奔。2026年7月,月之暗面发布Kimi K3,参数规模达到<strong>约2.8万亿</strong>,是目前全球参数量最大的开源模型。</p> <p style="text-align: left;">阿里紧接着推出Qwen3.8 Max,参数量<strong>约2.4万亿</strong>;百度文心5.0同样达到<strong>2.4万亿</strong>参数;DeepSeek V4-Pro参数量为1.6万亿。</p> <p style="text-align: left;">参数规模带来的智能提升肉眼可见。Kimi K3在多项Agent榜单上<strong>超越Claude Fable 5和GPT-5.6 Sol</strong>。Qwen3.8 Max被描述为“参数规模最大、性能最强的开源模型之一”。</p> <p style="text-align: left;">但<strong>成本也水涨船高</strong>。</p> <p style="text-align: left;">Kimi K3的API定价,非缓存输入从每百万Token 6.5元涨到20元,输出从27元涨到100元,分别上涨208%和270%。官方建议采用64张及以上加速卡组成超节点部署。</p> <p style="text-align: left;">发布仅两天后,月之暗面就宣布暂停C端新用户订阅,将全部算力投入保障已有用户。</p> <p style="text-align: left;">智能越前沿,模型参数越大,调用越贵,部署门槛越高,算力越紧缺……这似乎成了一个难以解开的死结。</p> <h2 style="text-align: left;"><strong>MiniMax,不做取舍</strong></h2> <p style="text-align: left;">对于成本和智能二选一的难题,<strong>MiniMax的选择是:我全都要</strong>。</p> <p style="text-align: left;">闫俊杰在财报会上基本把MiniMax的整套逻辑讲清楚了:</p> <p style="text-align: left;"><strong>“算力对每家公司都是有限的。我们希望通过‘Minimize the Inference Cost, Maximize the Intelligence’实现‘Intelligence with Everyone’。这是我们一直坚持的技术路线,也是创业初心。”</strong></p> <p style="text-align: left;">“Minimize the Inference Cost, Maximize the Intelligence”,意思是<strong>“最小化推理成本,最大化智能”</strong>。MiniMax将降低成本和提高智能放在了同一个叙事框架里。</p> <p style="text-align: left;">为什么这两件事可以放在一起说?因为MiniMax对<strong>“推理”</strong>的理解不太一样:</p> <p style="text-align: left;"><strong>第一,推理是制造下一代智能的生产资料。</strong></p> <p style="text-align: left;">过去认为推理是“用模型”,训练是“造模型”。但现在,合成数据、强化学习的Rollout、模型评测和验证、Agent与环境的交互等等这些核心环节,本质上跑的都是推理负载。</p> <p style="text-align: left;">后训练环节在整体训练算力中的占比越来越高。推理已经不是训练结束之后才出现的工作量,而是贯穿训练全过程的消耗。</p> <p style="text-align: left;">所以,推理效率决定的不只是API的定价空间,更决定了下一代模型能训练到什么程度。</p> <p style="text-align: left;"><strong>第二,推理成本优化是智能迭代的必要条件。</strong></p> <p style="text-align: left;">算力有物理上限,模型规模却在持续扩大。如果推理成本降不下来,越往后走成本越会反过来掐住智能提升的脖子。</p> <p style="text-align: left;">在有限的算力预算里,能不能把每一块钱都转化成有效的智能产出,决定了模型迭代能走多远。</p> <p style="text-align: left;"><strong>第三,用最低的单位智能成本,去追求最高的智能水平——这两件事是同一个目标的两面。</strong></p> <p style="text-align: left;">行业过去习惯把“智能优先”和“成本优先”当成两条不同的路线。但推理成本降不下来,再高的智能也落不了地。</p> <p style="text-align: left;">简单理解,MiniMax的思路是把成本优化和智能升级当成同一件事来做。从模型设计的第一天就把推理效率当成核心指标,贯穿整个研发周期。</p> <p style="text-align: left;">用闫俊杰的话说:<strong>“MiniMax追求的不是在智能与成本之间做取舍。追求更高等级的智能是目的,通过持续优化推理成本和效率来实现更高性价比是手段。”</strong></p> <h2 style="text-align: left;"><strong>计算成本降到1/20&nbsp;</strong><strong>MiniMax把“降本提智”</strong><strong>做成了技术闭环</strong></h2> <p style="text-align: left;">MiniMax一直以来就是遵循着这样的初心,建立起了一套技术底座。</p> <p style="text-align: left;">最核心的是其<strong>自研的MSA(稀疏注意力)架构</strong>。简单说,它把百万字长文本的单位Token计算成本压到了传统全注意力机制的<strong>约1/20</strong>,也就是说M3在1M上下文下<strong>每Token计算量只有上代的1/20</strong>。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/06fe53ef-4c71-4170-8c2d-ebfbf90e3246.jpeg" title="" /></p> <p style="text-align: left;">这个突破的关键在于:总参数量决定模型的知识容量上限,但激活参数量决定单Token推理成本。这两者可以解耦:<strong>参数规模扩张,不一定带来推理成本同比例上涨。</strong></p> <p style="text-align: left;">所以M3能在价格不变的前提下把智能水平提上去,M3 Pro能做到约3T参数量级的同时推进强化学习和长程任务训练。</p> <p style="text-align: left;">基础设施层面,MiniMax的ETTR(有效训练时间比例)能做到<strong>97%</strong>,是<strong>国内最早建立规模化、长期稳定算力体系的独立大模型公司之一</strong>。</p> <p style="text-align: left;">通过自主集群、云厂商和TokenFactory合作的组合方式搭建了算力供给网络,<strong>现有及规划算力已经能支撑3T级文本模型和视频模型的持续迭代</strong>。</p> <h2 style="text-align: left;"><strong>结语:</strong><strong>算力不占优&nbsp;</strong><strong>国产模型靠什么追?</strong></h2> <p style="text-align: left;">每每谈到中美大模型的差距,硬件总是绕不开的话题。</p> <p style="text-align: left;">过去大家默认,谁有更先进的芯片制程、更高的算力,谁就能做出更好的模型。按照这个逻辑,中国AI似乎将永远与美国AI保持着几个月到半年的差距。</p> <p style="text-align: left;">难道就只能如此了吗?</p> <p style="text-align: left;">MiniMax给出了一条新路:Minimize the Inference Cost, Maximize the Intelligence。</p> <p style="text-align: left;">降低单位智能的成本,同样也是在推高智能上限。因为今天的后训练、合成数据、强化学习,本质上跑的都是推理负载。推理效率越高,同样算力下能做的实验就越多,智能天花板就越高。</p> <p style="text-align: left;">谁能用更低的成本产出更高的智能,谁就能在有限的算力里跑出更远的边界,进而让更高的智能进入更广泛的生活中。</p> <p style="text-align: left;">这或许是国产大模型参与全球竞争时,最有希望走通的一条路。而MiniMax,已经开始验证了。</p> <p style="text-align: left;"><span style="color: #808080;">本文来源:<a href="https://mp.weixin.qq.com/s?__biz=MzA4MTQ4NjQzMw==&amp;mid=2652809415&amp;idx=1&amp;sn=0e649444f59aca98e2b1f1671bd8c955&amp;chksm=858267b8ed704d44c8620fa90adc4058216dcbccd19de09fa5e7f39906494c3880164542dc7e&amp;scene=0&amp;xtrack=1" rel="noopener" target="_blank">智东西</a></span></p><div style="color: #666; margin-bottom: 15px;">风险提示及免责条款</div> <div> 市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。 </div>