资讯
基元律动发布模型NeoHorse,探索Harness驱动的RSI路径
📋总体概括
基元律动(TokenRhythm)联合无问芯穹、清华、北大、阿里等机构发布首个Agent-Native模型NeoHorse-1,含4B和9B两个版本。公司由前华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创办,此前开源了Routing Harness系统OpenSquilla。NeoHorse以Harness产生的Agent执行轨迹(含路由选择、工具调用、环境反馈)为核心语料,结合在策略蒸馏进行后训练。在11项基准评测中,NeoHorse 4B在4B级模型中未加权平均分最高,并在五项基准上超过Qwen3.5-9B底座,被视为递归自我改进(RSI)的单轮工程验证。
⚡关键信息
- ▸基元律动联合无问芯穹、清华、北大、阿里等发布首个Agent-Native模型NeoHorse-1,含4B和9B两版
- ▸训练语料以Routing Harness(OpenSquilla)产生的执行轨迹为核心,保留工具调用、环境反馈等完整链路
- ▸团队用路由信号估计任务能力并安排训练顺序,结合Agent执行监督与在策略蒸馏更新模型
- ▸11项基准评测中NeoHorse 4B未加权平均分为4B级最高,五项基准超过Qwen3.5-9B底座
- ▸改善集中在反馈可观察、结果可验证的任务,复杂状态维护和长程调试仍是大模型优势
🔥犀利点评
把Agent执行轨迹喂回模型训练,本质是把外挂的Harness能力内化成权重,思路成立且有数据背书——4B打9B底座证明小模型吃对了数据确实能越级。但要说这是RSI还为时过早:评测暴露的改善局限于反馈清晰、结果可验证的任务,复杂长程场景大模型依旧碾压,说明所谓的自我改进边界很窄。真正的递归飞轮得看这轮产出能否显著提升下一轮轨迹质量,目前只是一次漂亮的单轮蒸馏,离自我进化还差几个量级。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 雷峰网 阅读全文 →