资讯

RTX 4060 跑 35B 模型,每秒 39 Token?伯克利、MIT 联手开源 FreeToken

InfoQ中文·2026/9/5 17:00:00🔗 原文

📋总体概括

伯克利与MIT团队联合开源了推理框架FreeToken,宣称可在消费级显卡RTX 4060上运行35B参数大模型,推理速度达到每秒39个Token。这一结果远超常规预期——4060仅有8GB显存,通常只能运行小参数模型。该项目的意义在于通过算法与系统工程优化,降低大模型本地部署的硬件门槛,让端侧和低成本设备跑大模型成为可能,或对推理成本结构产生冲击。

关键信息

  • 伯克利与MIT团队联合开源大模型推理框架FreeToken
  • RTX 4060(8GB显存)成功运行35B参数大模型
  • 推理速度达每秒39个Token,为消费级显卡跑大模型提供了新路径
  • 项目已开源,主打降低大模型本地部署的硬件门槛

🔥犀利点评

8GB显存跑35B模型,39 token/s这个数字若属实确实炸裂,但关键词是「若属实」。4060显存墙摆在那里,无非是量化、卸载、稀疏激活的老三样极限压榨,本质是拿计算时间换显存空间,实际体验能不能打问号。端侧推理赛道从不缺这种刷屏demo,缺的是能落地的工程细节。开源是真,成色待验,建议先看论文和复现结果再高潮。

本文由本站自动聚合,以下为原始来源:前往 InfoQ中文 阅读全文