资讯
RTX 4060 跑 35B 模型,每秒 39 Token?伯克利、MIT 联手开源 FreeToken
📋总体概括
伯克利与MIT团队联合开源了推理框架FreeToken,宣称可在消费级显卡RTX 4060上运行35B参数大模型,推理速度达到每秒39个Token。这一结果远超常规预期——4060仅有8GB显存,通常只能运行小参数模型。该项目的意义在于通过算法与系统工程优化,降低大模型本地部署的硬件门槛,让端侧和低成本设备跑大模型成为可能,或对推理成本结构产生冲击。
⚡关键信息
- ▸伯克利与MIT团队联合开源大模型推理框架FreeToken
- ▸RTX 4060(8GB显存)成功运行35B参数大模型
- ▸推理速度达每秒39个Token,为消费级显卡跑大模型提供了新路径
- ▸项目已开源,主打降低大模型本地部署的硬件门槛
🔥犀利点评
8GB显存跑35B模型,39 token/s这个数字若属实确实炸裂,但关键词是「若属实」。4060显存墙摆在那里,无非是量化、卸载、稀疏激活的老三样极限压榨,本质是拿计算时间换显存空间,实际体验能不能打问号。端侧推理赛道从不缺这种刷屏demo,缺的是能落地的工程细节。开源是真,成色待验,建议先看论文和复现结果再高潮。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 InfoQ中文 阅读全文 →