资讯

RTX 4060 跑 35B 模型,每秒 39 Token?伯克利、MIT 联手开源 FreeToken

InfoQ中文·2026/9/5 17:00:00🔗 原文

📋总体概括

伯克利与MIT团队联合开源推理框架FreeToken,宣称可在消费级显卡RTX 4060上运行350亿参数大模型,并实现每秒约39个Token的生成速度。该成果瞄准显存受限场景下的本地大模型部署,通过优化推理流程降低对高端GPU的依赖,若实际表现属实,将显著降低个人开发者和中小企业运行大模型的硬件门槛,具备开源社区推广价值。

关键信息

  • 伯克利与MIT联合开发并开源推理框架FreeToken
  • 在RTX 4060消费级显卡上运行35B参数大模型
  • 实测生成速度达每秒39个Token
  • 核心价值在于突破显存限制,降低本地部署大模型的硬件成本

🔥犀利点评

35B模型跑在4060这种8GB显存的卡上还敢报39 token/s,要么是量化到面目全非,要么是稀疏/投机解码换了套算法,反正免费午餐必有代价——大概率牺牲了精度或上下文长度。真正该看的不是峰值数字,而是开源后社区在真实任务上的复现结果。若性能兑现,这会是对GPU厂商卖显存生意的一次漂亮打脸。

本文由本站自动聚合,以下为原始来源:前往 InfoQ中文 阅读全文