开源框架Colibrì实现无GPU本地跑744B模型
工具AI 评分 78/100量子位待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
开源分层推理框架Colibrì在GitHub获32k Star,通过将MoE模型权重按需从SSD加载至RAM/VRAM,实现无GPU运行744B参数的GLM-5.2。经int4量化后,其17B常驻部分仅占9.9GB内存,最低16GB RAM即可运行。框架利用LRU缓存、专家使用频率统计及71.6%准确率的下一层专家预读,缓解SSD读取延迟,并支持双SSD并行分摊带宽。目前已覆盖9个模型家族,包括2.8T的Kimi K3,后者仅需32GB RAM及1.6TB硬盘。
为什么值得看
突破消费级硬件运行千亿参数MoE模型的内存瓶颈,为无GPU本地部署超大模型提供可行方案。
量化MoEGPU
信源1 家
关键事实
相关 · 工具
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
