AI 圈大事记

开源框架Colibrì实现无GPU本地跑744B模型

工具AI 评分 78/100量子位待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

开源分层推理框架Colibrì在GitHub获32k Star,通过将MoE模型权重按需从SSD加载至RAM/VRAM,实现无GPU运行744B参数的GLM-5.2。经int4量化后,其17B常驻部分仅占9.9GB内存,最低16GB RAM即可运行。框架利用LRU缓存、专家使用频率统计及71.6%准确率的下一层专家预读,缓解SSD读取延迟,并支持双SSD并行分摊带宽。目前已覆盖9个模型家族,包括2.8T的Kimi K3,后者仅需32GB RAM及1.6TB硬盘。

为什么值得看

突破消费级硬件运行千亿参数MoE模型的内存瓶颈,为无GPU本地部署超大模型提供可行方案。

量化MoEGPU

信源1 家

  1. [1]量子位笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub

关键事实

  • Colibrì框架在GitHub获得32k Star,支持无GPU运行744B参数的GLM-5.2。[1]

  • GLM-5.2经int4处理后常驻RAM部分约9.9GB,最低16GB RAM即可运行。[1]

  • 框架利用LRU缓存、专家频率统计与71.6%准确率的跨层预读优化SSD读取。[1]

  • 目前已支持9个模型家族,2.8T参数的Kimi K3需32GB RAM和1.6TB硬盘。[1]

相关 · 工具

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。