研究提出无限参数大模型架构
论文AI 评分 75/100arXiv cs.AI待复核
AI 聚合
本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。
研究人员提出无限参数大语言模型,利用紧凑超网络将运行时数据转化为共享基础网络的低秩调制。该方法通过贝叶斯信念在线更新生成器潜在代码,使前馈权重源自实时数据而非固定存储。该架构在保持存储足迹固定的同时,能编译出无限的有效权重,将运行时知识存入权重而非提示词,以节省上下文窗口并实现跨轮次持久化。
全文梳理
AI 摘要依据下方信源原文自动整理,非原文转载架构设计原理
该研究受混合专家架构启发,提出了无限参数大语言模型。传统模型依赖静态预训练数据,部署后权重冻结,无法从实时交互中学习。新架构采用紧凑超网络,将运行时提供的数据转化为共享基础网络的低秩调制。这意味着模型的前馈权重不再存储在固定的参数库中,而是直接根据实时数据动态生成,从而在保持存储足迹固定的前提下,实现了理论上无限的有效权重编译能力。
动态权重更新
与此前读取一次上下文即冻结的权重生成器不同,该研究在生成器的潜在代码上维护了贝叶斯信念。随着会话的进行,该信念会在线更新,模型的有效权重因此从不断演变的信念中重新推导出来。这种机制使得模型能够持续从用户的实时输入中学习,将用户提供的具体事实或修正信息直接写入权重,而不是仅仅将其作为临时指令放在提示词中。
优势与评估
将运行时提供的知识和行为存储在权重而非提示词中,带来了多项优势。这种方法在计算上实现了摊销,释放了宝贵的上下文窗口空间,使信息能够跨轮次持久存在,并且比上下文学习具有更好的泛化能力。研究团队制定了评估协议,专门针对上下文学习和检索方法进行测试,以验证该架构在处理实时数据时的实际效能。
为什么值得看
提出将实时交互写入模型权重的新架构,突破静态预训练限制。
大模型
信源1 家
关键事实
相关 · 论文
本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。
