在线策略自蒸馏与做梦模拟或成大模型持续学习新解法
在线策略自蒸馏与做梦模拟或成大模型持续学习新解法
大语言模型在部署后,普遍面临无法持续吸收新知识的难题。目前的优化技术主要集中在扩大上下文窗口和提升查找速度上,这只能让模型在单个对话内临时查找信息,一旦关闭对话框,知识就会被全部忘光。大模型持续学习的真正瓶颈并不在这些查找速度的优化上,而是在于如何将对话里学到的经验,物理性地改写进大模型底层的权重参数里。
在线策略自蒸馏(Online Policy Self-Distillation, OPSD)提供了一条全新的权重更新路径。大模型在面临任务时,其拥有完整长上下文的「教师状态」(Teacher State)会生成高质量的解答。随后,系统在云端通过反向传播(Backpropagation),计算基础状态(学生,Student)与教师状态在 Token 级别的概率差异来提供稠密的监督信号,让基础模型去逼近那个拿了高分的聪明状态。
相比于强行让模型死记硬背所有对话文字的监督微调(Supervised Fine-Tuning, SFT),自蒸馏仅提取维持性能所必需的决策经验。这种极度稀疏的参数更新能够避免灾难性遗忘(Catastrophic Forgetting),保护大模型原有的通用常识不被覆盖。
另一条更具前瞻性的学习路径是做梦模拟(Dreaming)。当大模型面对复杂任务时,会消耗巨大的推理期算力在脑海中自我博弈。模型会根据日常观察到的规律,自动构建一个虚拟的模拟器环境(Simulator),并在模拟器环境中进行上万次任务演练。如果演练成功,系统就会把成功的轨迹记录下来作为教材,更新基础模型的底层权重。相比于仅生成简短摘要的轻量压缩,做梦模拟会消耗巨大算力在云端反复预演,属于大模型扩展的第四个维度。
预计 2027 至 2028 年,AI 代理在与人类协同工作一周后将接受工作评估。一旦获得认可,系统便能在云端通过在线策略自蒸馏(OPSD)或做梦模拟,将当周积累的实战经验蒸馏内化至模型的底层权重中,实现部署后能力的在线扩张,让大模型越用越聪明。
信源:https://www.youtube.com/watch?v=20p5-kQXF_Q