AMAZINGINDEX.COM 日报快照
47.8
VOL. 2026.05
2026.05.27
← 返回 2026.05.27 日报
日报快照 · Daily Snapshot
NO. 008

LLM模拟睡眠机制提升推理能力

#ARTICLE HackerNews 2026.05.27
推荐指数 74.0 NO. 008 · 2026.05.27
发布2026/05/26Score145Comments113

研究者发现让大语言模型在推理过程中插入类似睡眠的离线状态,能显著降低累积错误并提升长序列任务表现。这为不增加参数、不扩展上下文的低成本优化提供了新路径。

LLM模拟睡眠机制提升推理能力

这篇论文的巧妙之处在于把神经科学里的睡眠记忆巩固机制直接搬到模型推理流程中,而不是训练阶段。之前大家解决长文本推理错误累积主要靠扩大上下文窗口或者加反思模块,成本高且延迟大。这个方法在推理时周期性冻结部分层、让激活态自发重组,相当于给模型做'系统维护',算力开销增加不到15%。

从工程落地看,这特别适合已经部署的7B-70B模型做热更新,不需要重新训练。如果后续能跟投机解码(speculative decoding)结合,可能把长文档分析、多轮客服这类场景的幻觉率压到可用水平。建议关注作者是否会在Hugging Face放实现,以及能否适配现有的vLLM推理框架。

意见分歧 81 条评论

核心争论:是创新的生物启发机制还是换皮的上下文压缩/注意力压缩技术

jgreid

Isn't this simply context pruning/optimization?

kylemaxwell

From the abstract, it looks like it's actually doing something deeper, updating weights in part of the model?

samsartor

The abstract and method sections only mention updating the SSM state during "sleep" (ie the same vectors that change after each token in stock Mamba) not any of the actual weight matrices. AFAICT this is just another attention compaction paper, with misleading tile? It is not very clearly written

查看原文 →