角色离场再回来,AI就换了个人?浙大、港大开源轻量化记忆路由器
新智元 · 人工智能
新智元 2026-09-06 00:03 北京 新智元报道 你以为,AI只要能连续生成一分钟视频,就算解决了「长视频」? 真正的考验,往往发生在主角离开镜头之后。 第一幕,一个穿特定服装的人出现在实验室;第二幕,他离开画面;第三幕再次返回时,模型可能已经给他换了脸、换了衣服,甚至把原本应该回来的物体也一起「忘」了。 原因并不神秘。自回归视频模型通常一段一段生成画面,并用Key-Value(KV)缓存保存上下文。为了把计算量控制住,缓存往往优先保留最近片段。短期动作是连上了,但更早的身份、属性和场景线索也可能被挤出去。 近日,浙江大学与香港大学团队提出 LayerRecall :不把整段历史一股脑塞回模型,而是同时回答两个问题—— 现在该想起什么?这段记忆又该在哪些层里使用? 论文地址: https://arxiv.org/abs/2608.28460 项目主页: https://yixuan-ding-zju.github.io/LayerRecall_Web/ GitHub: https://github.com/Yixuan-Ding-ZJU/LayerRecall 模型权重: https://huggingface.co/Yixuan-Ding-ZJU/LayerRecall LayerRecall让模型不仅会从历史中找回相关记忆,还知道应该把记忆送进哪些视频DiT层。 图1 | 论文选取的远期重现对比案例。白色虚线框标出第三镜头需要但未能成功恢复的主体、属性或场景物体;该图是定性对比,不代表全部测试案例的总体胜率(对应论文Fig. 1)。 先看结果:论文表中两个记忆评测Overall第一,基础质量没有被换掉 论文设计了100个未参与训练的三镜头prompt,专门测试主体、颜色、位置和场景四类长时记忆压力,每类25个案例,并与13个长视频生成或记忆增强基线进行比较。 表1|100个评测prompt上的主结果。粗体和下划线分别代表论文表中最好与第二好成绩(对应论文Table 1)。 图2|LayerRecall在多组「出现—离场—返回」三镜头任务中的生成结果,覆盖主体身份、颜色属性、关键物体与场景布局的远期召回(对应论文Fig. 5)。 在这套评测协议和所比较方法中,LayerRecall的MemoBench Overall达到 0.548 ,高于最佳基线MemFlow的0.531;MovieBench Overall达到 0.578 ,高于最佳基线Rolling Forcing的0.548。 与此同时,LayerRecall的VBench-Long平均分为 0.978 ,与LongLive-2.0骨干持平。它不是VBench-Long全表第一,但至少在论文报告的设置里,长程召回能力的提升没有以降低自身骨干的这项平均表现为代价。 额外路由也不是「零成本」。匹配H100设置下,端到端生成时间从305.9秒增加到309.4秒,增量约3.5秒;解码帧吞吐从5.22 FPS变为5.16 FPS。 一句话概括:LayerRecall追求的不是让模型回看更多,而是让它 更有选择地回忆 。 反直觉发现:记忆不是越多越好,更不能每层都塞 很多人第一反应是:既然模型会忘,那就扩大缓存,或者让每一层都读取远期历史。 但视频DiT内部并不是整齐划一的「同一种大脑」。团队对LongLive-2.0逐层分析后发现,有些层更依赖当前与近期画面,负责维持姿态、运动和局部连续性;另一些层才会对远期历史投入更多注意力。 图3|LongLive-2.0不同DiT层分配给历史记忆的注意力占比并不相同,红框标出论文最终采用的记忆敏感层(对应论文Fig. 2)。 类似的层间差异也出现在论文测试的LongLive和Self-Forcing骨干中,但峰值位置并不完全相同。这意味着「哪一层需要长时记忆」与具体骨干有关,不能把同一组层位置当成所有视频模型的通用答案。 更关键的是,如果把历史K/V注入所有层,远期线索可能反过来打乱当前运动。论文的All-Layer Routing对照正说明了这一点:模型有了更多历史,却更容易出现突变和时间抖动。 LayerRecall的两把钥匙 找对记忆,用对层 LayerRecall把长视频记忆拆成两条路线。 第一把钥匙:What to Retrieve,决定现在该想起什么。 系统为历史chunk建立紧凑摘要。当前画面到来后,路由器读取当前隐藏状态,形成随生成内容变化的查询,再从历史候选中找出最相关的记录。 这里有个技术细节很重要: 摘要只负责检索打分,真正送入注意力计算的仍是被选中chunk的完整K/V。 换句话说,它用小索引找资料,却不会只把「内容摘要」交给生成模型。 第二把钥匙:Where to Use,决定记忆送进哪些层。 被选中