当前位置: 主页 > 分析 >   正文

上海交大等机构打造的首个记忆基础模型,让AI告别"金鱼式遗忘"

导读:上海交大等机构打造的首个记忆基础模型,让AI告别"金鱼式遗忘"

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:科技行者)

这项由MemTensor(上海)科技有限公司、人民大学、新加坡国立大学、上海交通大学和同济大学联合开展的研究,于2026年7月以预印本形式发布,论文编号为arXiv:2607.26760v1,标题为《Metis: Memory Foundation Model》。感兴趣的读者可通过该编号在arXiv平台查阅完整原文。

你有没有遇到过这样的烦恼:和AI助手聊了很久,它帮你分析了你的生活习惯、记住了你的偏好,结果第二天一开新对话,它就完全"忘记"了一切,你得从头再解释一遍?这种体验,就好像你雇了一个每天早上都会失忆的助手——无论昨天你们建立了多深的默契,今天一切归零。这不是你的错觉,这是当前几乎所有AI系统的共同缺陷。

来自上述五所机构的研究团队决定从根本上解决这个问题。他们提出了一个全新的概念——"记忆基础模型"(Memory Foundation Model),并给出了第一个具体的原型系统,命名为Metis。这项研究的核心思路是:与其让AI靠一个外挂的"笔记本"来记东西,不如让记忆能力直接长在AI的"大脑"里。

一、AI的记忆之殇:外挂式记忆的三大硬伤

要理解这项研究的意义,先得弄清楚现有AI是怎么"记事"的。

现在最常见的方案叫做"检索增强生成",简称RAG,你可以把它理解成给AI配了一个外置的档案柜。每次AI需要回忆什么,就派一个小助手跑去档案柜里翻文件,找到相关的几页,然后塞进AI当前的输入框里让它读。表面上看,AI好像"记住"了以前的事,但实际上它每次都在现场重新阅读,而不是真正地记住了什么。

这个档案柜方案有三个让研究团队难以接受的根本缺陷。第一个问题是"分家"。档案柜和AI的大脑是分开的两套系统,它们各自有各自的目标和处理方式。档案柜只管把文件整理好送过来,AI只管根据收到的文件回答问题。这两件事之间没有深层的协调,就好像厨师和采购员各干各的,采购员不知道今天客人真正想吃什么,厨师也没法告诉采购员以后要多备什么食材。结果就是,档案柜送来的内容不一定是AI最需要的,而AI也没有办法充分利用档案柜的信息。

第二个问题是"优化断层"。AI系统可以通过大量数据训练来变得更聪明,但这套外挂档案柜的操作——翻文件、筛选、排序——中间有很多步骤没办法被训练过程直接优化。用技术语言说,梯度(也就是"哪里做错了、该怎么改"的信号)没办法顺畅地流过这些离散的操作步骤。于是你想让AI在特定领域的记忆能力变得更好,非常困难,只能借助一些迂回的强化学习方法,效率很低。

第三个问题是"时间成本"。每次对话前,系统都要先去档案柜跑一趟——嵌入编码、相似度计算、检索排序、把文本拼进输入——这一圈下来需要额外的时间。特别是当历史对话积累得越来越多,档案柜越来越大,这个开销就越来越不可忽视。

研究团队把这三个缺陷归纳为:架构上的"解耦"、优化上的"梯度阻断",以及效率上的"顺序处理"。他们的目标,是用一种全新的方式,把这三个问题一起解决掉。

二、原生记忆:让记忆"长"在大脑里

研究团队提出的核心理念,叫做"原生记忆"(Native Memory)。所谓原生,就是不外挂、不附加,而是记忆能力天然地存在于AI模型的内部计算之中。

为了精确描述这个概念,研究团队从两个维度来定义它。第一个维度叫"原生记忆状态"。你可以把现有的AI想象成一个每次都重置的计算器——它的内部参数(也就是它学到的所有知识和能力)是固定不变的,每次计算完就归位。而原生记忆模型则不同:它的一部分参数是"活的",会随着每次交互而动态变化,把当前的信息压缩存储进去,成为下一次交互的起点。这些动态参数就是它的"记忆状态"。

第二个维度叫"原生记忆过程"。有了记忆状态还不够,还得有配套的"记忆动作"——如何把新信息存进去、如何把旧信息调出来、如何决定记什么、忘什么、更新什么。这些动作在Metis中不是靠外部规则来触发的,而是自然地融合在模型处理每一句话的计算过程里。当模型读到"请帮我记住Alice喜欢牛肉汉堡"这句话,它在理解这句话的同时,就自动完成了"存入记忆"这个动作,不需要额外的环节。

研究团队给出了一个形式化的定义来表达这个思想。在传统AI中,模型的参数θ是完全固定的,每次输出只取决于当前输入。在记忆基础模型中,参数变成了θ_t,带着下标t代表它随时间变化。在第t步交互中,模型用当前的θ_t来生成回答;与此同时,θ_{t+1}也在模型的前向计算过程中被自动更新好,等待下一步使用。整个过程就像一条流动的河流,记忆随着每一次交互不断更新演进,而不是每次都从同一个起点出发。

这个设计还有一个微妙但重要的哲学区分。研究团队特别强调:他们所说的"记忆",专指在交互过程中实时获取的信息,而不包括AI在训练阶段学到的通用知识。训练阶段学到的那些东西,比如"法国首都是巴黎",应该叫"知识"而非"记忆",因为它不是针对某个具体用户或场景的个性化信息,也不需要实时更新。记忆是那些带着时间戳、带着个人背景的动态信息,比如"张三上周刚从北京搬到上海"。

三、Metis的构造:记忆是怎么被"装进去"的

理解了为什么要做原生记忆,下面来看Metis具体是怎么实现的。

现代AI的"大脑"主要由一种叫做Transformer的结构组成,你可以把它想象成一排紧密衔接的处理车间,文字输入从第一间车间进去,经过若干道工序后,从最后一间车间出来变成输出。研究团队在这些处理车间中插入了一种全新的组件,叫做"Metis块"(Metis Block)。每个Metis块由两个部分组成:一个叫"局部记忆块",一个叫"超参记忆块"。

局部记忆块是真正存放记忆的地方。在技术上,它是一个矩阵,尺寸为d_k × d_v(这只是表示它的容量大小的符号,无需深究),你可以把它想象成一块可以被反复改写的小黑板。除了这块主黑板,还有一个配套的"标准化向量",它的作用类似于黑板上的索引目录,帮助你在读取信息时找到正确位置。这两样东西在每次交互开始时都从零出发,随着对话推进而逐步积累信息。

超参记忆块则是负责"怎么写"和"怎么读"的控制中心。它包含一组在训练阶段学好的固定参数,这些参数在实际使用时不再改变,但它们决定了信息被压缩进记忆时的方式,以及被提取出来时的方式。超参记忆块的参数主要包括:一个"重要性评分向量"(决定当前输入里哪些部分值得被记录),两个投影矩阵(分别把待记录的内容转化为记忆的"键"和"值"),以及一个专门用于读取记忆的"查询投影矩阵"。

具体来说,当模型处理一段新的输入时,超参记忆块会先给输入中的每个词语打分,判断哪些词语对于未来的记忆检索最有价值,然后按照分数排序,只保留最重要的那一部分(这个比例由一个叫ρ的参数控制)。这就好像你在听一场演讲,不可能把每一个字都记录下来,你会自动筛选出关键词和核心观点。被选中的内容随后通过投影矩阵被转化成一组"键值对",用来更新局部记忆块里的那块小黑板。

更新记忆的具体公式是:新记忆 = λ × 旧记忆 + (1-λ) × 新内容。其中λ是一个介于0和1之间的折扣系数,它控制着遗忘的速度。λ越大,旧记忆保留得越久;λ越小,新内容的影响越大。这和人类记忆的某些机制有相似之处——时间越久的记忆会逐渐淡化,除非被反复强化。

读取记忆的过程叫做"记忆注意力"。当模型需要回答一个问题时,它会用那个专门的查询投影矩阵把当前问题转化成一个"查询向量",然后用这个向量去对小黑板进行"匹配读取"——找出黑板上与当前问题最相关的内容,叠加到正常的注意力计算结果上。最终的输出是原始注意力结果和记忆读取结果的加权平均,权重由一个参数γ控制。这个参数决定了当前输出中有多大比例来自"实时阅读输入",有多大比例来自"回忆过往记忆"。

研究团队在实践中还发现,用一种叫做"门控差值网络更新"(GDU)的策略替换简单的线性更新,能获得更好的效果,尤其是在需要处理更长时间跨度的记忆任务时。这就像是将简单的覆盖式改写升级为更智能的增量式修订,新信息不是粗暴地覆盖旧记忆,而是精细地合并进去。

四、训练数据:教AI如何"正确记忆"

有了记忆架构,还需要专门的训练数据来教会模型正确地使用它。现有的公开数据集大多是单轮问答或简单对话,缺乏专门的"记忆行为"样本。研究团队花了大量精力构建了一套专属的训练数据集。

这套数据集分为两大类:主数据集和辅助数据集。主数据集的核心是围绕四种基本记忆操作来设计的,研究团队将它们形象地描述为"记住"、"遗忘"、"更新"和"反思"。每种操作都有明确的交互模板。"记住"类型的样本格式是:先告诉模型一个事实,再隔一段时间问它这个事实——这测试的是基本的信息保留能力。"更新"类型则是:先告诉一个旧事实,再告诉新事实,然后问——这测试的是能否用新信息替换旧信息。"遗忘"类型是:先给一个事实,再明确指令要抹掉这个事实,然后问——这测试的是能否主动清除指定信息。"反思"类型是:告诉几个独立的事实,然后问需要综合这些事实才能回答的问题——这测试的是多跳推理和记忆整合能力。

研究团队从27个公开的学术基准数据集中提取素材,涵盖了长对话、知识编辑、机器遗忘、多跳问答等多个领域,总共合成了357,137个训练样本,总计约4亿个词元(token)。这些样本还被分成了三种"风格":明确指令式(直接说"请记住XXX")、隐含嵌入式(把需要记忆的信息自然地嵌在对话里,没有明显指令)、以及加干扰式(在信息输入和问题之间插入大量无关对话,测试长距离记忆的鲁棒性)。

辅助数据集则专门针对真实对话中更复杂的场景。研究团队识别出了两种主要的记忆失效模式:一种叫"干扰",即模型把相似的多个事实混淆,或者在遗忘一个事实时顺带错误地抹去了另一个相关事实;另一种叫"记忆污染",即模型在不需要使用记忆的普通聊天中,不合时宜地把存储的事实掺进回答里。

为了应对这两类问题,辅助数据集设计了四种特殊的训练场景。第一种叫"多实体绑定":同时给两个相似的事实(比如"Alice喜欢牛肉汉堡"和"Bob喜欢素食沙拉"),然后分别询问,测试能否正确对应。第二种叫"选择性遗忘":给两个事实后,只指令遗忘其中一个,然后问两个——测试能否精准删除而不误伤。第三种叫"记忆后的普通对话":记忆了某个事实后,进行一段和这个事实无关的闲聊——测试在这种情况下记忆中的内容不会渗漏到无关回答里。第四种叫"无关记忆对话":即使记忆中存有某个事实,如果当前问题根本不需要用到它,就不应该被触发——测试记忆的"按需调用"而非"无脑触发"。辅助数据集共产生了609,443个训练样本,与主数据集合计构成了训练Metis的完整数据基础。

五、训练目标:三种不同的"记忆课程"

有了数据,还需要设计合适的训练目标。研究团队设计了三个互补的训练目标,共同塑造Metis的记忆能力。

第一个目标叫"记忆重建目标"。这是最基础的一课:模型要能把读入的信息忠实地存进记忆,然后在被要求时把它完整地复述出来。这就像练习背诵——你先读一段文字,然后合上书,看能不能一字不差地默写出来。这个目标针对的是记忆的"无损压缩上限",虽然在实际记忆中往往需要有损压缩,但这个训练阶段帮助模型建立起基本的存取能力。

第二个目标叫"记忆操作目标"。在能够无损存取之后,模型还需要学会根据指令灵活地操控记忆——该记的记,该忘的忘,该更新的更新,该推理的推理。这个目标使用的就是主数据集中四种操作类型的样本。监督信号很直接:如果回答正确(符合记忆操作的预期结果),就给正反馈;如果不正确(比如在应该遗忘后还回答了那个事实),就给负反馈。

第三个目标叫"正则化目标"。这是针对前两个目标的补充和约束,专门使用辅助数据集来防范记忆失效的两种病态。它告诉模型:多个相似的事实要绑定到各自的主语上,不能混淆;遗忘操作要精确,不能错误地波及其他;没被问到记忆的问题就不要主动发挥记忆;完全不需要记忆的问题就按普通问题正常回答。

这三个目标通过一个动态的"课程采样"机制来调度:训练初期更多地采样简单的重建和操作数据,随着训练推进逐渐提高复杂场景的比例。这就像学钢琴先练基本功,再逐步挑战复杂曲目,而不是一上来就强行演奏《野蜂飞舞》。

六、实验结果:Metis表现如何

研究团队用多种方式对Metis进行了全面评测。他们将Metis与四类基线系统进行了比较:提供完整历史记录上下文的"全文本"模式、使用RAG检索的"部分上下文"模式、一个叫Temp-LoRA的测试时训练方法,以及一个叫δ-Mem的参数化记忆方法。Metis本身在"无上下文"条件下运行,也就是说,到了回答问题时,历史对话的原文完全不再提供,模型只能依赖自己的原生记忆。

在记忆操作任务上,研究团队使用了一个叫MemOps的专项基准测试,以及他们自己构建的测试集。Metis-27B(参数量最大的版本)在无上下文条件下,综合得分达到24.76(MemOps金标准设置)和73.77(Metis测试集),远超Temp-LoRA-27B的9.70和23.86,也大幅领先δ-Mem的4.38和15.03。值得注意的是,这些成绩虽然仍然低于有完整上下文的全文本模式(后者分别为87.90和78.87),但这个差距是预期之内的,毕竟原生记忆要靠一个固定大小的参数矩阵来压缩所有历史信息,而全文本模式则是原原本本地把所有文字都放在输入框里让模型读。

在记忆型问答任务上,研究团队测试了两个数据集。其中一个叫LoCoMo,它模拟长期对话场景;另一个叫NextMem,包含了SQuAD、HotpotQA等多种问答任务。Metis-27B在LoCoMo的无上下文设置下综合得分26.74,在NextMem上达到50.82,均为所有无上下文方法中的最高分。特别是在多跳推理(需要综合多条记忆才能回答的问题)和时序推理(需要判断前后时间关系的问题)上,Metis的提升尤为显著,这说明原生记忆不仅能存储孤立的事实,还具备一定的记忆整合能力。

从模型规模的角度来看,从4B升到9B时性能提升有限,但升到27B后性能有了明显的跃升。这暗示着记忆能力对模型的基础容量有一定要求,一旦达到足够大的规模,原生记忆的效果就能充分发挥出来。

七、分布外泛化:记忆能力能迁移到陌生场景吗

一个自然的疑问是:Metis的记忆能力是不是只在它训练过的数据类型上好用?研究团队专门在两个从未用于构建训练数据的外部基准上测试了Metis,分别是ATM-Bench和MemDaily。

ATM-Bench测试的是从个人档案(如邮件、日历、聊天记录)中提取并整合异质信息的能力,包括列表类问题、数字类问题和开放式问题三种形式。MemDaily则是一个日常个人对话场景下的单选题基准。

在ATM-Bench上,Metis展现出了明显的优势,在各模型规模下都超越了Temp-LoRA和δ-Mem的对应版本。Metis-4B综合得分10.22,Metis-9B达到16.49,Metis-27B达到18.56,而Temp-LoRA-27B仅有2.57。在MemDaily上,结果更为复杂:Metis整体上与基线方法相当,在某些子类上领先,但没有在ATM-Bench上那么明显的优势。研究团队认为,这两个测试合在一起,提供了初步的证据表明Metis学到的原生记忆能力具有一定的泛化性。

八、记忆容量的边界:能记多少、能记多久

Metis能记住的东西毕竟是有限的,研究团队对此进行了诚实而详尽的探索,将记忆能力分为"单步容量"和"轨迹容量"两个维度来考察。

单步容量测试的是:在一次单独的记忆更新中,最多能可靠地编码多少信息?测试方法是:先把若干条关于某个虚构人物的描述合并成一段文字,一次性更新进记忆,然后分别询问这段文字里的第一条、中间一条和最后一条信息。随着这段文字的词数从几十词增加到几百词,模型的回答准确率急剧下降。当输入超过几百词时,三个位置的准确率都接近零。相比之下,有完整上下文的对照组则不受这个影响。这表明,将大量信息一次性压入一个固定大小的参数矩阵,本质上是有损的,且损失随信息量增加而迅速加剧。

轨迹容量测试的是:在多次连续的记忆更新中,信息能保持多久?测试方法是:将40条关于某个虚构人物的信息分批(每批5条)依次更新进记忆,每更新完一批就问第一条、中间一条和当前批次的信息。随着更新步数增加,最早存入的信息的准确率几乎单调递减,中间和最新的信息也呈现不稳定的波动。这说明记忆的覆盖和干扰不仅作用于最旧的信息,而是扩散到整个记忆空间,导致全局性的混乱。

这两个发现都说明Metis目前还不适合作为长期记忆的唯一依赖,特别是在需要保留大量精细信息的场景中。研究团队对此持开放态度,认为这是当前原型版本的主要局限,也是未来研究的核心方向之一。

九、记忆的代价:对通用能力的影响

记忆能力的加入,会不会伤害模型原本的通用智能呢?研究团队设计了两种测试场景来回答这个问题。第一种是"初始状态"测试,即在记忆完全为空时,测试Metis与其原版骨干模型Qwen3.5-4B在通用任务上的差距。第二种是"激活状态"测试,即在记忆中预先存入了一些无关信息后,再测通用任务表现。

在初始状态下,Metis-4B的通用能力基本与Qwen3.5-4B持平,在知识理解(MMLU-Pro:45.20 vs 46.00)、数学推理(GSM8K:82.03 vs 83.09)和多语言理解(MMMLU:60.50 vs 61.30)上略有下降,但在指令遵循(IFEval:79.85 vs 79.30)上略有提升。差距都在可接受的范围内,说明记忆架构本身不会对模型的基础能力造成显著破坏。

在激活状态下,差距就明显大了。存入无关记忆信息后,Metis-4B在各项通用任务上均有下降,其中IFEval的下降最为剧烈(54.53 vs 76.71,差距超过22个百分点),MMLU-Pro和GSM8K分别下降5.1和5.6个百分点。这说明当记忆中存有内容时,这些内容会在一定程度上渗透到不相关的推理过程中,形成干扰噪声。这是原生记忆与生俱来的一个副作用:信息被压缩进全局参数空间后,其影响难以被精确隔离。

十、低秩压缩:记忆能占多少空间

从存储效率的角度,研究团队还探索了能不能对记忆矩阵进行压缩。他们尝试了对记忆矩阵做奇异值分解(一种数学压缩技术),然后只保留前k个最重要的方向,用这个压缩版的矩阵代替原始矩阵来回答问题。

实验的结论非常清晰:在全尺寸1024维的记忆矩阵中,实际上只有大约64维是有实质意义的。当k从1逐步增大到64时,性能从原始的43.5%快速恢复到99.9%;从64继续增大到256再到1024,几乎没有任何额外提升。这个发现意味着,可以用k=64的低秩近似来替代全尺寸矩阵,存储量减少到原来的约1/8,而性能几乎不受影响。对于需要在服务器上同时维护成千上万个用户记忆状态的实际应用场景,这个压缩率具有相当的实用价值。

十一、效率优势:速度上Metis能赢吗

研究团队还对Metis的推理效率进行了详细的测量,这部分内容在附录中有完整呈现。

在LoCoMo基准上的1527个样本的实测中,Metis-4B的平均端到端延迟为0.562秒,低于全文本模式的0.607秒,远低于δ-Mem的0.884秒和Temp-LoRA的1.567秒。更重要的是,在P95尾部延迟(即最慢的那5%请求的延迟)上,Metis的0.926秒相比全文本模式的3.012秒减少了69.3%,相比δ-Mem的1.600秒减少了42.2%,相比Temp-LoRA的3.292秒减少了71.9%。尾部延迟的大幅改善,说明Metis在处理长历史记录时具有更稳定的响应时间。

研究团队进一步做了从512到128K词元的大范围测试。在上下文长度较短时(32K词元以内),Metis的端到端延迟略高于全文本模式。但超过64K词元后,Metis开始反超,在128K词元处,全文本模式需要14.25秒,而Metis只需9.52秒,速度快约1.5倍。这个交叉点之所以在64K才出现,是因为Qwen3.5-4B本身有一部分层已经使用了线性注意力(这是一种随上下文长度线性扩展而不是平方扩展的更高效的注意力机制),降低了全文本模式在中等长度时的开销。但随着上下文继续增长,全文本模式的开销依然无法避免地爆炸式增长,而Metis的查询延迟则始终保持在几乎固定的水平。

在存储方面,全文本模式在32K词元下需要约1118MB的KV缓存存储,而Metis的完整记忆状态只需16.79MB(约为全文本的1/67),压缩到k=64后更是只需2.11MB(约为全文本的1/529)。这意味着同样一台服务器,用全文本方式只能同时服务约64个有32K历史的用户会话,而用Metis则可以同时服务约4000个——容量提升超过60倍。

十二、案例研究:Metis在真实对话中的表现

研究团队还展示了一些具体的对话案例,直观地呈现了Metis的记忆行为。

在"记住"案例中,用户先告诉Metis "Alice喜欢牛肉汉堡",随后问"Alice喜欢吃什么?",Metis正确回答了"Alice喜欢牛肉汉堡",表现了基本的记忆存取能力。

在"多实体"案例中,用户先后告诉Metis三件事:Alice 9岁、Alice喜欢牛肉汉堡、Alice住在北京,然后问"Alice多大了?",Metis正确回答了"Alice 9岁",说明它能将多个属性正确绑定到同一主体上。

在"干扰"案例中,用户告诉Metis Alice喜欢牛肉汉堡,然后插入一句无关的闲聊"昨天天气不错",再问Alice的喜好,Metis仍然正确回答,说明无关对话不会冲刷掉已有记忆。

在"遗忘"案例中,用户先告诉Metis Alice喜欢牛肉汉堡,然后指令"请忘记Alice喜欢牛肉汉堡",再问Alice喜欢吃什么,Metis回答"我没有这方面的信息",说明遗忘操作在最终状态上是有效的。不过研究团队也坦承,在收到遗忘指令时,Metis当步的直接回答仍然重复了旧事实,而不是确认已遗忘——这是一个行为上的不一致,说明遗忘操作的执行和当步的语言输出之间还存在脱节,有待改进。

十三、与Llama骨干的迁移测试

为了验证Metis框架不依赖特定的骨干模型,研究团队还将其应用到了Llama-3.1-8B上,进行了与主实验完全相同的训练和评测。结果表明,Metis(Llama-3.1-8B)在所有四个基准上均显著优于不使用上下文的原版Llama,综合得分36.03,略高于Metis-4B(33.14)和Metis-9B(34.44)。不过,具体到不同任务上,Llama版本与Qwen版本各有优劣,说明骨干模型的选择会影响具体任务的表现分布,但Metis框架的记忆能力本身可以成功迁移到不同架构上。

十四、记忆基础模型的未来路线图

在论文末尾,研究团队提出了一个宏大的未来愿景,将记忆基础模型的发展划分为五个层级,像是一个AI能力进化的阶梯。

第一级叫"有状态能力",也就是Metis目前所处的阶段:AI从无记忆的静态函数,变成了跨交互步持有动态内部状态的有状态系统。第二级叫"自我管理能力":AI不仅能持有记忆,还能自主判断什么该记、该记多久、记成什么形式,形成一个完整的记忆生命周期管理能力。第三级叫"经验学习能力":AI能把历史交互转化为改进自身能力的信号,从每一次成功和失败中持续进化,而不仅仅是把经历当作静态记录存下来。第四级叫"持久认知能力":AI维护着不断更新的世界模型、用户模型和自我认知,具备时间连续性的认知框架,能在长时间跨度内保持知识和判断的一致性。第五级叫"自我进化能力":AI能自主识别哪些经验具有长期价值,将它们抽象为可迁移的知识,并融入到自身未来的学习策略中,形成开放式的能力涌现。

研究团队认为,记忆基础模型不应被视为"装了更好记忆模块的普通AI",而是指向了AI范式的根本性转变——从无状态的预测机器,走向有状态的学习系统,最终成为能够自我进化的持续存在。

说到底,Metis做的事情可以用一句话概括:它让AI第一次有了真正意义上的"自己的记忆",而不是靠反复翻阅外置笔记本来装出一副"我记得你"的样子。这个突破目前还很初步,就像人类婴儿刚刚学会把短期记忆转化为长期记忆,还远没到能流畅地回忆多年前细节的阶段。固定大小的记忆矩阵在面对长期、大量的历史信息时,就像一块小黑板试图装下整座图书馆,信息必然要丢失和混淆。但方向是对的,而且这是第一次有人把这件事作为一个独立的研究问题认真地提出来、定义好、并给出了一个可以运行的原型。对于关心AI个性化、AI长期交互、AI持久智能的所有人来说,这个开端值得认真关注。有兴趣的读者可以在arXiv上搜索编号2607.26760,找到完整的论文和开源代码,自己动手探索这个新方向。

Q&A

Q1:Metis记忆基础模型和RAG(检索增强生成)有什么本质区别?

A:RAG是给AI配了一个外置档案柜,每次需要历史信息时都去翻文件再塞进输入框,记忆和推理是两套分离的系统。Metis的原生记忆则是把历史信息直接压缩进模型内部的参数矩阵里,读取和写入都发生在模型的正常计算流程中,无需额外的检索步骤。这意味着记忆和推理是深度耦合的,也支持端到端的训练优化,而RAG中间有离散操作无法被训练信号直接优化。

Q2:Metis能记住多少信息,记忆有上限吗?

A:有明确的上限。Metis的记忆被存储在一个固定大小的参数矩阵中(类似一块尺寸固定的黑板),随着写入信息越来越多,早期信息会逐渐被稀释和干扰。实验显示,单次写入超过几百词后准确率急剧下降;连续多步更新后早期信息的准确率也会持续下降。研究团队指出,这是当前版本的核心局限,未来需要改进记忆容量和长期保持能力。

Q3:Metis加入记忆功能后,会不会让AI在普通聊天时变得更慢或更容易出错?

A:研究显示,当记忆为空时,Metis与原版骨干模型的通用能力几乎相当,差距很小。但当记忆中存有内容时,这些内容会对无关任务产生一定干扰,尤其是在严格指令遵循任务上下降较明显。速度方面,Metis的查询延迟在上下文超过64K词元后反而比全文本模式更快,短上下文时略慢。总体来看,加入记忆有一定代价,但在设计合理的场景下是可接受的。

声明:市场有风险,投资需谨慎。本文基于第三方数据库发布,不代表本网观点,任何在本文出现的信息均只作为参考,不构成个人投资建议。如有出入请以实际公告为准。

热点新闻