一、引入 Titans 模型 我们将深入探讨谷歌研究院的一篇新论文《 Titans: Learning to Memorize at Test Time》 ,该论文介绍了一种名为 Titans 的新模型架构。
Titans 在缓解 Transformer 二次方成本问题的同时,展现出了令人期待的成果。
Titans 模型的设计灵感来源于人类大脑的记忆运作方式。
论文中有一句有趣的话提到, 记忆是一种基本的心理过程,是人类学习不可或缺的组成部分。
如果没有正常运作的记忆系统,人类和动物将局限于基本的反射和刻板行为 。
二、深度神经长期记忆模块 Titans 论文的一个关键贡献是深度神经长期记忆模块(deep neural long-term memory module)。
我们先来了解一下它是什么,然后再探讨它是如何融入 Titans 模型的。
与循环神经网络中将记忆编码为固定向量不同, 神经长期记忆模块本身就是一个模型,是一个多层神经网络,它将过去的历史抽象编码到自身的参数中 。
要训练这样一个模型,一种思路是训练它记忆训练数据。
然而,众所周知,记忆会限制模型的泛化能力,可能导致性能不佳。
三、避免过拟合的记忆机制 研究人员设计了一种巧妙的方法,来创建一个能够记忆,但又不会在训练数据上过拟合的模型。
这种方法的灵感来自人类记忆的一个类比。
当我们遇到令人惊讶的事件时,我们更有可能记住它。
神经长期记忆模块的学习过程正是基于这一理念设计的。
3.1 对 “惊讶” 进行建模
Updating the neural memory using a surprise element 通过论文中的上述定义,我们可以了解研究人员是如何对 “惊讶” 进行建模的。
Mt代表时刻t的神经长期记忆模块。
它通过上一时刻的参数以及一个被建模为梯度的 “惊讶” 元素进行
