谷歌发布 RNN 新架构，同等规模强于 Mamba

文章来源：企鹅号 - OSCHINA

3 月 1 日，在谷歌 DeepMind 近日的一篇论文中，研究者提出了 RG-LRU 层，它是一种新颖的门控线性循环层，并围绕它设计了一个新的循环块来取代多查询注意力（MQA）。他们使用该循环块构建了两个新的模型，一个是混合了 MLP 和循环块的模型 Hawk，另一个是混合了 MLP 与循环块、局部注意力的模型 Griffin。

https://arxiv.org/pdf/2402.19427.pdf

针对一系列模型规模、在 300B tokens 上对 Hawk 和 Griffin 的过度训练，Hawk-3B 在下游任务的性能上超越了 Mamba-3B，但训练的 tokens 数量只有后者的一半。Griffin-7B 和 Griffin-14B 的性能与 Llama-2 相当，但训练的 tokens 数量只有后者的 1/7。

此外，Hawk 和 Griffin 在 TPU-v3 上达到了与 Transformers 相当的训练效率。由于对角 RNN 层受内存限制，研究者使用了 RG-LRU 层的内核来实现这一点。

发表于: 2024-03-042024-03-04 14:24:30
原文链接：https://page.om.qq.com/page/Ox4RyUD7_Y_vYXjDgRbLFORQ0
腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号（企鹅号）传播渠道之一，根据《腾讯内容开放平台服务协议》转载发布内容。
如有侵权，请联系 cloudcommunity@tencent.com 删除。

扫码

添加站长进交流群

领取专属 10元无门槛券

私享最新 技术干货

谷歌发布 RNN 新架构，同等规模强于 Mamba

相关快讯

扫码

社区

活动

资源

关于

腾讯云开发者

热门产品

热门推荐

更多推荐