用户10317468
【从函数到 Transformer 系列 05】Transformer架构补充内容
原创
关注作者
腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
用户10317468
社区首页
>
专栏
>
【从函数到 Transformer 系列 05】Transformer架构补充内容
【从函数到 Transformer 系列 05】Transformer架构补充内容
用户10317468
关注
发布于 2026-09-29 09:25:51
发布于 2026-09-29 09:25:51
22
0
举报
概述
Transformer 架构补充内容 本篇为「从函数到 Transformer」系列的收官篇。前四篇我们从最简单的函数一路走到神经元、梯度下降、过拟合,再到矩阵运算与 CNN。本篇回答最后一个问题:为什么有了 CNN 和 RNN,大模型们还是选择了 Transformer? 一、为什么需要 Transformer RNN 的痛点:不能并行 处理文本这类序列数据时,最经典的方案是 RNN(循环神经网
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系
cloudcommunity@tencent.com
删除。
AIGC
问题归档
专栏文章
快讯文章归档
关键词归档
开发者手册归档
开发者手册 Section 归档