首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >光子存内计算硬件架构:从相变材料到非互易磁光材料的可扩展之路

光子存内计算硬件架构:从相变材料到非互易磁光材料的可扩展之路

作者头像
光芯
发布2025-06-11 14:05:42
发布2025-06-11 14:05:42
1.1K0
举报
文章被收录于专栏:光芯前沿光芯前沿

      本报告是匹兹堡大学Nathan Youngblood助理教授团队,针对光子存算一体架构的可扩展性难题,基于非易失性光学材料展开的前沿技术分享,题目为Scalable Architectures for Photonic Compute-In-Memory Using Nonvolatile Optical Materials

图片
图片

一、研究背景:AI计算需求转向与光子计算的机遇

图片
图片

      随着AI技术的发展,AI服务的计算需求正经历从训练密集型向推理密集型的转变。以OpenAI为例,其仅40%的计算资源用于模型训练,更多资源投向模型部署,而部署中模型推理需求显著增加。在数字加速器领域,训练需浮点运算以实现反向传播和梯度精确表示,推理则更适合int8量化模型,这为低精度模拟加速器在推理端的应用提供了机会。

图片
图片

      同时,低延迟或超低延迟计算需求日益增长,例如在FPGA矩阵乘法中存在速度瓶颈,而光子集成凭借光纤的极高带宽、低功耗线性变换(如傅里叶变换)以及低至每乘积累加操作少于一个光子的功耗等特性,在这类场景中展现出优势。光子计算架构主要分为权重固定架构和输出固定架构,本文将围绕这两类架构展开探讨。

图片
图片

二、权重固定架构:相变化材料与非互易磁光器件的应用与挑战

图片
图片

(一)相变材料的光子存储与计算

图片
图片

      相变材料(如硫系玻璃)可在玻璃态(非晶态)和晶态间切换,伴随折射率的显著变化,这一特性使其在光域和电域均可存储信息。将其溅射在波导上,通过改变非晶态与晶态的比例,可利用透射率变化光学编码信息,类似电阻式交叉阵列在电域的电导变化。

图片
图片
图片
图片

      将两个波导结合,可实现输入功率与传输率的乘积及求和,完成简单的矩阵向量乘法。例如,将卷积边缘核映射为4×4矩阵及光子交叉阵列,通过行扇出、列扇入和光电探测器非相干求和,扫描像素时可提取输入图像边缘。

图片
图片

      在扩展计算吞吐量方面,可利用光频率梳在频率空间实现并行计算。单个连续激光泵浦微谐振器产生四波混频,生成间隔100GHz的多个频段波长,结合标准光纤复用器和解复用器,可同时处理多输入向量,使吞吐量提升数倍。

图片
图片

      然而,该架构面临硬件规模限制。若以25×25微米单元存储1亿参数,需8×8厘米芯片,制造难度大;即便采用64×64阵列,也需重写超2000次,消耗594W能量,存在高延迟(2.4ms)和高能耗问题。

图片
图片

(二)应对挑战的解决方案

1. 多功能存储单元

图片
图片

      结合非易失性相变材料的大幅改变和易失性高速权重更新的小幅调整。例如,在环形谐振器中集成相变材料和PN调制器,反向偏置PN结可快速调制(易失性调谐),正向偏置则加热相变材料实现非易失粗调,通过两者结合可提高精度并减少材料重写次数,延长架构寿命。不过,当前低损耗的Sb2Se3相变化材料耐久性有限,仍是研究重点。

图片
图片
图片
图片
图片
图片

2. 非互易磁光器件

图片
图片

      受光环形器和高速磁光调制器等研究启发,提出非互易光子内存计算平台。该平台由非易失性非互易环形谐振器记忆单元组成,利用磁光材料中磁场方向不同导致的顺时针和逆时针模式相位差,通过平衡光电探测可得到正负数值。通过片上集成电磁体的电流可切换材料状态,结合CoFeB磁铁可无能耗保持磁态。

非互易+非易失磁光材料异质集成实现高性能光子存内计算

图片
图片
图片
图片
图片
图片

      实验显示,该器件可通过纳秒脉冲实现2位精度权重设置(受函数发生器限制),编程能量低至数百fJ/bit,速度达1ns,驱动电压为mV级,兼容CMOS工艺。其非易失性权重编码展现出磁滞回线特性,经测试可实现超24亿次重写循环,耐久性远超其他非易失性光存储单元。

图片
图片

三、输出固定架构:时间复用与相干计算的扩展潜力

图片
图片

      输出固定架构采用时间复用方法,将矩阵A和B按时间流处理,突破硬件物理规模限制,降低对模数转换器(ADC)的要求,节省能量。例如,以10GHz速度传输光信息时,可在传输完所有子矩阵后采样,而非实时高频采样。

图片
图片

      在相干矩阵向量乘法器实验中,通过马赫-曾德尔干涉仪(MZIs)和移相器控制输入信号A和B的幅度与相位,经50:50分束器后积分,通过输出光强差可得到两输入向量电场的点积,实验精度达理想值的97%(主要受调制器消光比限制)。相干计算支持复数编码,利用光的幅度和相位,在相同信噪比下可编码更多比特,契合复杂神经网络的能效需求。

图片
图片
图片
图片
图片
图片

      在二维扩展方面,采用光子交叉阵列结合3D分束器和光栅耦合器,片内保持相位相干,片外仅需强度测量。通过近场图像传感器采集光栅耦合器输出,比较像素相对强度可得输出矩阵。不过,128×128光子交叉阵列的扩展受限于高带宽内存的数据输入,需在架构设计中综合考虑光学和存储因素。

图片
图片
图片
图片
图片
图片
图片
图片

四、总结与展望

      光子计算在矩阵向量乘法中展现出高带宽和低功耗优势,权重固定架构通过相变化材料和非互易磁光器件提升了可扩展性和耐久性,输出固定架构借助时间复用和相干计算突破硬件限制。然而,实际应用中仍面临材料耐久性、内存带宽等挑战。未来,随着器件工艺和架构设计的进步,光子计算有望在AI推理和低延迟计算领域发挥更重要

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2025-06-10,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档