返回
查看原链接原链接
Bilibili17分19秒 · —

脉冲神经网络(SNN):原理、潜力与局限——一份技术解析笔记

脉冲神经网络(SNN):原理、潜力与局限——一份技术解析笔记

核心结论: 脉冲神经网络(SNN)通过引入“内部状态、时间动态、阈值发放”等机制,为低功耗持续感知和事件驱动计算提供了不同于传统人工神经网络的替代路线,但受限于训练难度、时间维度成本和生态成熟度,它在短期内既无法取代基于 Transformer 的大模型,也没有证据表明它一定比普通网络更省电,其价值更可能体现在机器人、传感器和可穿戴设备等 Transformer 不擅长的边缘场景中。

核心要点

  • 当前主流生成式 AI(如 ChatGPT、DeepSeek)依赖 Transformer 架构,基于注意力和大规模矩阵运算,其计算方式与人脑神经元的机制有本质区别。
  • 人脑处理信息并非让所有神经元持续密集工作,多数神经元平时保持沉默,仅在信号满足条件时发出短脉冲;这引发了一个问题:AI 是否必须依靠持续密集的计算?信息是否只能由连续数值表示?
  • SNN 借鉴了生物神经元的若干动态特征,将时间顺序纳入计算过程,让神经元保存内部状态、随时间累积输入、达到阈值后发放脉冲。
  • SNN 的省电潜力在于事件驱动稀疏计算:无变化时不发送信号,大部分神经元沉默时硬件可跳过部分乘法和数据搬运;但实际能耗取决于具体任务和硬件。
  • 目前 SNN 训练困难(脉冲函数不可导)、时间维度计算开销大、软件和硬件生态远不如 GPU 成熟,因此难以与 Transformer 在大规模语言模型上竞争。
  • 事件相机等硬件输出的自然事件流与 SNN 的输入形式高度契合,是 SNN 当前最有落地前景的方向。
  • 学术界已在尝试将 SNN 用于语言模型(如 Spiking Bert、SpikeGPT),但精度、训练效率和部署成本离主流大模型仍差距巨大,且能效数据多为理论估算。

详细解析

一、为什么会出现 SNN:普通人工神经网络的来龙去脉

普通人工神经元的计算方式:收到一组数字 → 为每个数字乘上不同权重 → 求和 → 经激活函数输出一个新数值。将这种单元堆叠足够深,并用海量数据调整权重,就构成了今天的神经网络。

这个名字来源于早期研究者对神经系统的抽象,但普通网络真正保留的只有“许多简单单元相互连接”这一层关系。神经元内部的电位变化、脉冲时间、化学过程和复杂结构大多没有进入普通网络。人工神经元本质上是数学计算单元,并非对真实脑细胞的完整模拟。

Transformer 更进一步走上工程路线:把文字变成向量,计算不同位置之间的关系,其优势来自注意力机制、并行训练、数据规模和成熟的 GPU 生态,而不是对某种生物神经元的精确模拟。这本身不是坏事——工程上只要能解决问题,没必要一比一复刻自然界。但一旦设备需要持续接收传感器数据且被功耗和延迟卡住,密集计算就未必合适了,这是 SNN 出现的现实动机。

二、SNN 的核心原理与方法

SNN 让人工神经元保存内部状态,并把时间、阈值和脉冲都放进计算过程。

LIF 神经元:最常用的简化模型
  • 全称:Leaky Integrate-and-Fire,中文通常译作“泄露积分发放”。
  • *Leaky(泄露)*:内部状态会随时间衰减;
  • *Integrate(积分)*:模型会累积输入带来的影响;
  • *Fire(发放)*:达到阈值后输出脉冲。
  • 工作机制:LIF 保存一个随时间变化的内部状态(通常叫膜电位),即“当前神经元积累到了什么程度”。新输入会改变膜电位;没有持续输入时,它会逐渐衰减;达到设定阈值时,神经元输出一次短脉冲,再按模型规则重置。
  • 与普通人工神经元的根本区别:普通神经元拿到当前输入就算出当前输出;LIF 是否放电不只取决于当前输入,也取决于前一时刻留下的膜电位
  • 定位与局限:LIF 离真实神经元还很远。真实细胞有离子通道、不同形态的树突、复杂的突触和化学调节。LIF 没有照搬这些结构,只保留了“几种可能对计算有用的动态特征”。
脉冲编码:信息如何用时间表达

由于有了脉冲,信息不再只有数值大小,还包括以下维度:

编码方式原理示例/说明
频率编码刺激越强,神经元在一段时间内放电越频繁最直观易懂
时间编码同一次脉冲出现的先后早晚本身表示差别来得更早 vs. 更晚
群体编码一组神经元共同形成模式,而非把含义压在单个神经元身上群体协同表达

时间结构差别的具体示例:两个输入序列都包含 10 个脉冲,一个序列把脉冲集中在第一秒,另一个把脉冲均匀分布在一分钟内。两者脉冲总数相同,但时间结构完全不同,SNN 可以直接利用这种差别。

编码方式的影响:SNN 不要求所有信息都换算成脉冲次数,不同任务使用不同编码。有些传感器可以直接产生事件,普通数据则往往需要转换。选择哪种编码会直接影响精度、延迟和需要运行多少个时间步;把时间纳入模型会增加成本,训练和推理时都得把这些时间步算进去。

三、SNN 的省电逻辑与适用边界

省电的机制:少算而非“脉冲”本身

SNN 省电的关键在于有机会少算一些东西。以摄像头对着静止走廊的场景为例:

  • 普通流程:按固定频率拍下完整画面,把每一帧送进网络。即使绝大多数区域没有变化,像素仍被读取,数据仍被移动,网络仍要计算。
  • 事件驱动思路:没有变化就尽量不发送事件;某处发生变化才把信号送下去。如果网络中大多数神经元也保持沉默,硬件就有机会跳过一部分乘法和数据搬运。
重要限制:省电并非自动获得

SNN 不会因为名字里有“脉冲”就自动变成低功耗系统。实际能耗取决于:

  • 活动有多稀疏;
  • 需要运行多少个时间步;
  • 权重和状态怎样存取;
  • 底层芯片能不能跳过无效计算。

关键警告:把 SNN 直接放到普通 GPU 上运行不一定更节能。GPU 最擅长规则密集并行的矩阵运算,而 SNN 的事件可能稀疏异步,还要反复更新每个神经元的内部状态。模拟时间往往需要执行多个步骤,减少的乘法可能不足以抵消循环、访存和调度带来的开销。所以看到“省电多少倍”这类数字时,需要追问:它用的是什么硬件、处理什么任务、跑了多少时间步、精度有没有下降。

四、事件相机:SNN 最天然的应用场景

事件相机是理解“事件驱动”的最佳例子:

  • 普通相机:按固定节奏拍摄完整画面,每帧每个像素都要重新报告一次亮度。
  • 事件相机:仅当某个像素明显变亮或变暗时发出一个事件,记录变化的位置、时间以及变亮还是变暗。输出不是一叠整齐的照片,而是一串随时间出现的变化事件。
  • 静止时,事件可非常少;
  • 高速物体掠过时,运动边缘会迅速亮起;
  • 不必等待下一张完整图像,因此提供极高的时间分辨率,适合高速运动、强弱光变化和低延迟场景。

事件相机输出的离散事件流与 SNN 内部的脉冲传递形式对上了。事件机器人不必反复处理整张画面,可以直接关注刚刚发生变化的位置。

但必须注意:数据形式对得上不代表 SNN 就一定更好。事件相机的数据不如普通图像直观、缺少完整纹理,还要处理噪声、事件稀疏程度和异步数据结构;很多事件视觉任务照样可以用普通深度网络完成。

五、为什么大模型仍然用 GPU 和 Transformer?

三个根本原因:

1. 难以训练:脉冲函数不可导
  • 普通神经网络的输出通常是连续变化的,数值稍微变一点,训练算法就能沿梯度判断参数调整方向。
  • 脉冲发放通常用阶跃函数表示:未达阈值输出为 0,越过阈值输出为 1。该函数在阈值处不连续,在其他位置的导数又为零,因此不能直接为标准反向传播提供有效梯度。
  • 最常见的解决办法是替代梯度(Surrogate Gradient):前向计算时神经元仍按真实阈值发出离散脉冲;反向传播时用一条平滑函数的导数近似阶跃函数的导数,据此调整参数。
  • 替代梯度的局限:它终究只是近似。神经元长期不放电可能收不到有效的学习信号;网络沿时间展开后,也会遇到循环网络中常见的梯度消失或爆炸问题。
2. 时间维度本身很贵
  • 普通深层网络要保存每一层的中间结果;
  • SNN 如果运行多个时间步,还得保存每一层在每个时间点的膜电位和脉冲状态
  • 反向传播又要沿时间倒着算,显存占用和计算量都会显著增加
3. 生态不成熟
  • 今天的 CUDA、PyTorch、云平台、模型库和工程经验都是围绕密集张量计算长期积累起来的;
  • SNN 需要的却是稀疏事件、局部状态和异步通信;
  • 研究芯片可以专门配合这些特点,但开发工具、部署规模和通用性还远没有 GPU 生态成熟。
  • 技术普及不只看论文指标:训练稳不稳定、软件好不好用、硬件能不能买到、模型是否容易部署,都会影响最终结果。

六、神经形态芯片:SNN 的硬件搭档

SNN 经常与神经形态芯片一起出现。神经形态芯片不是给 GPU 换个名字,而是从硬件设计上配合神经元状态和脉冲:

  • 事件到来时只更新相关的局部计算;
  • 存储和计算离得更近;
  • 不必让所有单元按照同一节拍完成整块矩阵运算。

不同芯片的路线差异(原文提及但未给出具体型号对应细节):如 Intel Loihi、IBM TrueNorth 以及 SpiNNaker 等,具体路线侧重不同——有的强调数字神经元核心和片上学习,有的强调大规模脉冲路由,有的使用大量通用处理核心模拟神经系统。它们都在想办法让硬件更适合 SNN 计算(稀疏、异步、随时保存局部状态)。

专用硬件的限制:芯片支持哪些神经元模型、权重精度多高、网络怎么映射、训练是否方便,都会影响实际效果。某个任务在某块芯片上的能效数据不能直接套到所有应用上。

七、SNN 适合落地的场景

SNN 最先落地的地方很可能不是云端大模型,而是需要持续感知、反应快、电池又小的设备:

  • 始终在线的声音检测:不需要把每一毫秒的完整波形都送到云端。
  • 可穿戴医疗传感器:需要长期监测却不能频繁充电。
  • 无人机和小型机器人:要立刻回应运动变化,难以背着数据中心行动。
  • 智能眼镜、事件相机、工业监控、脑机接口、前端低功耗传感器和实时控制:这些设备处理的不是一次性送进来的静态文件,而是现实世界中持续变化的信号——需要知道哪里变了、什么时候变,并在有限功耗下一直运行。

八、SNN 在语言模型中的研究进展(前沿探索)

原文表示“再来看更难的一步”,以下是已有的学术尝试:

模型/方向做法结果/状态
SpikeFormer 及后续 Spike-driven Transformer把脉冲神经元用进 Transformer,主要在视觉任务中探索脉冲形式的注意力视觉任务为主要实验场景
Spiking Bert将 BERT 的知识蒸馏到脉冲模型GLUE 多项语言理解任务上做了实验
SpikeGPT沿 RWKV 式的循环结构让 token 依次进入模型,展示脉冲激活也能生成文本后续版本测试更大模型,最高约 12 亿参数

关键限制(原文明确标注)

  • 受计算资源限制,较大的两个模型没有在原来的大型文本数据上完成充分训练
  • 缩放实验使用的是规模更小的数据集;
  • 这些实验只表明“脉冲模型已经能做部分语言理解和生成”,研究者也开始尝试注意力机制和更大的模型,但在精度、知识容量、训练效率和部署成本上全面胜过主流大语言模型还差得很远

文本 token 与事件相机的本质区别:文本 token 不是天然事件流。语言模型需要稳定保存复杂连续表示,还要处理很长的上下文。把这些表示压成脉冲可能减少某些高成本操作,也可能需要更多时间步才能恢复精度。

论文能耗数据的性质(原文明确提示必须仔细看)

  • SpikeGPT 的说法是:如果跑在能够利用稀疏脉冲的神经形态硬件上,理论操作数可以明显减少——注意是理论估算。
  • Spiking Bert 的能效分析同样来自估算:依据是特定芯片工艺下的单次操作能耗和模型放电率。
  • 作者甚至把真正部署到 Loihi 2 列为未来工作

所以,脉冲语言模型确实已经存在,但说它能替代主流大模型,证据还不够。

限制与待确认问题

本部分集中整理原文中明确指出或暗示的不确定性与未解决问题:

  1. 省电是否成立没有统一答案:SNN 是否一定比普通神经网络省电,现有研究给不出统一结论,完全取决于任务、硬件和时间步配置。
  2. 替代梯度的有效性上限:替代梯度只是近似方案,长期不放电的神经元可能收不到有效学习信号,且沿时间展开会有梯度消失/爆炸。
  3. SNN 能否在通用大模型上胜出:目前找不到证据支持;规模和成熟度都追不上 Transformer。
  4. 神经形态芯片的适用性边界:芯片支持的模型、权重精度、映射方式都会影响效果,单一芯片上的能效数据不能外推。
  5. 语言模型中的 SNN 能效数据均为估算:没有硬件实测支撑,作者自己都把“部署到实际芯片”列为未来工作。
  6. 事件相机上的 SNN 未必优于普通深度网络:数据形式匹配不代表最终效果更好。
  7. 模仿大脑是否只是包装:原文最终没有给出定论——“人脑的机制不能直接搬进芯片,但继续研究它怎么处理信息还是可能带来新的计算方法”。

行动清单(面向技术决策者与研究者)

原文没有给出“行动清单”,但基于全篇论证可以提炼出以下可执行的观察方向:

  1. 关注场景:持续感知、低功耗、毫秒级反应、电池容量有限——这些都是 SNN 相对有把握的优势领域(声音检测、可穿戴、机器人、智能眼镜、事件相机、工业监控、脑机接口等)。
  2. 核实能效声明:面对“省电多少倍”的说法,要追问三个问题:什么硬件?处理什么任务?跑了多少时间步?以及精度有没有下降。
  3. 考虑混合架构:SNN 不一定需要全面取代 Transformer,实际系统中可以让两个架构分工——比如眼镜上的事件传感器 + SNN 负责持续感知,发现值得注意的变化时才唤醒本地或云端的 Transformer;机器人同样可以让 SNN 处理毫秒级反应,再让大模型负责规划、语言和速度较慢的推理。
  4. 谨慎看待论文中的能耗数字:检查是实测还是估算,估算依据是什么(芯片工艺、放电率等假设),是否已部署到真实硬件。
  5. 留意生态动态:训练稳定性、软件易用性、硬件可获取性和部署便利性可能比单项指标更能决定 SNN 的落地速度。

总结

  • SNN 不是什么:它不是对真实人脑的完整模拟,没有复制出真正的脑细胞机制;它也不是一种天然低功耗的技术,名字里的“脉冲”不等于自动省电。
  • SNN 是什么:它采用了大脑神经元的一部分计算原则——保存内部状态、信号随时间到达、大部分时候沉默、需要时才发放脉冲——包括内部状态、时间动态、阈值发放和事件驱动
  • SNN 的定位:这套方法不适合所有任务,却可能更适合机器人、传感器、智能眼镜和可穿戴设备中的持续感知场景。
  • SNN 与 Transformer 的关系:短期内取代 Transformer 的可能性很低;SNN 的未来可能不是消灭 Transformer,而是进入 Transformer 不擅长的地方。
  • 最终判断:人工智能不一定只能依靠越来越密集、越来越庞大的矩阵计算;模仿大脑的架构会不会成为 AI 未来的新方向还不能确定,但密集矩阵计算显然不是唯一值得尝试的路线。