单位时间内内存与芯片可传输的数据量。
算力再猛,也怕数据堵车;内存带宽就是那条主干道,路一堵,GPU 只能原地空踩油门。
它常卡住推理速度,尤其影响参数读取和生成 token 的效率。
VRAM
VRAM 是数据仓库,Memory bandwidth 决定搬运有多快。
Inference
推理不只看算力,常被 Memory bandwidth 卡住节奏。
Tokens-per-second
带宽越吃紧,TPS 越容易碰到天花板。
Flash Attention
Flash Attention 通过减少访存压力来绕开带宽瓶颈。