并发与调度
影响 高
多 stream 却不并发 —— 逻辑 stream 抢占物理硬件队列
代码里开了很多 CUDA stream,但 Nsight 时间线上 kernel 首尾相接、几乎没有重叠,多流优化完全没有收益
Nsight Systems · nvidia-smi
2026-08-07
每个案例记录一种瓶颈模式:怎么看出来、为什么会这样、怎么改。
代码里开了很多 CUDA stream,但 Nsight 时间线上 kernel 首尾相接、几乎没有重叠,多流优化完全没有收益
GPU 利用率看起来不低,但时间线上密密麻麻全是几微秒的小 kernel,kernel 之间有稳定间隙,总耗时远大于各 kernel 耗时之和
没有匹配的案例。