CUDA GPU 架构可视化

Flash Attention Kernel 执行流程模拟
CUDA LIVE

执行阶段

准备就绪

性能指标

SM 占用率 0%
HBM 带宽利用率 0 GB/s
L2 Cache 命中率 0%
计算吞吐量 0 TFLOPS

图例

CPU / Host
HBM (Global Memory)
L2 Cache
Shared Memory (SMEM)
Register File
Streaming Multiprocessor (SM)
Warp (32 Threads)
Thread
数据包 (Data Packet)

事件日志

Step 0 / 8