CUDA toolkit profilier
写这个记录的时候,cuda已经不再支持nvprof,nvvp也变得异常难用(因为很多功能,比如metrics,去掉了)。现在推荐用nsight compute,这个工具分为gui和cli版本。
先从cli入手吧,gui我试了一下,花里胡哨的乱七八糟。
第一步
将nsight compute的可执行文件添加到path
gld_efficiency gst_efficiency
高性能的全局内存访问是指每条请求所执行的内存事务数量尽可能小。
每个线程加载4字节内存,一个warp加载128字节内存。
https://developer.nvidia.com/blog/using-nsight-compute-to-inspect-your-kernels/