+−⟲ Gemm RS 1. tile-level计算2. 发起TMA操作st到symm mem 3. TMA结束后利用relaxed.sys对flag+1(不能atomicAdd因为是跨进程) 1. 判断该tile是否为本rank shard2. 若是,等待flag的counter为ws 3. 发起multimem.ld.reduce4. 块内规约计算该tile的norm部分和放入GMEM中5. 对每个m_Tile的tile_m_counter调用atomicAdd计数+1 Norm 1. 自旋等待tile_m_counter计数到达N / nTile2. 将对应的