triton.experimental.gluon.language.amd.cdna5.async_copy.shared_to_global
- triton.experimental.gluon.language.amd.cdna5.async_copy.shared_to_global(pointer, smem, mask=None, cache_modifier='', _semantic=None)
Asynchronously copy elements from shared memory to global memory.
Requires manual syncronization via
wait_group()before accessing the stored data.- Parameters:
pointer (tensor) – Destination pointer tensor.
smem (shared_memory_descriptor) – Source shared memory descriptor.
mask (tensor, optional) – Mask tensor for predicated stores. Defaults to None.
cache_modifier (str) – Cache modifier specifier. Defaults to “”.