triton.experimental.gluon.language.amd.cdna5.async_copy.shared_to_global

triton.experimental.gluon.language.amd.cdna5.async_copy.shared_to_global(pointer, smem, mask=None, cache_modifier='', _semantic=None)

Asynchronously copy elements from shared memory to global memory.

Requires manual syncronization via wait_group() before accessing the stored data.

Parameters:
  • pointer (tensor) – Destination pointer tensor.

  • smem (shared_memory_descriptor) – Source shared memory descriptor.

  • mask (tensor, optional) – Mask tensor for predicated stores. Defaults to None.

  • cache_modifier (str) – Cache modifier specifier. Defaults to “”.