triton.experimental.gluon.language.amd.cdna5.async_copy.global_to_shared

triton.experimental.gluon.language.amd.cdna5.async_copy.global_to_shared(smem, pointer, mask=None, other=None, cache_modifier='', _semantic=None)

Asynchronously copy elements from global memory to shared memory.

Requires manual syncronization via wait_group() before accessing the loaded data.

Parameters:
  • smem (shared_memory_descriptor) – Destination shared memory descriptor.

  • pointer (tensor) – Source pointer tensor.

  • mask (tensor, optional) – Mask tensor for predicated loads. Defaults to None.

  • other (tensor or scalar, optional) – Tensor or scalar providing default values for masked elements. Defaults to None(0).

  • cache_modifier (str) – Cache modifier specifier. Defaults to “”.