Без заголовка
Моя мысль в том, что параллелизм и асинхронность должны просто встраиваться в компилятор, который должен выдавать код куда-нибудь сразу в CUDA, а не код для традиционного CPU, а хоть и со многими ядрами. Ибо жизнь поменялась. А там уж какие языки эту поддержку в себя встроят, те и победят. В Julia тоже есть примитивы параллельного программирования. Но в от для CUDA они дорабатывали бэкенд компилятора, в этом фишка, а не в самом языке.