Без заголовка
А есть подход, который нормально делит память среди нейронов \ слоёв (так чтобы минимизировать обращения к чужой памяти с каждого процессора)? Ведь вам-то без разницы где узкое место в ALU или MMU.
На современных процессорах они настолько близки, что на простой Core на 1м процессоре можно упереться в DDR-4 если постараться (без использования SSE в вообще SIMD-инструкций).