Без заголовка
При этом сама работа NALU нигде-нигде не обсуждается как аппаратная основа реализации ALU. Обсуждается теоретический вопрос: как выбор функции активации (одной из десятков и десятков) в качестве явного innate prior влияет на результаты обучения. Ответ: влияет, и сильно. Показано на простейшем примере: выучиваемость понятия числа, с которым возможны какие-то операции. Замечу, что первый эксперимент с глубокой сетью было выучивание XOR, это доказывало некоторые теоретические свойства сети. Никому и в голову не приходило делать гейты XOR на глубоких сетях. Идёт обсуждение про реализацию в кремнии NALU, а при чтении материала про выучивание XOR глубокой сеткой такого обсуждения не было?
Вот справочная первая попавшаяся на глаза ссылка на работу по этому XOR -- тысячи их, https://medium.com/@jayeshbahire/the-xor-problem-in-neural-networks-50006411840b. А теперь появилась работа по NALU, из того же ряда. Без малейшего намёка на то, что это будет использовано для аппаратных реализаций именно ALU. Но говорится, что при работе с аппаратными реализациями вид активационной функции оказывается важным и нельзя считать какие-то решения универсальными для разных типов задач. Innate priors важны, от них нельзя отмахнуться.