ailev.ru

20 сентября 2015 · Комментарий

Без заголовка

Интересный вопрос, кстати, почему ReLU стал юзаться совсем недавно, ведь он проще, вычисляется быстрее, дает лучше результаты, не насыщается как сигмоида (что для трени многослойных сеток актуально). Единственная проблема - и видимо была самая существенная - у него производная разрывна, т.е. градиентные алго могут не катить и нужны субградиентные, что видимо и отпугивало исследователей. Хотя тот же L. Bottou показал что SGD можно вполне юзать для трени SVM (с похожим на ReLU hinge loss). Возможно, это был одна из работ что создала предпосылку для использования ReLU. Ну т.е. моя гипотеза что народ строго ориентировался на функции с непрерывной производной, а субградиентные алгоритмы - это была отдельная тема, которой занимались отдельные люди. Ну и плюс важность sparsity тоже была осознанна относительно недавно

К записи · К обсуждению