ailev.ru

9 июня 2016 · Комментарий

Без заголовка

Мне лично, в плане освоения лёрнинга, весьма полезно оказалось знакомство с методами нелинейной оптимизации. Нейросеточникам, конечно, по большому счету по барабану, ибо они юзают SGD той или иной вариации. Но вот чтобы асилить статьи по HF или K-FAC, необходимо иметь неплохую базу в нелинейной оптимизации, которая с потолка не берется. Ну а тем кто не только нейросетками занимается, нелинейную оптимизацию тем более знать нужно. Уж по крайней мере, Newton-Raphson, Gauss-Newton, Levenberg-Marquardt, BFGS/L-BFGS, может Conjugate Gradient. Ну т.е. на практике обычно юзается L-BFGS или LM, но Newton/Gauss-Newton для них базовые. Как кто-то писал, основные идеи немалого кол-ва научные статей можно описать как AutoDiff+L-BFGS :). Ну т.е. преобразование задачи в проблему оптимизации, ну и решение ее достаточно стандартными методами. В некоторых областях стандартным является Levenberg-Marquardt, так что его тоже знать полезно. А в хорошей научной статье, задача оптимизации ставится два-три раза :).

К записи · К обсуждению