Без заголовка
Мне лично, в плане освоения лёрнинга, весьма полезно оказалось знакомство с методами нелинейной оптимизации.
Нейросеточникам, конечно, по большому счету по барабану, ибо они юзают SGD той или иной вариации. Но вот чтобы асилить статьи по HF или K-FAC, необходимо иметь неплохую базу в нелинейной оптимизации, которая с потолка не берется.
Ну а тем кто не только нейросетками занимается, нелинейную оптимизацию тем более знать нужно. Уж по крайней мере, Newton-Raphson, Gauss-Newton, Levenberg-Marquardt, BFGS/L-BFGS, может Conjugate Gradient.
Ну т.е. на практике обычно юзается L-BFGS или LM, но Newton/Gauss-Newton для них базовые.
Как кто-то писал, основные идеи немалого кол-ва научные статей можно описать как AutoDiff+L-BFGS :). Ну т.е. преобразование задачи в проблему оптимизации, ну и решение ее достаточно стандартными методами. В некоторых областях стандартным является Levenberg-Marquardt, так что его тоже знать полезно.
А в хорошей научной статье, задача оптимизации ставится два-три раза :).