ailev.ru

Обсуждение

В архиве: 5 комментариев.

Читать и комментировать в ЖЖ ↗

Имя не сохранено · 19 сентября 2015

Комментарий

Хотя похоже с БД поноценно работать без ГУ невозможно...

Имя не сохранено · 19 сентября 2015

Комментарий

Кстати, помимо нейросеток развивается еще и такое направление в машин лёрнинге как Gaussian Process/Kernel methods - вот к примеру свежие и интересные работы http://www.cs.cmu.edu/~andrewgw/pattern/ Там есть про масштабируемые алго для больших объемов данных (традиционная слабость Kernel Methods ибо O(n^3)) и более гибкие kernels, по сути способные выучивать фичи. Мне лично GP или там линейные алго несколько ближе чем нейросетки, в силу того, что нейросетки неинтерпретируемы. Ну и кагбэ последние работы говорят что GP/Kernel methods не обязательно медленные. А выразительность GP в плане выучивания сложных моделей тоже по сути ограниченна скоростью работы (ну т.е. при O(n^3) далеко не уедешь).

Анатолий Левенчук · 19 сентября 2015

Комментарий

Идущий за мной докладчик на BigData прямо сказал тезис "чем больше данные, тем более простые могут быть алгоритмы", который общий и для бигдатовцев (они как раз про shallow learning) и deep learning (для которых "ихняя бигдата" просто "небольшая обучающая выборка", см. http://habrahabr.ru/company/meanotek/blog/266961/ -- я именно этот текст с уводящим от сути дела названием помянул в своём выступлении). А вообще, kernel trick и в deep learning набирает популярность. И простейшие передаточные функции (вместо хитрого сигмоида тупой ReLU). А shallow learning норовят применить последовательно пару раз (даже без back propagation, но и там есть свои заморочки), или даже тройку раз. Буйно восцветают сто цветов, но все они клонятся в сторону не "определения фич", а "выучивания". Опять же, герменевты много говорят об "интерпретируемости". Один из вариантов тут -- привыкать к новым найденным фичам, давать им имена, понимать отношения между ними, и дальше демонстрировать "понимание" в терминах этих новых фич. Что-то такое с нейросетками уже начинают делать (особенно этим любят заниматься со свёрточными сетями и изображениями -- глаз смотрит, прикидывает, что это за фича, называет её, далее объявляем элементом онтологии и уже объясняем мир в её терминах. Все довольны). Восхитительное время, смена парадигмы. Относительно быстро, как когда-то с квантовой механикой и теорией относительности.

Ответ на комментарий

Имя не сохранено · 20 сентября 2015

Комментарий

я вот все чаще замечаю, что не только подходы к машин лёрнингу основываются на наших представлениях о работе мозга (тут можно не только нейросетки вспомнить, но и байесов подход и фреймы) но и парадигмы лёрнинга влияют на наше мышление - включая к примеру теор вер. ну по крайней мере, я еще когда с теорией типов и Coq разбирался, я заметил что это изменило мое мышление и восприятие мира потом более близкое знакомство с теор вером, с байесовским подходом, нейросетками и проч потихоньку меняет восприятие мира - на долгом периоде это чувствуется тут еще Талеба можно вспомнить :)

Ответ на комментарий

Имя не сохранено · 20 сентября 2015

Комментарий

Интересный вопрос, кстати, почему ReLU стал юзаться совсем недавно, ведь он проще, вычисляется быстрее, дает лучше результаты, не насыщается как сигмоида (что для трени многослойных сеток актуально). Единственная проблема - и видимо была самая существенная - у него производная разрывна, т.е. градиентные алго могут не катить и нужны субградиентные, что видимо и отпугивало исследователей. Хотя тот же L. Bottou показал что SGD можно вполне юзать для трени SVM (с похожим на ReLU hinge loss). Возможно, это был одна из работ что создала предпосылку для использования ReLU. Ну т.е. моя гипотеза что народ строго ориентировался на функции с непрерывной производной, а субградиентные алгоритмы - это была отдельная тема, которой занимались отдельные люди. Ну и плюс важность sparsity тоже была осознанна относительно недавно

Ответ на комментарий