А вот не соглашусь. Исключений, конечно, полно -- но тренд именно в том, что все "ключевые догадки" обычно уже подтверждаются экспериментом, и эксперименты показывают мощь догадки и что эта догадка улучшает.
Прямо скажем, что скорость, стоимость и точность feedback loop - не заслуга области, а подарок судьбы, которым пришлось пользоваться или вон из профессии. В большинстве областей это невозможно в принципе (и без принципа) - вон, инициативы медицинские привели к тому, что по проблеме лечения рака тоже общаются в режиме реального времени, если я правильно помню. Однако при условии необходимости для фидбэка хотя бы мышей и месяцев - такую скорость не разовьешь.
>>gitxiv.org
gitxiv.com
Спасибо за ссылку, раньше не видел.
Кстати, код и данные дают в публичный доступ далеко не всегда. Например, в последней работе гугла про image classification на 300 миллионах каинок, они полбзуют приватный датасет. https://research.googleblog.com/2017/07/revisiting-unreasonable-effectiveness.html
А в коде "sentiment neuron" работы они не включили код для тренировки, опубликовали только код для inference. https://github.com/openai/generating-reviews-discovering-sentiment Но, надо сказать, очень быстро находятся добровольцы которые пишут на основе пэйпера код и публикуют его.
Ой, конечно .com -- писал в поезде без интернета и в беспамятстве )))
Код и данные дают очень и очень часто, просто иногда делают (по соглашению с фирмой) задержку в полгода кода и данных по сравнению со статьёй. Так сказать, ищут компромисс академических и бизнес-интересов.
Опыт системной и программной инженерии показывает, что сначала что-то в организационной действительности появляется там, где работают с битами (и все кричат, что с железом номер не пройдёт), а с лагом 10-15 лет эти же принципы как-то ухитряются начинать применять и к железным проектам. Так что и с мышами будут изменения, никуда не денутся.
> если ты не применил новый способ, получающий state-of-the-art по точности или производительности, то нет предмета публикации (и тут вечные споры конечно, тем не менее).
Это правда для конференций, и то пожалуй не для всех.
> мало дать формулы, нужно ещё опубликовать код, и указать набор данных, чтобы люди могли повторить.
Reproducability это огромная проблема в DL, а никак не обязательное условие.
> интернет не даёт всем опубликованным новинкам потеряться, плюс добавляет широкие возможности по обсуждению мимо конференций и формальных peer review, популярностью пользуются несколько еженедельных newsletters с "супер-пупер-новинками" -- и крутых новостей за неделю набегает более чем достаточно.
Хорошая статья на arxiv'e может спокойно потеряться, и быть замечена только после публикации на конференции.