← Машинное обучение: победы сегодня и ежедневно
Обсуждение
Читать и комментировать в ЖЖ ↗
> Из этой же серии работа с памятью -- differentiable neural computer
- а я все ждал, когда вы до него дойдете. )
Комментарий
Про achieving human parity... и аппаратное обеспечение для обучения.
"All neural networks in the final system were trained with
the Microsoft Cognitive Toolkit, or CNTK [63, 64], on a
Linux-based multi-GPU server farm. CNTK allows for flexible
model definition, while at the same time scaling very
efficiently across multiple GPUs and multiple servers. The
resulting fast experimental turnaround using the full 2000h
corpus was critical for our work.
...
[пропустим про автоматическую настройку параметров]
...
Training the acoustic models in this paper on a single GPU
would take many weeks or even months. CNTK made training
times feasible by parallelizing the SGD training with our
1-bit SGD parallelization technique [65]. This data-parallel
method distributes minibatches over multiple worker nodes,
and then aggregates the sub-gradients. While the necessary
communication time would otherwise be prohibitive, the 1-
bit SGD method eliminates the bottleneck by two techniques:
1-bit quantization of gradients and automatic minibatch-size
scaling.
...
These two techniques allow for excellent multi-GPU/server
scalability, and reduced the acoustic-model training times on
2000h from months to between 1 and 3 weeks, making this
work feasible."
(Не удивлюсь, если модель в итоге мегабайт 10-15 и может оффлайн c допустимыми задержками исполнятся на смартфонах).
И тут вопрос насчет дальнейшей масштабируемости, вперед к экзафлопсу или к экзасопу. По мере продвижения к этим вычислительным мощностям будет нарастать асинхронщина, спайковщина, байесовщина, uncertainty?
Например нейроморфный глобально асинхронный, локально (на уровне ядра) синхронный чип/плату/серверы SpiNNaker используют теперь не только для получения готовых алгоритмов, которые намайнила натуральная эволюция (на дофига квантовых частиц в качестве хардваре и за миллиарды лет времени) (имеются ввиду нейробиологические био-реалистичные симуляции) (авторы DNC из DeepMind говорят же, что DNC может послужить метафорой для нейробиологических моделей) но и для других вычислений.
Комментарий
Я обычно подчёркиваю во всех своих выступлениях, что прогресс и прорывы в любом технологическом стеке обеспечиваются прогрессом и прорывами на самых его нижних уровнях -- в случае deep learning это, конечно, уровень аппаратуры. С аппаратурой всё пока нормально происходит, через год это будет x10 на единицу потребляемой энергомощности по сравнению с текущими GPU (все эти TPU и DPU специально для нейросеток разработанные). И проектные нормы 1нм уже в плане у TMSC, чего ещё пару лет назад никто не мог думать.
Так что за аппаратными мощностями дело не заржавеет, был бы спрос. А спрос на все эти переводы-распознавания будет, куда ж он денется. Интеллект, он всем нужен, если дешёвый. А нечеловечий интеллект -- он дешёвый.
Комментарий
Да давно дошёл, просто довольно долго не было времени сесть и написать ))) Хотя, если честно, то ритм чтения у меня сорвался существенно. Но не для таких работ, ссылка на которые мне приходит по десятку каналов сразу )))
Комментарий
Спасибо за обзор, очень полезно.
Комментарий
Занятно то, что она у вас не выделена никак, будто является равноположенной другим работам.
Комментарий
может даже будут такие лего, где физическое расположение и коммутация множества FPGA чипов на плате, и самих рэк-юнитов и самих рэков будут делаться руками роботов, по мере генезиса приложения, под управлением самого приложения... (как на складах Амазона внедряются роботы, так они внедрятся и в дата-центры)
Комментарий
Про неё уже столько написано, что ой-ой, что не добавить?! Но я (вслед за Михаилом Бурцевым) ещё и MemNN не забываю, ибо там мартовские ещё публикации были, и результаты-то вполне сравнимые. Каждую пару месяцев по линии этих differentiable архитектур с памятью что-то крутое появляется и выдаёт очередной state-of-the-art (или повторяет state-of-the-art на более экономных средствах, что тоже важно). Работа кипит.
Комментарий
Там только градиенты однобитные, а не сама модель.
Про итоговую модель же сказано, что это ансамбль из 3х моделей из примерно 50М параметров в каждой. Пусть даже до 16-битных float их сожмут -- будет 50M*3*2 = 300Mб. Но в современных телефонах вполне в память влезет даже без дополнительного сжатия! (Что тоже не проблема -- раз в 5 сожмут).
Проблема в другом -- см. в комментарии ниже.
Комментарий
Ну, вообще, улучшение качества по сравнению с прошлой работой всего на 10%, а не в разы. За год.
Что, конечно, замечательно, особенно, если бы такое улучшение ещё пару годиков происходило хотя бы.
Но они произвели переоценку качества человека (кстати, то же самое два месяца назад сделал Baidu -- и тоже получил оценку качества в 1.5 раза хуже прошлых оценок!).
Итого, по их цифрам,
5.9% -- это качество аннотаций среднего человека (количество ошибок по сравнению с эталонной базой).
11.3% -- то же самое, но на второй более шумной базе.
Но я не удивлюсь, если у человека с более хорошим слухом ошибка уровня 2-3%, а у человека с более плохим -- на уровне 7-10%.
Ну и посмотрите, что за ошибки эти люди и компьютеры там допускают -- много ошибок из-за неточности и неоднозначности разметки.
Посмотрел бы я то же самое на более однозначном датасете, и особенно не на английском языке -- потому что, сдаётся мне, уже начинается подгонка под ответ.
Комментарий
10% за год -- это ой-ой! Мало кто верил, но я просто знал )))
Ну, и я согласен с переоценкой качества для людей. Мне всегда казалось, что сравнивают не со средним по больнице, а с какими-то профи (я, например, совсем не профи и у меня обычно куча ошибок -- и у многих, думаю, так же).
Я думаю да, ещё годик-два будет так же: придёт же ещё новый хард для обучения в следующем году, да и residuals только-только появились, с ними много сюрпризов ещё должно быть. Ну, и разные сжатия сетки позволят выученному легко упихнуться в телефоны (на что уйдёт ещё год-другой). То есть года через три будем беседовать с телефонами, причём к тому времени и алгоритмы работы с памятью подоспеют нормальные, так что отвечать телефоны будут не всегда невпопад, какой-то reasoning там будет "из коробки" )))
Комментарий
Сейчас, кстати, жмут и до 35-45 раз практически без потерь. Но, как всегда, "есть тонкости".
Комментарий
>10% за год
10% за год относительно своей прошлой работы (а не лучшей) на странном небольшом датасете со странным ансамблевым алгоритмом (который применяется в kaggle чтобы выжать последние проценты или доли процента -- и дальнейшего развития не имеет).
И в основном, эти 10% получены за счёт роста вычислительной мощности в 50 раз.
Это не повторить не то что каждый год, а даже на протяжении 2-3 лет.
В общем, прогресс почти остановился, получается. "Low hanging fruits" новой технологии заканчиваются. Кое-как дожали до "среднего человека" на одной конкретной подзадаче.
И ещё меня очень смущает качество более важного на практике качественного распознавания в шумах:
Изображение — открыть источник
Комментарий
И вот ещё про факторы из https://svail.github.io/mandarin/ -- ещё одно свидетельство (при)остановки прогресса в этой области:
"3.4. The limiting factor is data
Time spent on a machine-learning problem roughly falls into the following three categories: getting data, developing algorithms, and training models. One of the reasons deep learning has been so valuable is that it has converted researcher time spent on hand engineering features to computer time spent on training networks. The end-to-end learning approach for speech recognition further reduces researcher time. GPUs have added so much value because they have reduced the training time. The systems work our team has done to speed up neural network training has further reduced that. We can now train a model on 10,000 hours of speech in around 100 hours on a single 8 GPU node."
Комментарий
Я не считаю, что low hanging fruits закончились. Я думаю, что за ближайшую пару лет "средний человек" на всех задачах будет, в том числе за счёт того, что начнутся предугадывания из содержательного контекста (а не просто за счёт "хорошего анализа звука"). И с шумами (т.е. "хороший анализ звука") тоже всё подтянется. И в телефоны упихнётся, никуда не денется. Ну, можнет быть, в топовые телефоны 2018 года выпуска (телефоны-то тоже на месте не стоят).
Можно будет вернуться к этому треду осенью 2018 года. Думаю, никакого застоя и видно не будет.
Комментарий
Ну да, данных пока требуется не много, а чрезвычайно много. Тут, конечно, будут решать алгоритмы -- например, опора на байесовские методы существенно уменьшает потребность в огромных датасетов (правда, при этом нужно чутка больше вычислять, но это некритично при нынешнем росте вычислительной мощности. Мозг должен быть мощным, а не как у мышки).
Я думаю, данных будет требоваться столько же, сколько сейчас, но из этих данных будет выжато много, много больше.
Комментарий
Моя мама после дтп все время слышит шум и слова слышит через шум. Когда она слышит слово, тогда она начинает перебирать вероятные варианты. Например, при втором упоминании авторы не поставили слово corpus после 2000h. Моя мама, будучи мной, услышав 2000h, поняла бы, что это 2000h corpus, но лишь благодаря человеческому мозгу. Из чего я делаю вывод, что ML не сможет распознавать на равне с человеком зашумленные датасеты до тех пор, пока не сравнится с человеком по энтропии алгоритмов мозга (если можно так сказать), т.е. пока система не сможет понять статью хотя бы поверхностно (а может даже, основываясь на этих знаниях, сделать себе реинжиниринг).
Комментарий
>например, опора на байесовские методы существенно уменьшает потребность в огромных датасетов
Расскажите мне, как это применить к звуку.
Комментарий
Я думаю, что это не буду рассказывать. Там много интересных работ сейчас идёт, по факту байесовская статистика скоро будет входным билетом в машинное обучение не меньше, чем линейная алгебра. И к звуку это, конечно, тоже будет приложимо.
Комментарий
Еще на счет хардваре. Вот Yoshua Bengio обновил работу про e-prop (equilibrium propagation). И пишет:
We lay down the basis for a new framework for machine learning. In this framework the quantities of interest (the
prediction and the objective function) are defined, in terms of the data and the parameters of the model, implicitly through
an energy function, rather than explicitly (like in a feedforward net). This implicit definition involves the minimization of
an energy function. This makes applications on digital hardware (such as GPUs) less practical as it needs long inference
phases involving numerical optimization. But we expect that this framework could be extremely efficient if implemented
by analog circuits, as suggested by Hertz et al. (1997).
The framework presented in this section is deterministic, but a natural extension to the stochastic case is presented in
the Appendix B.
https://arxiv.org/abs/1602.05179
Вот и думаешь, что надо программировать на вязальных машинках, которые будут вязать аналоговые дендриты/нейроны
Изображение — открыть источник
F1.Schematic of biological NN and an ONW ST (organic nanowires synaptic transistor) that emulates a biological synapse
http://advances.sciencemag.org/content/2/6/e1501326.full