19 октября 2016 · Комментарий

Без заголовка

Про achieving human parity... и аппаратное обеспечение для обучения. "All neural networks in the final system were trained with the Microsoft Cognitive Toolkit, or CNTK [63, 64], on a Linux-based multi-GPU server farm. CNTK allows for flexible model definition, while at the same time scaling very efficiently across multiple GPUs and multiple servers. The resulting fast experimental turnaround using the full 2000h corpus was critical for our work. ... [пропустим про автоматическую настройку параметров] ... Training the acoustic models in this paper on a single GPU would take many weeks or even months. CNTK made training times feasible by parallelizing the SGD training with our 1-bit SGD parallelization technique [65]. This data-parallel method distributes minibatches over multiple worker nodes, and then aggregates the sub-gradients. While the necessary communication time would otherwise be prohibitive, the 1- bit SGD method eliminates the bottleneck by two techniques: 1-bit quantization of gradients and automatic minibatch-size scaling. ... These two techniques allow for excellent multi-GPU/server scalability, and reduced the acoustic-model training times on 2000h from months to between 1 and 3 weeks, making this work feasible." (Не удивлюсь, если модель в итоге мегабайт 10-15 и может оффлайн c допустимыми задержками исполнятся на смартфонах). И тут вопрос насчет дальнейшей масштабируемости, вперед к экзафлопсу или к экзасопу. По мере продвижения к этим вычислительным мощностям будет нарастать асинхронщина, спайковщина, байесовщина, uncertainty? Например нейроморфный глобально асинхронный, локально (на уровне ядра) синхронный чип/плату/серверы SpiNNaker используют теперь не только для получения готовых алгоритмов, которые намайнила натуральная эволюция (на дофига квантовых частиц в качестве хардваре и за миллиарды лет времени) (имеются ввиду нейробиологические био-реалистичные симуляции) (авторы DNC из DeepMind говорят же, что DNC может послужить метафорой для нейробиологических моделей) но и для других вычислений.

К записи · К обсуждению