Без заголовка
Интересно, что в плане deep learning здесь многое перекликается с тем что делает Google.
На днях вышел выпуск подскаста TWIMLAI с Jeff Dean. https://twimlai.com/twiml-talk-124-systems-software-machine-learning-scale-jeff-dean/
Jeff тоже говорит что интересный (хотя и сложнопредсказуемый) прогресс переходит в область архитектуры компьютеров. Там много возможностей, потому что непонятно какие архитектуры выиграют.
Они начали с TPU для inference, потому что это проще, легко масштабировать. Но TPU v2 - он для тренировки, и масштабирование там существенно сложнее т.к. одного чипа мало. В итоге они сделали что-то по уровню похожее на DGX-2: 64 TPU объединенные в один pod, с высокоскоростной сетью передачи данных между ними. "A 64-TPU pod can apply up to 11.5 petaflops of computation to a single ML training task."
При этом, они не торопятся делать рискованные эксперименты с кардинальным изменением чипов (например, попробовать quantied 4-bit operations вместо 8-bit), т.к. цена ошибки высока: если чип проектируется сейчас, то он выйдет из фаба через 2 года и должен поработать в датацентре еще года три. Соответственно, чип должен быть способен поддержать алгоритмы которые будут использоваться через 2-5 лет.
Еще интересно, что Jeff видит преимущество в том что у них вертикальная интеграция: TPU, TensorFlow и рисёрчеры которые этот софт пользуют. Это позволяет быстрее итерировать.