Без заголовка
Ну да, данных пока требуется не много, а чрезвычайно много. Тут, конечно, будут решать алгоритмы -- например, опора на байесовские методы существенно уменьшает потребность в огромных датасетов (правда, при этом нужно чутка больше вычислять, но это некритично при нынешнем росте вычислительной мощности. Мозг должен быть мощным, а не как у мышки).
Я думаю, данных будет требоваться столько же, сколько сейчас, но из этих данных будет выжато много, много больше.