Без заголовка
>а) аннотировать можно ещё и типами, не только частями речи. IBM Watson использует какую-то онтологию простенькую для этого, качество ответов вырастает существенно.
Качество каких именно ответов вырастает?
IBM Watson не является единой системой -- это скорее набор баз данных и библиотек, решающих разные задачи.
Например, синтаксический анализ Watson не использует embeddings и реализует подход, основанный на правилах и классификаторах объектов разных типов.
Так же, как и ЭТАП-3, Compreno, и куча других продвинутых систем с многолетней историей.
Онтология в нём -- это классификаторы объектов, кажется, говорилось про порядка 50 основных классификаторов. В каждом сотни тысяч лингвистических единиц. "Если взять онтологию из хотя бы 200 понятий" -- вы имеете в виду, взмахом руки заполнить ещё 200 классификаторов такого же размера? У вас есть лишние $20 млн долларов? (из расчёта один человеко-год на один вручную заполняемый классификатор)
Да и всё равно "в разы" не получится, потому что компьютер не строит модель мира, стоящую за текстом.
б) "разворачиваться" NVIDIA может сколько угодно, но на практике рост скорости на единицу мощности пока что был едва ли 1.3 раза в год -- 1 ГФлопс на видюшке был уже в 2008м ( http://www.overclockers.ru/images/soft/2014/03/24/dx/nvidia_1_big.jpg ) , сейчас их 7, теперь предлагаете просто постоять и подождать 20-30 лет? И это если получится техпроцесс улучшать -- с обычными процессорами мы уже упёрлись в бутылочное горлышко фон-неймановской архитектуры, получив увеличение скорости в 2 раза за 5 лет -- и, скорее всего, оно предпоследнее! На видюшках ожидается ускорение от силы в 4 раза за ближайшие 5 лет, они упрутся в скорость видеопамяти, в шины PCI-E и NVLink.
Я говорю о другом -- метод грубой силы может и должен использоваться только при избытке вычислительной мощности и неумении строить оптимизированные модели под конкретную задачу.
В данной ситуации скорее проблема в том, как при недостатке вычислительной мощности построить эффективные легкоподдерживаемые подсистемы, грамотно использовать доступную обратную связь для увеличения их качества и построить в итоге сложную систему, достигающую действительно отличных результатов.
Вы правильно определяете проблему: на текущий момент вся сложность именно в накоплении и использовании обратной связи. Компьютеры глупые, потому что обычные люди не умеют их учить, а компьютеры плохо умеют учиться. (Если бы компьютеры пытались выполнить человеческую работу, то, может, они бы строили модели мира, объединяли их и становились умнее -- но в рамках текущего разделения обязанностей, компьютеры не выполняют те же действия, что и люди, поэтому модели мира у компьютеров донельзя примитивны.)