Без заголовка
Увы, "семантические информационные системы" -- это будущее (далёкое?).
Точность систем анализа текста даже не 99.9%, а едва 80-90%. Перемножим на объём Консультанта Плюс...
С такой точностью представляете, какое количество ошибочных параграфов оно найдёт?
В Консультанте Плюс из-за его объёма проблема даже расставить ссылки из одного документа на другой, что уж говорить про точную разметку используемых терминов.
(При этом мне известны примеры полной разметки небольших юридических справочников)
То же самое и с curriculum learning и любым другим механизмом: как максимум, это подграф из определений толкового словаря, к которому прикреплены веб-документы, высоко отранжированные гуглом.
Вспомните проблему систем класса "never ending learning" -- ошибки накапливаются, их приходится вычищать руками чтобы хоть как-то жить дальше, например, internet cookies -- это не еда, несмотря на то, что cookies -- это печенье.
А если нужно вычищать руками -- то это значит, что происходит не самообучение, а перенос знаний, и интеллект градуируется по уровням: нужно, чтобы более интеллектуальный оператор обучал менее интеллектуального оператора.
Это фундаментальная проблема обучения на текущий момент, и поэтому пока что невозможно построить качественную неизвестную модель большого размера по известным данным, несмотря на используемые алгоритмы или удачно выбранные фичи.
>we developed a delicate iterative pipeline
Тут совсем другое: система учится сопрягать две модели (речи на входе и текста на выходе), а не строить неизвестную модель по известным данным.
В таких условиях, чем больше данных, тем лучше сопряжение. Чем лучше сопряжение, тем больше дополнительных данных для сопряжения мы можем найти.
Создаётся положительная обратная связь. Но такие системы на текущий момент почему-то не учатся до 100%, а всего лишь до 95% -- даже при огромном количестве данных, потому что нейросети обеспечивают лишь качество уровня 95%. Кстати, пока не очень понятно, почему именно. LSTM даже с лёгкостью умеют делать что-то типа "исключений из правил", успешно обрабатывая лингвистические нерегулярности, но, тем не менее, 95% качество -- это сейчас практический предел на многих, если не всех задачах.