ailev.ru

3 августа 2015 · Комментарий

Без заголовка

"Никакими онтологиями это не исправить" -- в Watson онтологии используются очень боком, только для улучшения качества ответа при подведении под сознательно маленький набор этих типов. Токенизаторы разные понятно почему: там идеологическая фишка такая, что для разных обработок нельзя текст прекодировать (например, разбивать на токены), потому как для разных вопросов любое сжатие (предобработка текста -- это его сжатие) теряет какую-то информацию, предположительно важную для ответа. Поэтому любая работа всегда с голым текстом. Отсюда и разные токенизаторы, особенно если учесть то, что они во всяких Jeopardy! вынуждены были учитывать разную игру слов, и поэтому с токенизаторами, которые могли бы отсекать эту игру слов, они осторожны заранее. Насчёт преобразования процедурного знания, так и непроцедурное тоже тяжело преобразовывать, только по другим причинам. ))) Отлаживать непроцедурные экспертные системы тоже было тяжело, хотя и не нужно было точно знать точку в тексте, куда вставлять дополнительную продукцию. Даже при полностью аддитивном модульном декларативном знании есть проблема вставки махонького факта, который переворачивает всю систему этих знаний -- и все прекомпиляции нужно опять-таки выкидывать на помойку (https://en.wikipedia.org/wiki/Belief_revision). CYC наиболее продвинулся в этом направлении, заведя механизм микротеорий, но там опять-таки пока ручное кодирование, а это уже очевидный тупик. Они это понимают, и пытались взлететь на самостоятельное чтение текстов для обучения программой, но воз и ныне там (план был выйти на это ещё в 2001 году).

К записи · К обсуждению