ailev.ru

3 августа 2015 · Комментарий

Без заголовка

>Токенизаторы разные понятно почему: там идеологическая фишка такая, что для разных обработок нельзя текст прекодировать (например, разбивать на токены), потому как для разных вопросов любое сжатие (предобработка текста -- это его сжатие) теряет какую-то информацию, предположительно важную для ответа Да нет конечно -- для ответа информация не настолько важна -- теряется в разы больше информации, она важна для дальнейших методов обработки. Модели настраивать -- очень сложная задача. А теперь представьте, что одна модель построена и протестирована с запятыми, вторая без запятых, третья в нижнем регистре, четвёртая с апострофом присоединённым к левому слову, пятая точки добавляет, ещё в пяти стоп слова разные пропускаются, итп. Не уберёте запятые -- а в модели запятых нет -- и модель сломается или будет выдавать неправильные результаты. Можно было бы переучить/перенастроить, но это огромный труд. Поэтому я онтологии и припоминаю -- многие видели в них спасение от именно таких проблем с разными толкованиями, ведь вроде бы вместо (N)*(N-1) конвертеров можно написать по онтологии для каждого представления, а дальше компьютер сам между ними научится преобразовывать данные. >CYC наиболее продвинулся в этом направлении ага, обогнали своё время лет на тридцать.

К записи · К обсуждению