ailev.ru

1 июня 2012 · Комментарий

Без заголовка

Семантическую модель не построить автоматически без качественного синтаксического и морфологического анализа. Некоторые задачи находятся на интересующем вас стыке. Например: - "Технология Compreno также успешно определяет и более сложные синтаксические связи, такие как замена слова «мальчик» на слово «он» в предложении (для специалистов: анафора): «Хоть мальчик и хотел поиграть, но он понимал, что у него мало времени»." http://www.abbyy.ru/science/technologies/business/compreno - "Результатом анализа предложения (цепочки предложений) должен быть не только синтаксический граф, но и набор подтвержденных гипотез типа "А.С.Пушкин=ФИО", "12.05.2012=Дата". При переходе от анализа изолированных предложений к полнотекстовому анализу в текущем контексте должны также раскрываться гипотезы типа "он=А.С.Пушкин"". http://kelijah.livejournal.com/45529.html Как я понимаю, для solarix и NLTK такие задачи - это "потолок", а для compreno и ontos - "линия старта". Проблема "тусовочной" разработки обычно заключается в слабой проработке или закрытости "данных" при неплохом качестве "кода". Чаще всего ценными для практического применения наработками, полученными на базе открытого кода, не делятся или показывают их ограниченному кругу лиц. Поэтому у NLTK движок может быть и конкурирует, но сравнивать нужно по качеству результата для русского языка, которое определяется базой правил разбора.

К записи · К обсуждению