27 февраля 2014 · Комментарий

Без заголовка

Фишка в том, что в разных источниках информация разная и структурирована по-разному. Так что "мамы всякие нужны, мамы всякие важны". В результате у нас должен быть прототип интеграции данных с семантической публикацией. Это очень, очень хитро и там внутри есть несколько совсем современных технологий: -- создание RDL в публикуемом формате, который может быть прочтён разными программными стредствами. Там внутри и словарь, и описание данных и много чего ещё. Именно тут нужно знание о предметной области (так, именно сюда нужно класть понятие ОЯШ или moe). И именно тут нужно понимать про 4D и possible worlds. -- управляемый паттернами и RDL мэппинг структурированных и неструктурированных данных из API и различных datasets (ибо не все данные в онлайне, "бывают и просто файлы") в машинночитаемый семантический формат. Семантический -- это когда у каждого элемента данных есть URI, и по этому URI про этот элемент можно что-то узнать в Сети (дереференсинг). -- семантическая публикация данных (обеспечение того самого дереференсинга). Если просто напечатать человекочитаемый текст, то семантика потеряется. Поэтому нужно напечатать так, чтобы поисковые машины прочли машинное, а люди прочли текстовое. Сегодня все эти технологии работают по кусочкам в разных инструментах, ими владеют разные команды. А у нас будет показана полная цепочка. Cool! Дальше много путей развития: -- наращиваем RDL, получаем супер-пупер-гипер-глоссарий предметной области, что уже неплохо. -- наращиваем число федерируемых ресурсов -- наращиваем число типов генерируемых страниц, получаем всё более осмысленные ответы на наши вопросы -- заставляем программу "думать" (включаем статистический и логический вывод). Но это уже потом, пока же нужно хотя бы 10 элементов данных взять по 5 штук из каждой из двух онлайн баз и прогнать по всей цепочке до публикации. Это я хотел бы иметь до дня хакатона! Это и есть "подготовка" :-)

К записи · К обсуждению