Без заголовка
Фишка в том, что в разных источниках информация разная и структурирована по-разному. Так что "мамы всякие нужны, мамы всякие важны". В результате у нас должен быть прототип интеграции данных с семантической публикацией. Это очень, очень хитро и там внутри есть несколько совсем современных технологий:
-- создание RDL в публикуемом формате, который может быть прочтён разными программными стредствами. Там внутри и словарь, и описание данных и много чего ещё. Именно тут нужно знание о предметной области (так, именно сюда нужно класть понятие ОЯШ или moe). И именно тут нужно понимать про 4D и possible worlds.
-- управляемый паттернами и RDL мэппинг структурированных и неструктурированных данных из API и различных datasets (ибо не все данные в онлайне, "бывают и просто файлы") в машинночитаемый семантический формат. Семантический -- это когда у каждого элемента данных есть URI, и по этому URI про этот элемент можно что-то узнать в Сети (дереференсинг).
-- семантическая публикация данных (обеспечение того самого дереференсинга). Если просто напечатать человекочитаемый текст, то семантика потеряется. Поэтому нужно напечатать так, чтобы поисковые машины прочли машинное, а люди прочли текстовое.
Сегодня все эти технологии работают по кусочкам в разных инструментах, ими владеют разные команды. А у нас будет показана полная цепочка. Cool!
Дальше много путей развития:
-- наращиваем RDL, получаем супер-пупер-гипер-глоссарий предметной области, что уже неплохо.
-- наращиваем число федерируемых ресурсов
-- наращиваем число типов генерируемых страниц, получаем всё более осмысленные ответы на наши вопросы
-- заставляем программу "думать" (включаем статистический и логический вывод).
Но это уже потом, пока же нужно хотя бы 10 элементов данных взять по 5 штук из каждой из двух онлайн баз и прогнать по всей цепочке до публикации. Это я хотел бы иметь до дня хакатона! Это и есть "подготовка" :-)