ailev.ru

26 февраля 2014 · Комментарий

Без заголовка

На первых порах нам нужно просто существенно ограничить набор входных данных (как минимум, для хакатона). Потом же работа может быть итеративной: путём вытеснения менее надёжных источников более надёжными. Поэтому я бы озаботился сейчас не столько "достоверными источниками данных", сколько "достоверным набором концептов". Нужно, например, решить "роли озвучивали", "сейю" и "актёр" это синонимы, или "сейю это актёр озвучки из Японии" (а американский актёр озвучки это уже не сейю, плюс это необходимость приписывания гражданства людям). Ну, и так далее, по концепту за раз. То есть на первых порах нас интересуют "схемы данных", а не сами данные -- с точностью до замечания, что про схемы часто можно узнать только после анализа тех данных, которые они описывают, ибо разработчики схем не отличаются особой страстью к документированию своих решений. Ну, и нужно не забывать, что в отличие от базоданческой парадигмы closed world у нас онтологическая open world, это означает, что добавлять новую информацию будет необременительно. Сначала ограниченный набор данных, а потом пусть всё пухнет.

К записи · К обсуждению