Я думаю, что "глоссарная составляющая" (мультиязычная, с толкованиями) должна быть составной частью Reference Data Library.
Вообще, тут три дисциплины:
-- моделирование данных, как в Kimball «Data Warehouse Toolkit» и у всей остальной датабазной тусовки
-- тезаурусы и далее по лингвистической линии моделирования понятий (WordNet и прочие)
-- онтологическая линия (ISO 15926, DOLCHE, COSMO и т.д.).
По замыслу Ontology Summit 2014 мы должны навести мосты между разными комьюнити (в частности, между датабазным моделированием данных и онтологическим моделированием), что непосредственно является целью проекта. Т.е. мы понимаем, что исходные данные у нас сделаны датабазно, а конечные данные у нас будут онтологичны. Предложение сделать "словари сленга" неминуемо залезает и в лингвистические комьюнити с их пониманием "широты-узины понятий" (в отличие от "общности-специализации понятий" в онтологической парадигме).
Вся эта работа не на leading edge, а на bleeding edge, ещё более переднекраевая, чем может показаться. Завтра будет доклад по проекту онтологической тусовке: http://ontolog.cim3.net/cgi-bin/wiki.pl?ConferenceCall_2014_02_27, прямо первым номером в программе.
Структурированные словари нужны не столько для лингвистики, а сколько для вытаскивания семантики из неструктурированного текста. Источники информации - это только на нижнем техническом уровне базы данных. В полях таблиц - полный бардак.
Там предложили ещё посмотреть authority files http://viaf.org/ и http://www.dnb.de/EN/gnd как источник информации по создателям манги. Хотя мне не понятно, что с этим делать.
Кстати, не понятно, как и в каком формате это будет происходить. В Берлине, например, люди просто собираются и есть время и место. Правда, не видно линков на приведённые тут страницы хакатона.
На первых порах нам нужно просто существенно ограничить набор входных данных (как минимум, для хакатона). Потом же работа может быть итеративной: путём вытеснения менее надёжных источников более надёжными. Поэтому я бы озаботился сейчас не столько "достоверными источниками данных", сколько "достоверным набором концептов". Нужно, например, решить "роли озвучивали", "сейю" и "актёр" это синонимы, или "сейю это актёр озвучки из Японии" (а американский актёр озвучки это уже не сейю, плюс это необходимость приписывания гражданства людям). Ну, и так далее, по концепту за раз. То есть на первых порах нас интересуют "схемы данных", а не сами данные -- с точностью до замечания, что про схемы часто можно узнать только после анализа тех данных, которые они описывают, ибо разработчики схем не отличаются особой страстью к документированию своих решений.
Ну, и нужно не забывать, что в отличие от базоданческой парадигмы closed world у нас онтологическая open world, это означает, что добавлять новую информацию будет необременительно. Сначала ограниченный набор данных, а потом пусть всё пухнет.
При распухании может наступить полный бардак. Особенно, если работа коллективная.
Структурированные словари как раз и годятся, чтобы не изобретать велосипед, а использовать уже устоявшиеся связи.
Обычно вводят следующую терминологию: словарь как просто список слов (включая глоссарий -- с толкованиями), таксономия (словарь с прописанными иерархическими отношениями род-вид), тезаурус (прописан некоторый не слишком большой список отношений), онтологии (отношений много разных).
Особенностью подхода также является работа со множеством альтернативных иерархий классов классов (классификаторов) по разным типам отношений, что даёт возможность разбираться с бардаком согласно положениям системного подхода: что является бардаком для одного стейкхолдера с позиций его деятельности будет крайне удобно и упорядоченно для другого деятеля с позиций его деятельности.
Собственно, онтологическая парадигма как раз и является ответом на variety (в volume, velocity, variety) в BigData, потому как позволяет управляться с бардаком. Но, конечно, этот аппарат чуть посложней, чем в обычном моделировании данных, ибо ничего не даётся бесплатно.
>> эксель-таблички, CSV
сейчас "из коробки" доступен только xlsx? что-то как-то не могу пока найти именно доступ к csv...
P.S. несколько потерял нить: мероприятие которое произойдет завтра предполагает какую то форму личного присутствия, как было в прошлом году, или полностью переехало в оффлайн?
Я вот тоже считаю, что технологии нужно показывать и отлаживать на примерах из digital humanities. Если бы показали какую-нибудь "расходно-напорную диаграмму", было бы не так понятно, о чём речь. А тут хотя бы понятно сразу как зовут Онегина (хотя это написано), и какая фамилия Татьяны (хотя это не написано ;-)