Обсуждение

В архиве: 34 комментария.

Читать и комментировать в ЖЖ ↗

Имя не сохранено · 27 февраля 2014

Комментарий

А что в итоге, к примеру ваша онтология аниме и манги, представлять из себя будет? Ну с юзерской точки зрения (юзер сайта, или хотябы юзер API).

Имя не сохранено · 27 февраля 2014

Комментарий

Сумбурненько как-то. Пришлось всё-таки установить скайп. Телеком теперь его не режет. Пошёл восстанавливать старые аккаунты.

Анатолий Левенчук · 27 февраля 2014

Комментарий

Там всегда сумбурненько, сегодня вообще всё ОК было -- даже тянули время до конца сессии. Все докладчики уложились в свои 10 минут, я предупреждал "высшее руководство", что вопросов много не будет, но они не поверили :-) Я уже понял по отклику в академической тусовке анимешников в Yahoo!, что помощи оттуда нам ждать не придётся. Так что будем делать пока всё сами. Вы и есть представитель сообщества отаку, но я надеюсь, что вы ещё что-то расскажете про API тамошних ресурсов. Я бы предложил на первых порах чисто для пробы ограничиться двумя: myanimelist и anidb, чтобы демонстрировать синтетические страницы "myanimelistdb". В этой команде в анимешках что-то понимаю пока только я, и немного justy_tylor. Остальные больше понимают, как моделировать насосы и их каталоги (а не аниме и их каталоги), да и этих людей не так много. Я думаю, что мы сделаем отдельное онлайн совещание в конце следующей недели, на русском :-) А пока каждый учит свой кусок матчасти: вы с API ресурсов разбираетесь, ещё один участник разбирается с тем как делать RDL, программируется веб-интерфейс-на-паттернах и т.д.. Интерес самих онтологов, думаю, вы уже поняли: их интересует, как в машине представлять выдуманные миры, да ещё и в 4D extensional ontology. Это не до конца решённый у них в сообществе вопрос, но вы видели ответы vvagr: основные онтологические решения уже приняты (ибо берётся не какая-то там онтология, а инженерная, специально заточенная на выражение творческой человеческой работы).

Ответ на комментарий

Анатолий Левенчук · 27 февраля 2014

Комментарий

Онтология находится "под капотом", юзерам она не нужна. Это как карбюратор в автомобиле: он есть, но пользователям не виден и для них недоступен. Онтология в данном проекте нужна для того, чтобы федерировать данные нескольких онлайн ресурсов. Пользователь сможет увидеть, например, данные с anidb и myanimelist на одной странице (скажем, оба рейтинга -- и сравнить их). Ну, и ряд других целей, но это уже менее важные цели.

Ответ на комментарий

Имя не сохранено · 27 февраля 2014

Комментарий

Кстати, corneredangel написал, что может дать контакт Anime News Network's Encyclopedia and Lexicon ( http://www.animenewsnetwork.com/encyclopedia ) Похоже, информация там более полная и структурированная, чем в других источниках. Но это всё коммерческое. Не понятно, что именно получится в результате. Если что-то полезное, можно было бы договориться с владельцем на использование.

Имя не сохранено · 27 февраля 2014

Комментарий

Я уже понял по отклику в академической тусовке анимешников в Yahoo!, что помощи оттуда нам ждать не придётся. Так что будем делать пока всё сами. Так в первую очередь не понятно, что надо делать. Там есть люди, профессионально занимающиеся классификацией и каталогизацией, в том числе библиотечным делом. Я нашёл базу данных AniDB. По API информацию там вытягивать мягко говоря не удобно. И я не уверен, получится ли у меня со временем. Насчёт же понимания - вот по этой причине все проекты я начинаю с составления глоссария. Ну и да, хорошо бы как-нибудь описать прогнозируемые результаты для "нормальных людей". А то сейчас это выглядит "мы намудрим с онтологиями, а потом выставим это в веб (может быть)".

Ответ на комментарий

Анатолий Левенчук · 27 февраля 2014

Комментарий

Фишка в том, что в разных источниках информация разная и структурирована по-разному. Так что "мамы всякие нужны, мамы всякие важны". В результате у нас должен быть прототип интеграции данных с семантической публикацией. Это очень, очень хитро и там внутри есть несколько совсем современных технологий: -- создание RDL в публикуемом формате, который может быть прочтён разными программными стредствами. Там внутри и словарь, и описание данных и много чего ещё. Именно тут нужно знание о предметной области (так, именно сюда нужно класть понятие ОЯШ или moe). И именно тут нужно понимать про 4D и possible worlds. -- управляемый паттернами и RDL мэппинг структурированных и неструктурированных данных из API и различных datasets (ибо не все данные в онлайне, "бывают и просто файлы") в машинночитаемый семантический формат. Семантический -- это когда у каждого элемента данных есть URI, и по этому URI про этот элемент можно что-то узнать в Сети (дереференсинг). -- семантическая публикация данных (обеспечение того самого дереференсинга). Если просто напечатать человекочитаемый текст, то семантика потеряется. Поэтому нужно напечатать так, чтобы поисковые машины прочли машинное, а люди прочли текстовое. Сегодня все эти технологии работают по кусочкам в разных инструментах, ими владеют разные команды. А у нас будет показана полная цепочка. Cool! Дальше много путей развития: -- наращиваем RDL, получаем супер-пупер-гипер-глоссарий предметной области, что уже неплохо. -- наращиваем число федерируемых ресурсов -- наращиваем число типов генерируемых страниц, получаем всё более осмысленные ответы на наши вопросы -- заставляем программу "думать" (включаем статистический и логический вывод). Но это уже потом, пока же нужно хотя бы 10 элементов данных взять по 5 штук из каждой из двух онлайн баз и прогнать по всей цепочке до публикации. Это я хотел бы иметь до дня хакатона! Это и есть "подготовка" :-)

Ответ на комментарий

Имя не сохранено · 27 февраля 2014

Комментарий

С технической стороны сервис очень хороший, но есть пара проблем Если сравивать веб и API, то в XML информации гораздо меньше. Нет, например, режиссёров эпизодов. Для онтологии интересно как раз попытаться построить полное описание. Ещё там в Terms of Service стоит "When using this API to display information on a public website, you must list Anime News Network as the source of the data and link to Anime News Network on every page that incorporates data from the API."

Ответ на комментарий

Анатолий Левенчук · 27 февраля 2014

Комментарий

Там более-менее нарезаемая на части работа. Технология предполагает для каждого API иметь свой управляемый паттернами ридер, обращающийся к базе. А что не отдаётся по API ридер может спросить по HTTP и отпарсить полученный HTML страницы, закрыв хитрую механику доступа. Фокус в том, что этот ридер будет управляться паттернами, а они онтологичны. Так кодирование эволюции бакуганов и смена пола персонажей после медицинской операции будут одинаковым: TemporalWholePart персонажа. Это сильно экономит мышление и позволяет подобные работы по федерированию ресурсов проводить с меньшим числом ошибок и быстрее, чем "на коленке" с принятием уникальных решений "по ситуации".

Ответ на комментарий

Анатолий Левенчук · 27 февраля 2014

Комментарий

Задача номер один -- это выбрать минимальное число ресурсов, на которых можно продемонстрировать максимальные бенефиты интеграции данных: показать из них такую страницу, которую каждый отаку хотел бы посмотреть, но которую он не смог бы увидеть в природе. А начать с двух. Я предлагаю anidb и myanimelist только потому, что на них больше всего информации о "внутри мира" (system of interest). Но можно и animenewsnetwork, нет вопросов -- только там больше про студии (enabling system). Конечно, больше всего "сюжета" и тривиа в википедии, но там нужно парсить "на лету" и понимать естественный язык. Это для хакатона трудновато будет, можно оставить на потом. Примите решение в узком кругу российских отаку, с этих ресурсов и начнём. :-) Далее нам нужно выбрать 10 первых элементов данных, чтобы часть была из внутреннего мира, часть из внешнего. Не более 10, по семь пересекающихся из каждого ресурса, и три непересекающихся в ресурсах. Конечно, эти решения должны принимать "академические отаку", а онтологи и программисты подключатся на следующем шаге. Увеличивать число ресурсов и обрабатываемых полей легко. Вот резко самоограничиться для задания образца работы трудно :-)

Ответ на комментарий

Анатолий Левенчук · 27 февраля 2014

Комментарий

Я думаю, что писать на каждой странице дереференсинга, что данные взяты из какого-то ресурса -- это хороший тон. А в семантическом формате для этой цели будут метаданные. Там тоже целая наука (кстати, один из проектов хакатона посвящён проблеме метаданных. Можно пригласить их проконсультировать, какие именно нам нужны метаданные, чтобы выглядеть прилично -- иметь, например, с ними получасовое онлайн обсуждение прямо в ходе хакатона. Ну, или спросить заранее, а потом в ходе хакатона получить их review того, как мы реализовали их предложения).

Ответ на комментарий

Анатолий Левенчук · 27 февраля 2014

Комментарий

Я и написал: для демонстрации "нормальным людям" нужно уметь генерировать датасеты и страницы: -- на основе нескольких (2 вначале, 200 в конце) источников информации -- читаемые как людьми, так и краулерами (типа Гугля), так и с поискового интерфейса (машинно) Все эти семантические особенности обычно скрыты под капотом. Они главным образом обеспечивают борьбу со сложностью и монстровостью быстро распухающего решения. Ибо для двух источников данных всё ОК. А когда источников данных два десятка, из них три объектных, шесть реляционных, пять эксель-табличек, немного полнотекстовых документов, а ещё два интерфейса NoSQL -- вот тут и наступает каюк. Ибо контролировать владельцев ресурсов в целях унификации бардака нельзя, и нужно защищаться от проникновения этого бардака на свою территорию. В этот момент и вспоминают об онтологиях и семантике. Пользователь её не видит, её видят разработчики.

Ответ на комментарий

Имя не сохранено · 28 февраля 2014

Комментарий

Вместо выбрасывания на пользователя страниц с мешаниной из различных источников логично было бы делать поисковую систему по запросам. (вытаскивающую часть сети и с возможностью филтрации) И Гугла я бы вообще попросил туда не соваться, потому что данные сняты с других источников, а он про них и так знает.

Ответ на комментарий

Имя не сохранено · 28 февраля 2014

Комментарий

Надо, конечно, договариваться заранее. Методанные - это другой мир. К тому же, технические заготовки лучше сделать заранее, а на самом хакатоне заниматься только задачей.

Ответ на комментарий

Имя не сохранено · 28 февраля 2014

Комментарий

В принципе, у отаку со стажем отличается от начинающего любителя аниме именно тем, что знает, когда какой режиссёр что снимал и какая сейю какую героиню где озвучивала. Плюс поиск идёт по вопросу "я люблю это, это и это, чего бы ещё такого посмотреть" (То есть жанр, набор героев и тип сценария)

Ответ на комментарий

Анатолий Левенчук · 28 февраля 2014

Комментарий

Да, именно так. Но для начала сделаем "браузинг" (то есть кликабельные элементы, включая кликабельные наименования элементов -- клик на них ведёт в глоссарные определения). То есть на странице кликабельно всё, и систематические адреса (URI). Движок распознаёт, когда к нему приходит машина, и отдаёт RDF (триплы) машине, и человеческую страницу в HTML, когда приходит человек или Гугль. Гугль пускаем, ибо мы вполне можем что-то на странице вычислить, чего нет ни в одной из баз данных (например, общий или нормализованный или ещё какой-нибудь рейтинг, вычисленный на основе данные двух или более рейтингов разных ресурсов).

Ответ на комментарий

Анатолий Левенчук · 28 февраля 2014

Комментарий

Да, я пытался донести эту мысль про "технические заготовки, обучение людей, апробацию коммуникации" и т.д. -- чтобы всё это было до хакатона, а не во время его. На хакатоне занимаемся задачей. Метаданными заниматься придётся, куда ж без них. Благо кое-какой опыт и стандарты тут имеются, но грех не задействовать армию онтологов, которые будут рядом заниматься именно метаданными для онтологий. Ибо результат-то у нас -- справочные данные (reference data), что как раз самая что ни на есть онтология (с точностью до разницы в терминах, используемых инженерной тусовкой). Если, конечно, руки дойдут до этих метаданных и у них и у нас :-)

Ответ на комментарий

Анатолий Левенчук · 28 февраля 2014

Комментарий

Это разные сценарии. Так, начинающие отаку как раз будут спрашивать базу: какой режиссёр что снимал (есть и базы, в которых показываются продюсеры отдельных эпизодов -- там ведь выпускающие сильно могут разниться, я где-то такую базу видел) и какая сейю какую темпоральную часть героини (детскую или взрослую, например) озвучивала. А можно представить и развитие в сторону привинчивания tvtropes.org (да так, чтобы не в целом к сериалу или манге, а в привязке к конкретному месту использования -- для чего нужно разработать "координатную систему" внутри более развитую, чем "с третьей по пятую минуту после опенинга третьего эпизода").

Ответ на комментарий

Имя не сохранено · 28 февраля 2014

Комментарий

Ой. Вот общий рейтинг по нескольким ресурсам - это компот из ужа с ежом. Я бы вообще все численные значения, созданные коллективом, выбросил нафиг.

Ответ на комментарий