ailev.ru

Обсуждение

В архиве: 8 комментариев.

Читать и комментировать в ЖЖ ↗

alh__ · 19 сентября 2014

Комментарий

Мне кажется, что основной тренд не там. До того, как потребуются гибридные алгоритмы, надо пройти этап более простых предсказательных и предписывающих моделей. Их появление требует существенного пересмотра способов ведения бизнеса, в частности повседневного использования экспериментов, количественного анализа разного рода эффектов и т.п. Кроме того сейчас обработка текстов и особенно понимание языка по востребованности существенно уступают потребностям в прогнозировании поведения (продажи, лояльность, предотвращение обращений за обслуживанием), в анализе и использовании геолокационных данных, распознавании образов, обнаружении аномалий и предсказаниях на основе исторических данных. То, что сейчас востребовано в области текстового анализа, к пониманию языка практически никакого отношения не имеет.

Анатолий Левенчук · 19 сентября 2014

Комментарий

Просто у каждого "тренд" -- это про разные периоды времени. Я, конечно, понимаю, что текущая мода -- это простая статистика, которая только-только начинает получаться и у текстовиков, и у базоданцев-бигдатанцев. Я тут не про текущую моду, а про приближающийся рок-н-ролл. На Ontology Summit 2014 тема гибридных вычислений была признана крайне важной, но докладчиков по факту не нашлось. Для меня "тренд" -- это как раз вот это, о чём пока мало кто говорит, что не присутствует на сегодняшний момент, но будет. А классические fads and fashions -- ну, чего о них говорить? Это пусть на конференциях другие докладчики обсуждают )))

Ответ на комментарий

alh__ · 19 сентября 2014

Комментарий

Вот правда, мне кажется, что упор на "понимание" в Big Data / Machine Learning это совсем не тренд, даже долгосрочный. Это весьма ограниченная область, следствие излишне "человеческого" подхода. Для решения массы весьма рок-н-ролльных задач никакого понимания не требуется.

Ответ на комментарий

Анатолий Левенчук · 19 сентября 2014

Комментарий

Это абсолютно понятно, и открытым текстом говорится при обсуждении неминуемого успеха IBM Watson (ровно в этой терминологии: что будет бешеный успех, работа с естественным языком и никакого "понимания"). Но я обсуждаю то, что придёт за этой уже существующей по факту волной технологий. Что будет за статистическими системами. Хотя да, если сейчас заняться статистикой в ассортименте, то лет на пять хватит только её (а то и на все десять: реляционные базы данных, например, никуда не ушли, хотя NoSQL уже не один год).

Ответ на комментарий

alh__ · 19 сентября 2014

Комментарий

Мне кажется, что пока не видно, что будет за статистическими системами. Просто потому, что массовое практическое внедрение статистических систем сильно изменит жизнь. И я сомневаюсь, что дело пойдет в сторону "понимания", поскольку полезность понимания как такового базируется на успехе человеческого разума, который мы видим в единственном экземпляре :). Может оказаться, что это вообще отдельный артефакт на обочине разных способов решения задач :)

Ответ на комментарий

Имя не сохранено · 19 сентября 2014

Комментарий

Анатолий Игоревич, дайте пожалуйста ссылку на файл видео 92 заседания incose http://vimeo.com/105790957 в высоком разрешении. Там качество видео как будто на телефон снимали.

Анатолий Левенчук · 19 сентября 2014

Комментарий

А вот что снялось, я то и залил на сервер -- почему нерезко получилось, даже не знаю, сетап был стандартный. Другого файла получше у меня, увы, нет. Я бы рекомендовал не на экран смотреть, а на оригинальный файл (он-то доступен в .pdf). А я сам с высоким разрешением не нужен )))

Ответ на комментарий

Имя не сохранено · 20 сентября 2014

Комментарий

Если считать, что большие данные это просто "большие", то такое определение сродни понятию "горизонта на планете Земля" --- чем ты выше (больше производительность твоего вычислителя), чем дальше отодвигается от тебя этот горизонт. Спекулировать про "экспоненциальную сложность" и сводить к алгоритмам которые решают за логарифмическое время на самом деле бесполезно. Дело в том, что большиеданныеТМ это не просто хранилища большого размера, или быстро выполняемые (или вообще поточные) запросы. БольшиеданныеТМ подразумевают, что они приносят нечто качественно новое в решение задачи для которой собираются. Качественно новым в случае больших данных (и именно тогда по сути данные становятся "большими") является переход от "экстраполяции" к "интерполяции" при решении задачи для которой собирались данные. То есть в пространстве состояния (определяемого измерениями собираемых данных) "характеристика решения" интересующая собирающего данные ведет себя "негладко" (на каком то масштабе дает сильную дисперсию для одних и тех же входных данных в случае интерполяции или вообще не поддается оценке в случае экстраполяции ). "Интервалы" внутри пространства состояния полностью определяется какое количество данных мы собираем, что естественно соответствуют априорной частоте пребывания наблюдаемой системы в данной точке пространства состояния. Так вот, по моему скромному мнению, большиеданныеТМ это когда в пространстве состояний системы не остается "интервалов" между отсчетами данных в которых при прогнозе не может работать простая интерполяция. Точность при этом прогноза является предельной для заданного при сборе данных числа и состава измерений. PS естественно все "продвинутые" методы ML в основном пытаются делать неким "наилучшим образом" "экстраполяцию" по пространству состояний системы.