ailev.ru

20 сентября 2014 · Комментарий

Без заголовка

Если считать, что большие данные это просто "большие", то такое определение сродни понятию "горизонта на планете Земля" --- чем ты выше (больше производительность твоего вычислителя), чем дальше отодвигается от тебя этот горизонт. Спекулировать про "экспоненциальную сложность" и сводить к алгоритмам которые решают за логарифмическое время на самом деле бесполезно. Дело в том, что большиеданныеТМ это не просто хранилища большого размера, или быстро выполняемые (или вообще поточные) запросы. БольшиеданныеТМ подразумевают, что они приносят нечто качественно новое в решение задачи для которой собираются. Качественно новым в случае больших данных (и именно тогда по сути данные становятся "большими") является переход от "экстраполяции" к "интерполяции" при решении задачи для которой собирались данные. То есть в пространстве состояния (определяемого измерениями собираемых данных) "характеристика решения" интересующая собирающего данные ведет себя "негладко" (на каком то масштабе дает сильную дисперсию для одних и тех же входных данных в случае интерполяции или вообще не поддается оценке в случае экстраполяции ). "Интервалы" внутри пространства состояния полностью определяется какое количество данных мы собираем, что естественно соответствуют априорной частоте пребывания наблюдаемой системы в данной точке пространства состояния. Так вот, по моему скромному мнению, большиеданныеТМ это когда в пространстве состояний системы не остается "интервалов" между отсчетами данных в которых при прогнозе не может работать простая интерполяция. Точность при этом прогноза является предельной для заданного при сборе данных числа и состава измерений. PS естественно все "продвинутые" методы ML в основном пытаются делать неким "наилучшим образом" "экстраполяцию" по пространству состояний системы.

К записи · К обсуждению