ailev.ru

Обсуждение

В архиве: 11 комментариев.

Читать и комментировать в ЖЖ ↗

Имя не сохранено · 13 августа 2015

Комментарий

еще нужен инструмент под это дело...

Имя не сохранено · 13 августа 2015

Комментарий

Увы, "семантические информационные системы" -- это будущее (далёкое?). Точность систем анализа текста даже не 99.9%, а едва 80-90%. Перемножим на объём Консультанта Плюс... С такой точностью представляете, какое количество ошибочных параграфов оно найдёт? В Консультанте Плюс из-за его объёма проблема даже расставить ссылки из одного документа на другой, что уж говорить про точную разметку используемых терминов. (При этом мне известны примеры полной разметки небольших юридических справочников) То же самое и с curriculum learning и любым другим механизмом: как максимум, это подграф из определений толкового словаря, к которому прикреплены веб-документы, высоко отранжированные гуглом. Вспомните проблему систем класса "never ending learning" -- ошибки накапливаются, их приходится вычищать руками чтобы хоть как-то жить дальше, например, internet cookies -- это не еда, несмотря на то, что cookies -- это печенье. А если нужно вычищать руками -- то это значит, что происходит не самообучение, а перенос знаний, и интеллект градуируется по уровням: нужно, чтобы более интеллектуальный оператор обучал менее интеллектуального оператора. Это фундаментальная проблема обучения на текущий момент, и поэтому пока что невозможно построить качественную неизвестную модель большого размера по известным данным, несмотря на используемые алгоритмы или удачно выбранные фичи. >we developed a delicate iterative pipeline Тут совсем другое: система учится сопрягать две модели (речи на входе и текста на выходе), а не строить неизвестную модель по известным данным. В таких условиях, чем больше данных, тем лучше сопряжение. Чем лучше сопряжение, тем больше дополнительных данных для сопряжения мы можем найти. Создаётся положительная обратная связь. Но такие системы на текущий момент почему-то не учатся до 100%, а всего лишь до 95% -- даже при огромном количестве данных, потому что нейросети обеспечивают лишь качество уровня 95%. Кстати, пока не очень понятно, почему именно. LSTM даже с лёгкостью умеют делать что-то типа "исключений из правил", успешно обрабатывая лингвистические нерегулярности, но, тем не менее, 95% качество -- это сейчас практический предел на многих, если не всех задачах.

pw · 13 августа 2015

Комментарий

Очень любопытный для меня пост. Я как всегда в таких местах многие наборы букв не понимаю, но общая идея хорошо ложится на мои текущие проблемы. Вы своими изложениями часто хватаете ту ниточку, которая потенциально может распутать большой клубок. Понял про ситуационность проблемы. Но это не исключает возможности формирования (не ключевых или обязательных и даже не общих, а скажем) скелетных принципов помогающих решать поставленный вопрос в конкретных ситуациях. Расставить ссылочки - реализуемое (в смысле малый шаг правильную сторону), но малоэффективное занятие - как раз антоним общего подхода. Нужно нечто дающее методы и критерии правильности в общем случае ("Все полезно, что в рот полезло" - сарказм). Вот есть предметная область, есть задача стать экспертом, и даже есть три года. Берем академические книжки, новостной поток, знакомство с актуальными задачами, общение с признанными экспертами (по возможности просим их стать тьюторами), забираем немного шире в соседние области, цепляем "совсем не про то, но явно перспективное у нас в будущем"... Вот тут везде нужны критерии выбора - чего точно не хватает, а чего можно, но уже не успеешь. Академические книжки. Где минимально необходимая норма, а где оптимум? Новостной поток. Как его ограничить, но не потерять пульса жизни в теме? Актуальные задачи. Какие задачи стоит реально разбирать - классику, фронтир? Не устареет ли навык за три года? Эксперты. Какое количество мнений оптимально? Тусовка требует много времени. Одно мнение - однобокий и возможно ошибочный взгляд. Тьютор (учитель) - тут обычно хотя бы одного найти. Как это правильно сделать? Соседние области. Обязательно нужно, но как остановиться, чтобы не потерять фокуса поставленной задачи? "Совсем не про то". Как удержать мотивацию на протяжении трех лет? Видимо сейчас это востребованный сервис - не просто дать направленный граф чего изучать, а дать гарантию, что в результате правильного и полного выполнения инструкций ученик успеет получить достаточный для успешной практики набор знаний и умений. Я бы заплатил.

Анатолий Левенчук · 13 августа 2015

Комментарий

Я тут как раз написал, что полного автоматизма не удастся достичь, а только некоторых подсказок (и цифра 95% точности тут была бы просто запредельной). Обсуждаемая предметная область такова, что два преподавателя -- три мнения, два онтолога -- три онтологии, два тьютора -- три разных предложения по каждому вопросу. Так что вопросы тут встают даже для чисто ручной работы. Ну, и глаза боятся, руки делают. Тут важно ещё задачу саму уточнить: я задачу ситуационного свода знаний в обобщённом виде не встречал ещё сформулированной, только отдельные "семантические инструменты" для разных предметных областей или совсем уж общие "семантические SDK". Масштабируемость -- да, это проблема. У человека та же проблема, склеить знание одной книжки занимает месяц, а десяти книжек может и несколько лет занять )))

Ответ на комментарий

Имя не сохранено · 13 августа 2015

Комментарий

Спасибо за термин. Как выделять подмножество куррикулума области, нужное для решения более-менее определенной практической задачи (Свод знаний ситуативен)? Свод знаний нельзя готовить впрок, это неподъемная и ненужная работа. Можно ли допускать риск, что из-за отсутствия общего знаменателя, вещей нужных почти во всех задачах, вроде той же геометрии, пользователь пройдет мимо задачи, не распознав ее, положившись на доступность curriculum miner? Есть ли оптимум между трудозатратами на приобретение общего знаменателя и расширением образовательных траекторий (+поля когнитивного зрения), которое он предлагает? Намайнил ли уже кто-нибудь что-то круче линеала для примера?

Анатолий Левенчук · 13 августа 2015

Комментарий

Да, именно так -- типичная задача построения curriculum, причём перестраивать его приходится ежемесячно (и ученик меняется сильно сам по себе, и учебный материал не стоит на месте), ситуация не стоит на месте. Ещё проблема в генерации упражнений, но это совсем уж другой уровень работы (проще считать на первом этапе работы, что каждый текст это учебник и при нём есть задачник -- то есть пока даже со статьями и новостями не работать).

Ответ на комментарий

Анатолий Левенчук · 13 августа 2015

Комментарий

Вы задаёте правильные вопросы, но я боюсь, что пока на них ни у кого нет ответа. Но я как-то описал задачу, и теперь можно потихоньку (или не потихоньку) ответы на эти вопросы искать. Проблема ещё и в том, что частные решения под самыми разными именами и на самых разных технологиях появляются в разных предметных областях. Так что даже погуглить трудно: непонятно какие слова из каких предметных областей в этих решениях будут ключевые. Я просто в посте попытался показать, что есть общая постановка задачи и можно сделать общего вида инструментарий. Но честно скажу, у меня нет ещё детального понимания, как эту задачу решать. Только несколько частных идей -- типа того же построения графа определений и использований (но что делать, если граф окажется циклическим, я пока не знаю. А он ведь окажется циклическим! Останется требовать от авторов текстов переписать эти свои тексты, чтобы граф был ациклическим, то есть переходить к инженерной части работы над сводом -- выправлять коленвал).

Ответ на комментарий

Имя не сохранено · 13 августа 2015

Комментарий

Циклы можно попробовать разрывать "лодами", недетальными и нестрогими описаниями "про что это вообще", предзнанием, с обещанием раскрыть позже и напоминанием пересмотреть предыдущее использование, когда это позже наступает. Проблема часто возникает, если пытаться максимально группировать знания, канонический пример — теорема Лопиталя, чтобы вычислить предел, нужно посчитать производную, а производная сама вводится через предел. Школьный лод — таблица производных, синтаксические правила и объяснение на пальцах про скорость. Я не уверен, что этот способ работает везде, был бы рад контрпримерам.

Ответ на комментарий

Имя не сохранено · 13 августа 2015

Комментарий

>Я тут как раз написал, что полного автоматизма не удастся достичь, а только некоторых подсказок (и цифра 95% точности тут была бы просто запредельной). Пусть 95% точности -- вероятность успешного извлечения одного факта. Но когда речь идёт про логический вывод, при последовательности умозаключений длины N (использующей одновременно N разных фактов) вероятность справедливости результата становится 0.95 в степени N. Это исчезающе малая величина. Установление взаимоотношений между ними подвержено этому же самому процессу -- а это суть "ситуационного свода знаний" в том числе. Так что единственный рабочий вариант на сегодняшний день -- взять толковый словарь / онтологию, и в нём руками выделить необходимые для обучения понятия. >я задачу ситуационного свода знаний в обобщённом виде не встречал ещё сформулированной Да ещё Мински с фреймами пытался описать часть реальности, и экспертные системых 70х годов тоже -- а что это, как не ситуационный свод знаний. Так что тут как с бессмертием: формулируй задачу, не формулируй -- пока нет подходящих инструментов, сделать всё равно ничего путного не получится!

Ответ на комментарий

Имя не сохранено · 19 ноября 2015

Комментарий

Нил Стивенсон, "Алмазный век, или Букварь для благородных девиц" - шикарно описывает автоматическую систему обучения ребёнка, подсовывающую ему каждый раз именно те сведения, которые перекроют очередной ближайший inference distance в сторону очередной цели