Обсуждение

В архиве: 12 комментариев.

Читать и комментировать в ЖЖ ↗

atrey · 30 ноября 2003

Комментарий

Понятизацию конечно хорошо. Но вот меня -как непрофессинального потребителя информации(зато профессионального архитектора) интересует вопрос- как фильтровать неоригинальную информацию в интернете. масса ссылок. но в 90 процентов из них -содержится только та информация, которая есть в других-из тех же 90 процентов. То есть все такие ссылки с успехом могут быть заменены одной. Выработаны ли какие-то способы структурирования информации по_её степени оригинальности , по наличию новых смыслов, а не по форме построения текста? И_возможно ли это в принципе? спасибо.

Анатолий Левенчук · 30 ноября 2003

Комментарий

Ну, это совсем не в тему моего постинга. А вам, наверное, сюда -- http://www.dialog-21.ru/direction_fulltext.asp?dir_id=15539 В этом великолепном обзоре поисковых систем, который сделал Сегалович, вы можете найти и про то, как ищут и вычеркивают тексты-повторения:
Не могу удержаться, чтобы не описать остроумный алгоритм, применяемый в современных поисковых системах для того, чтобы исключить «очень похожие документы». Происхождение копий документов в Интернете может быть различным. Один и тот же документ на одном и том же сервере может отличаться по техническим причинам: быть представлен в разных кодировках и форматах; может содержать переменные вставки – рекламу или текущую дату. Широкий класс документов в вебе активно копируется и редактируется – ленты новостных агентств, документация и юридические документы, прейскуранты магазинов, ответы на часто задаваемые вопросы и т.д. Популярные типы изменений: корректура, реорганизация, ревизия, реферирование, раскрытие темы и т.д. Наконец, публикации могут быть скопированы с нарушением авторских прав и изменены злонамеренно с целью затруднить их обнаружение. Кроме того, индексация поисковыми машинами страниц, генерируемых из баз данных, порождает еще один распространенных класс внешне мало отличающихся документов: анкеты, форумы, страницы товаров в электронных магазинах Очевидно, что с полными повторами проблем особых нет, достаточно сохранять в индексе контрольную сумму текста и игнорировать все остальные тексты с такой же контрольной суммой. Однако этот метод не работает для выявления хотя бы чуть-чуть измененных документов. Для решения этой задачи Udi Manber (Уди Манбер) (автор известной программы приближенного прямого поиска agrep) в 1994 году предложил идею [manber1994], а Andrei Broder (Андрей Бродер) в 1997 [broder] придумал название и довел до ума алгоритм «шинглов» (от слова shingles, «черепички, чешуйки»). Вот его примерное описание. ...
Там же и про "смыслы", о которых вы упоминаете. Отмечу только ехидно, что многие "смыслы", которые вы пытаетесь найти в интернете, отсутствуют, потому что а) никто их туда не выложил, и они существуют только на какой-нибудь бумаге или в файле, закопанном в недрах какого-нибудь неподключенного к интернету компьютера; б) никто еще этого "смысла" не придумал, или придумал, но никак не зафиксировал, а только треплется об этом среди своих друзей и коллег; в) написан этот "смысл" и выложен в интернет не на том языке, на котором вы его ищете и сможете прочесть. И, думаю, таких "смыслов" будет большинство -- легче обычно самому придумать велосипед, нежели найти его описание... Но к моему исходному постингу все это все-таки не имеет никакого отношения.

Ответ на комментарий

atrey · 30 ноября 2003

Комментарий

То, что написано"ехидно"-это очень интересно.Выходит, что смысла в Интеренте не найти, без подключенной головы железка ничего не скажет, и никакой "архитектуры" в ней нет и не может быть. Настоящая "архитектура" смыслов-находится только в нашей голове. а как она построена-мы как не знали, так и не знаем до сих пор. все исследования "архитектуры-компьютерных систем"-блеф.Что и требовалось доказать.

Ответ на комментарий

Анатолий Левенчук · 30 ноября 2003

Комментарий

Ну, это у вас крутые выводы: никакого отношения обсуждаемые вами вопросы к архитектуре компьютерных систем не имеют, равно как и обычной архитектуре, и даже к "информационной архитектуре" (это как раз о том, как выкладывать информацию в Сеть так, чтобы ее потом можно было найти), и уж тем более к изобретенной вами "архитектуре" смыслов (это что еще за зверь? -- не наблюдал его в своей голове никогда ;). Ключ в двери не равен ключу шифра, и не равен родниковым ключам, даже если и записываются они все одним словом. Как-то вы все по диагонали: архитектору потребовалось включить компьютер, который оказался неэквивалентен биологическим мозгам, в которых не обнаружилось ничего похожего на ему знакомую архитектуру. Отсюда делается вывод, что какие-то там исследования(!) -- блеф. Я думаю, аккуратнее нужно с логикой.

Ответ на комментарий

atrey · 30 ноября 2003

Комментарий

"никакого отношения обсуждаемые вами вопросы к архитектуре компьютерных систем не имеют, равно как и обычной архитектуре". По-видимому тут всё дело в разном понимании слова "архитектура" на греческом. русском и английском языках, и в непонятной любви компьютерщиков к_слову "архитектура" Вопросы были о структуре информации, то есть структуре смыслов. Как я теперь начинаю понимать- в технике компьютерного "железа"-можно было бы говорить не об "архитектуре"-компьютерных систем, а об их технологии и конструкции,это бы избавило от ненужных ассоциаций с искусством и смысловыми моментами...

Ответ на комментарий

Анатолий Левенчук · 30 ноября 2003

Комментарий

Ну, слово архитектура в компьютерных науках имеет не меньшую полисемию, нежели в любых других (например, организационных -- говорят и об архитектуре предприятия, имея ввиду ее компонентами бизнес-процессы и связи между ними). Про искусство и смыслы в околокомпьютерных науках тоже вполне поминают. Но, боюсь, с вашим гуманитарным уставом в этот компьютерный монастырь ходить не стоит. Вы как-нибудь поразмышляйте на досуге: здание имеет архитектуру, город имеет архитектуру. А городская агломерация имеет архитектуру? А страна? И почему у здания -- архитектура, а у корпуса компьютера -- дизайн? В этот момент вы и задумаетесь над тем, что вы сами вкладываете в это слово. Компьютерщики, конечно, поступают проще: они берут слово и точно определяют, что оно означает. И помещают это слово в глоссарий, в который всегда могут поглядеть все желающие. И не предполагают, что их за это кто-то будет ругать.

Ответ на комментарий

atrey · 30 ноября 2003

Комментарий

в отношении государства,предприятия-логичнее по-моему воспользоваться словом "структура" или "система". Другое дело, что эти слова слабо учитывают временнОй аспект, чаще только пространственный. если же говорить о системе "связи бизнесс-процессов" -то скорее по-моему подошло бы что-нибудь из музыки.Музыка-ведь это ожившая архитектура(если "архитектура-это застывшая музыка"-(:-)), то есть более процессуальное нечто. Или из театра-скажем "сценарий"взаимодействия бизнес-процессов .

Ответ на комментарий

Анатолий Левенчук · 30 ноября 2003

Комментарий

Вот я и не рекомендую ходить в компьютерные науки с определениями типа "застывшей музыки" (штамп, между прочим -- а ведь журналистов за штампы ой как не жалуют, за все эти "стремительные домкраты", которые врываются в чужие культурные полянки ;) Совершенно непонятно, чем "структура" лучше, нежели "архитектура". Почему у кристалла -- структура, а у здания -- архитектура? Что, "застывшей музыки" в кристалле меньше? Замечу еще флегматично, что в общественных науках не рекомендуют применять панфизикалистский подход, со всем его словарем и даже инженерными приложениями в частности. И это не случайно. Есть более широкий культурный контекст, в котором это все рассматривается. Нельзя критиковать одну полянку знания с позиций другой полянки. У компьютерщиков не меньше поводов упрекнуть архитекторов, чем у архитекторов есть поводов упрекнуть компьютерщиков. По крайней мере компьютерщики развиваются по числу идей на одного участника процесса на порядки быстрее, инноваций воплощенных у них с тысячи раз больше, креативность брызжет во все стороны, а у архитекторов по сравнению с ними застой и хныканье на отсутствие денег и ценителей их "застывшей музыки". А компьютерные архитектуры расходятся, как горячие пирожки: люди голосуют за них своими кошельками. Поэтому архитекторам можно было бы и подучиться: что такого в компьютерных архитектурах, что они в своих строительных архитектурах прохлопали за тысячи застойных лет? Без мета-перехода такое не обсуждается.

Ответ на комментарий

Анонимный автор · 30 ноября 2003

Комментарий

не могли бы вы по подробнее написать про "Проблема архитектуры дешевой нотаризации раскрываемой информации и система раскрытия информации" какой инфрмации? (это относится и к пункту 2) тех саммых документов в docflow/workflow ? Борис.

Анатолий Левенчук · 30 ноября 2003

Комментарий

В случае информации государства возникает проблема доверия к данным:
  • Ни один государственный орган не согласится иметь «ссылки» на корпоративную информацию и информацию граждан, предоставляемую на их серверах, ибо эта информация может быть а) намеренно недоступна ровно тогда, когда в ней больше всего необходимость (понятно, что «плановые ремонты» или «аварии» будут максимальны именно при назревании скандала) и б) изменена «задним числом»
  • Госведомства не более честны в этом плане, чем граждане и бизнесы, но предполагается, что граждане должны им доверять, и никто не защищает граждан от замены, например, текста или атрибута какого-то неопубликованного документа задним числом (искажения записи) или исчезновения оригинала записи из госкомпьютера. Публикация защищает, но сразу возникает проблема с учетом «штатных» исправлений и изменений, а также дублированием данных и всеми вытекающими отсюда архитектурными сложностями.
Эта проблема существует и в «бумажном» мире, но ее обязательно нужно адресовать в электронном мире. Поскольку при «безоткатном» государстве уходят одни проблемы, но появляются другие проблемы (государство становится много более жестким и начнет настаивать на своих ошибках, вместо того, чтобы тихо исправлять их задним числом, как это происходит сейчас), то проблема доверия к данным должна быть адресована. Еще одна проблема: реализация прав граждан на доступ к информации госорганов. Каким образом обеспечивается секретность исключений? Какая гранулярность исключений (на Западе – часто вычеркивается лишь один или несколько абзацев в документе)? Как связаны технические регламенты раскрытия информации с административными требованиями (каковы электронные административные регламенты раскрытия, и насколько технические средства их поддерживают)? Объединенные государственные инфокоммуникационные ресурсы (ОГИР) являются основным инструментом реализации требований законодательства по предоставлению информации о действиях органов власти и госуправления. Также ОГИР является основным инструментом по реализации требований информационного регулирования для частных предприятий и граждан. Это требование реализуется двумя архитектурными путями:
  • Репликацией информации (с учетом связанности информации и ее предоставляющих агентов) в коммерческих системах, представляющих расширенные возможности data mining, а заодно выполняющих функцию независимых бэкап/нотаризующих хранилищ информации (опять же – с точностью до агентской архитектуры)
  • Тотальной безлюдной нотаризацией (например, как услугой Репозитория)

Ответ на комментарий

Анонимный автор · 1 декабря 2003

Комментарий

мне кажется что все это очень удачно должно пересечся со всеми уже забытым URN (не URL а именно URN и URI) посмотрите RFC2915 доступ к ресурсам в такой схеме довольно прозрачен. Можно иметь несколько провайдеров которые предоставляют услугу архивации всех или части документов. документ подписывается вместе с URN что исключает его модификацию. Борис.

Анатолий Левенчук · 2 декабря 2003

Комментарий

Там сложней механизмы: не волнует техническая сторона, она тривиальна, а волнует юридическая сторона технологий -- кем подписывается документ? как отражаются исправления ошибок в документах? что такое версионирование в терминах юридически достоверных действий? и т.д. Насчет URI -- это, конечно, используется. Архитектура ОГИР явно задействует FIPA (www.fipa.org). Технарей в проекте достаточно, поверьте. Не хватает стыка между технарями и юристами (отдельно юристы, замечу в проекте тоже есть, но они не могут договориться с технарями) а также государствостроителями (которые вообще не любят дружить ни с юристами, ни с технарями) и даже пиарщиками (ибо мало предложить что-то, нужно обеспечить общественное принятие предложенного на тысячах и тысячах чиновничьих рабочих мест). А URI -- там целый Репозиторий про это уже предусмотрен, что толку то... Нотариальность волнует, а не "применение ЭЦП с открытым ключом"...

Ответ на комментарий