Без заголовка
Ну, это совсем не в тему моего постинга. А вам, наверное, сюда -- http://www.dialog-21.ru/direction_fulltext.asp?dir_id=15539
В этом великолепном обзоре поисковых систем, который сделал Сегалович, вы можете найти и про то, как ищут и вычеркивают тексты-повторения:
Не могу удержаться, чтобы не описать остроумный алгоритм, применяемый в современных поисковых системах для того, чтобы исключить «очень похожие документы». Происхождение копий документов в Интернете может быть различным. Один и тот же документ на одном и том же сервере может отличаться по техническим причинам: быть представлен в разных кодировках и форматах; может содержать переменные вставки – рекламу или текущую дату. Широкий класс документов в вебе активно копируется и редактируется – ленты новостных агентств, документация и юридические документы, прейскуранты магазинов, ответы на часто задаваемые вопросы и т.д. Популярные типы изменений: корректура, реорганизация, ревизия, реферирование, раскрытие темы и т.д. Наконец, публикации могут быть скопированы с нарушением авторских прав и изменены злонамеренно с целью затруднить их обнаружение. Кроме того, индексация поисковыми машинами страниц, генерируемых из баз данных, порождает еще один распространенных класс внешне мало отличающихся документов: анкеты, форумы, страницы товаров в электронных магазинах Очевидно, что с полными повторами проблем особых нет, достаточно сохранять в индексе контрольную сумму текста и игнорировать все остальные тексты с такой же контрольной суммой. Однако этот метод не работает для выявления хотя бы чуть-чуть измененных документов. Для решения этой задачи Udi Manber (Уди Манбер) (автор известной программы приближенного прямого поиска agrep) в 1994 году предложил идею [manber1994], а Andrei Broder (Андрей Бродер) в 1997 [broder] придумал название и довел до ума алгоритм «шинглов» (от слова shingles, «черепички, чешуйки»). Вот его примерное описание. ...Там же и про "смыслы", о которых вы упоминаете. Отмечу только ехидно, что многие "смыслы", которые вы пытаетесь найти в интернете, отсутствуют, потому что а) никто их туда не выложил, и они существуют только на какой-нибудь бумаге или в файле, закопанном в недрах какого-нибудь неподключенного к интернету компьютера; б) никто еще этого "смысла" не придумал, или придумал, но никак не зафиксировал, а только треплется об этом среди своих друзей и коллег; в) написан этот "смысл" и выложен в интернет не на том языке, на котором вы его ищете и сможете прочесть. И, думаю, таких "смыслов" будет большинство -- легче обычно самому придумать велосипед, нежели найти его описание... Но к моему исходному постингу все это все-таки не имеет никакого отношения.