Обсуждение

В архиве: 8 комментариев.

Читать и комментировать в ЖЖ ↗

scriptum · 20 сентября 2003

Комментарий

Мне кажется это довольно тривиальная задача - если вы согласовано сохраняли знаки цитирования ">" - у вас должен остаться так называемый "хорошо-определенный документ". В этом случае организация такого документа - не сложнее чем получение структуры DOM из XML документа. Такие задачи решаются так называемыми "универсальными" парсерами, типа ХМЛ-парсеров. В итоге получается набор деревьев - это и есть вид организации таких документов.

Анатолий Левенчук · 20 сентября 2003

Комментарий

Ну, там чуть сложнее -- > > > оставляли, хотя мейлер резал сами удлиняющиеся строчки и нельзя быть уверенными, что они совпадают на 100% А эти самые "универсальные парсеры" -- это просто текстовые языки типа awk, или что-то более специальное? Google сообщает, что кто только не пытается приляпать к парсерам слово "универсальный". Наверняка кто-то решал подобную задачу, но как его найти? ;)

Ответ на комментарий

scriptum · 21 сентября 2003

Комментарий

Тогда у вас скорее всего не "хорошо определенный" документ. Универсальный парсер придумал ваш покорный слуга, когда руководил группой биоинформатиков в геномной компании - в ней же он и был написан на Jave. Идея состоит в том, что постольку поскольку документ хорошо определен (любой нормализованный хмл файл - пример такого документа) один и тот же парсер, пользуясь словарем тэгов для данного типа документа, может представить этот документ в виде деревьев (в более общем случае, в виде графа) и потом траверсировать эти деревья. На этом принципе основаны ХМЛ-парсеры. ДОМы - такая структура. Отсюда и термин универсальный - для любого документа используется один и тот же код - опять, если к нему прилагается описание (таги определены) и он сам по себе хорошо определен. Написать такой парсер было тривиально - документ записывался в стандартный ДОМ (стандартный, потому что ДОМы поддерживаются стандартной джавой), а дальше - делай с ней что хочещь. Таких парсеров я не встречал.

Ответ на комментарий

yole · 21 сентября 2003

Комментарий

http://zest.sourceforge.net/ Ну и ещё тот продукт, который мы сейчас делаем - он тоже будет такую переписку уметь красиво обрабатывать. Наверное. Если получится.

Анатолий Левенчук · 21 сентября 2003

Комментарий

Да, Zest -- это явно шажок в том направлении. Только вот проект год как заглох, а автор его занимается в Беркли другими интересными делами, обеспечив себе академическую публикацию по данному проекту. А когда вы свой продукт сделаете? Ложка-то к обеду дорога ;)

Ответ на комментарий