Обсуждение

В архиве: 8 комментариев.

Читать и комментировать в ЖЖ ↗

ext_5540743 · 16 марта 2025

Комментарий

Я вижу, что у вас большой упор сделан на то, что "учебники будут читать ЛЛМ", а у меня вопрос — а что делается для того, чтобы это стало реальностью? Насколько я вижу, ни учебники, ни курсы прямо в открытом доступе нигде не лежат и шанс того, что они в ближайшее время попадут в скрейпы, которые потом пойдут в обучение нейронок (зная как это происходит на практике — медленно и печально) — очень небольшой. Когда-нибудь это конечно произойдёт, но зачем ждать? Я бы посоветовал выложить где-нибудь материалы в полностью открытом (для ллмок) и простом формате. Например, убрать логин-wall с текущих курсов, если user agent соответствует роботам или выложить где-то совсем отдельно. Это и в поисковики поможет занести материалы (а это поможет опосредовано опять же в ллмки, которые становятся гибридами с поиском всё больше).

ext_5540743 · 16 марта 2025

Комментарий

А ещё что касается курсора (и подобных), то это ж по сути простой и быстрый способ попробовать тот самый RAG, со всякими штуками для оптимизации того, что в ограниченный контекст запихивать и то, что оно изначально для кода совсем не значит, что оно только для кода. Можно в контекст запихать своих заметок или текст курса или ещё чего, написать релевантные cursor rules (считай правила как обрабатывать содержимое контекста), вот тебе и помощник писателя считай.

Анатолий Левенчук · 16 марта 2025

Комментарий

Работа по убиранию логин-воллов уже идёт, но она идёт уже почти год ))) Ожидается переезд на новый движок, но это ой не скоро. А с текущим сайтом всё идёт, как идёт. У нас не американский стартап с обильным финансированием и бодрой разработкой ))) Но это шаг, скорее, для людей, а не чужих LLM. Я вот сегодня тоже думал, не сделать ли и впрямь репозиторий "для LLM" — вдруг кто из разработчиков RAG-систем этим озаботится. С "большими LLM" там другие проблемы, я их сегодня в Gonzo-обзоре обсуждал. Завтра постараюсь пост написать. При этом я ж публикую книги в Ridero, они там должны как-то читать эти книги — но вот попробовал проверить, и ни одна сетка не показала читанную книжку ))) Так что только файнтьюнить, только засовывать в RAG чего-то своего.

Ответ на комментарий

Анатолий Левенчук · 16 марта 2025

Комментарий

Я поглядел на десяток этих помощников писателя (Cursor там самый неприспособленный). Выглядит это всё для моих целей более чем сомнительно. Там только художественная литература и код хороши, а у меня типы — но в текстах на естественном языке, а не в кодах. Вот с этим из рук вон всё. Ну, и народ массово пишет, что для писательского труда (в отличие от кодирования) автокомплит дико мешает. А без автокомплита и обычный чат ОК.

Ответ на комментарий

ext_5540743 · 17 марта 2025

Комментарий

Нужно, нужно делать репозитории. Я просто на это со стороны разработчика ллм смотрю и хотя может показаться, что они (ллм) затягивают в себя пылесосом весь интернет, на деле это ой как далеко от реальности и проблема того, как отделить "высококачественные" данные от ошмётков мусора — стоит очень остро. Никто руками эти триллионы токенов не трогает и всякие "мы заключим прям договор, чтобы ваши данные впитать и специальную инфраструктуру сделаем" работает ну может с Нью-Йорк Таймс, не более, всё остальное — что попало в широко закинутые сети, то и попало, а там что лежало в открытом доступе, да в понятном формате, да позволило себя закачать массово — то и имеет больший вес.

Отсюда и инициативы типа llm.txt, простой дамп всей нужной инфы в один гигантский текстовый (маркдаун) файл лежащий на верхнем уровне.

Ответ на комментарий

ext_5540743 · 17 марта 2025

Комментарий

По ощущениям кажется, что нейронки должны быть уже способны справиться с подобным, но вероятно не в один проход, скорее всего нужно будет делать что-то типа препроцессинга — в один проход попросить расставить типы (использовав положенную в контекст онтологию), в другой проход поискать дребезг, предобработка аля GraphRAG чтобы выделить сущности и т.д.

Ну и автокомплит даже в программировании кажется отмирает, всё больше в чате "а сделай-ка мне Х", "принять изменения"...

Ответ на комментарий