Обсуждение

В архиве: 2 комментария.

Читать и комментировать в ЖЖ ↗

ext_5540743 · 5 апреля 2025

Комментарий

> идея, что "книги будет читать AI" не оправдалась, текущие модели LLM не показывают знакомства с моими книгами (хотя я это не со всеми моделями проверял, тем не менее). Возможно, эти книги/курсы надо кормить LLM другими путями.

Конечно надо другими путями, я уже говорил, что не смотря на весь хайп про "data wall" и заканчивание чего бы ещё скормить ллмке, на практике лаборатории чрезвычайно ленивые и скупые — "ой, в дефолтном дампе/скрейпе интернета не было? Ну и невозможно значит получить эти данные", бегать по магазинам покупать отдельные экземпляры книжек они ещё даже близко не начали, а на пиратском тренировать сильно не наглеют. Так что, для попадания в базу надо класть на сильно видное место и желательно, чтобы формат был максимально простой — текст/маркдаун (а то вот например Common Corpus, на котором ВСЕ тренируются, даже пдф-ки не сохраняет, ибо дорого для них, а они волонтёры).

Такая вот парадоксальная ситуация, когда с одной стороны интернет взвыл от того, что ИИ-боты заддосили всех скрейпами, а с другой не знаешь куда информацию положить, чтобы она точно попала в следующую версию нейронки. Моя версия: класть везде, и на сайт (без логина конечно!) и на лайфджорнал и ещё на гитхабе репозиторий сделать, назвать awesome-system-thinking, тогда точно скачают! И в твиттере анонсы класть, его хотя бы грок читает, а вот телеграм вряд ли кто-то индексирует, а у вас вся активность там.