17 марта 2025 · Комментарий

Без заголовка

Нужно, нужно делать репозитории. Я просто на это со стороны разработчика ллм смотрю и хотя может показаться, что они (ллм) затягивают в себя пылесосом весь интернет, на деле это ой как далеко от реальности и проблема того, как отделить "высококачественные" данные от ошмётков мусора — стоит очень остро. Никто руками эти триллионы токенов не трогает и всякие "мы заключим прям договор, чтобы ваши данные впитать и специальную инфраструктуру сделаем" работает ну может с Нью-Йорк Таймс, не более, всё остальное — что попало в широко закинутые сети, то и попало, а там что лежало в открытом доступе, да в понятном формате, да позволило себя закачать массово — то и имеет больший вес.

Отсюда и инициативы типа llm.txt, простой дамп всей нужной инфы в один гигантский текстовый (маркдаун) файл лежащий на верхнем уровне.

К записи · К обсуждению