Без заголовка
Всё очень просто с мыслеобразами и когнитивным кодированием.
В пространстве проекции мыслеобразов на текст -- кодируем последовательности из одного или более слов в виде сжимающего отображения.
p1 = ("Василий", "Петрович")
p2 = ("Я", "Пришёл", "Домой")
И так далее.
q[i] = code(p[i]) , такое, что similar(p[a], p[b]) => similar(q[a], q[b]) . Правда, сложно определить что такое similarity без мозга, поэтому пользуются суррогатами: близость перевода, или "рядом были те же слова", или "слова относятся к одной картинке", или "вместе с этими фразами поставили одну и ту же оценку на imdb" или ещё каким.
В Machine Translation как раз используется векторное кодирование слов + иерархия LSTM для подобного сжатия. Не идеально работает, конечно, но неплохое приближение.
Для визуальных проекций -- берётся распознавание образов и полученные в его рамках вектора с предпоследнего слоя нейросети.
И тому подобное. В общем, технология вполне работает, хоть и прожорливая и ненадёжная.