Без заголовка
Моя мама после дтп все время слышит шум и слова слышит через шум. Когда она слышит слово, тогда она начинает перебирать вероятные варианты. Например, при втором упоминании авторы не поставили слово corpus после 2000h. Моя мама, будучи мной, услышав 2000h, поняла бы, что это 2000h corpus, но лишь благодаря человеческому мозгу. Из чего я делаю вывод, что ML не сможет распознавать на равне с человеком зашумленные датасеты до тех пор, пока не сравнится с человеком по энтропии алгоритмов мозга (если можно так сказать), т.е. пока система не сможет понять статью хотя бы поверхностно (а может даже, основываясь на этих знаниях, сделать себе реинжиниринг).