Без заголовка
>был же вал статей про иерархический RL, например. Зачем об этом писать? Это ж общее место.
Гм, только оно переставало работать при малейших изменениях в правилах моделирования или же было слишком глупым/медленным на используемом железе.
>Про универсальность я ж ответил: одна сетка не должна быть универсальной, ровно как человек ни разу не универсален
Под "универсальностью" ваши оппоненты подразумевают несколько другое -- умение адаптироваться.
(Ведь вы не будете делать одну нейросеть для робота, который красит стены в хрущёвках, и другую нейросеть для робота, который красит стены в кирпичных домах, одну нейросеть для московского робота-водителя, другую для питерского робота-водителя, третью специально для робота-водителя для дяди Васи, итп.?)
Этот навык можно поделить на несколько уровней:
а) умеет адаптироваться к небольшим изменениям внешней среды
б) умеет адаптироваться к существенным изменениям внешней среды
в) умеет сам научиться работать в любой внешней среде
RL до AlphaZero, увы, редко дотягивал даже до уровня (а).
У AlphaZero уровень между (a) и (б).
Под человеческим уровнем подразумевается (в).
При этом, если вы увеличите сложность добывания информации о внешней среде, то RL алгоритмы упадут ещё на уровень ниже по шкале "адаптивности".
Вспомните Хайнлайна с его "специализация -- удел насекомых". Мы хотим такие универсальные алгоритмы, а не отдельную нейросеть для забивания только гвоздей только в квартире дяди Васи.