Без заголовка
Действительно, не дочитал... Но вот прочитал и видно, что достаточной статистики не набрали (они там сами жалуются на размер датасета одиночного человека)... Надо было как активный эксперимент ставить, и подмешивать человеку гарантированную долю картинок на которых ошибается гугловский алгоритм (ну и наоборот гуглу человеческие). Тогда бы была статмодель явления.