Без заголовка
вроде бы на таком уровне оно уже давно в гугле используется, так что у меня есть небольшая надежда, что тут именно смысл будет, а не та же статистика в обертке из алгоритма выбора представления.
Насчет объемов - опять же возможны варианты, начиная от того, что такие задачи весьма хорошо распараллеливаются (а уж серверов у гугла хватит), заканчивая тем фактом, что вторичного контента во всем гуглохозяйстве очень много, что сулит хотя бы вменяемую эффективность, а в будущем, очень надеюсь, деградацию копипастии.
Проблема сложная, неоднозначная, но так ведь и в гугле инженеры периодически ноют на слишком простые задачи