Это была ошибка: неверно поняли то, что происходит. С тех пор уже много что поменялось, но речь идёт о старших моделях GPT-3.5-turbo (где 16К токенов), о замене prompt и использовании абсолютно другой системы подачи чанков. До finetune таки не дошли. Ибо finetune возможен, но задорого, и заниматься этим некому. При этом Davinci можно файтньюнить, и прямо в прайслисте есть замечание, что the performance of gpt-3.5-turbo is on par with Instruct Davinci (и instruct это же просто из коробки файнтьюненный на диалогах Davinci).
Так что пока мы просто держим возможность посадки на любой бэкенд в части сетки и просто делаем свой пайплайн на Haystack. Всё работает, играемся с промптами и размером чанков. А там поглядим.