Исследователи из Harvard и University of Chicago проанализировали год production-трафика Chutes - миллиарды запросов к тысячам моделей. Главный вывод: реальные LLM-нагрузки сильно меняются со временем, поэтому короткие synthetic benchmarks дают слишком упрощённую картину.
Пользователь часто возвращается к той же модели с растущим контекстом. Если следующий запрос попадёт на тот же GPU, уже вычисленную часть prompt можно переиспользовать.
А обычный load balancer, который просто равномерно раскидывает запросы между GPU, может уничтожить эту cache locality.
Нужно одновременно учитывать:
* историю запросов;
* affinity к модели и prompt prefix;
* состояние cache;
* изменение traffic pattern со временем.
Авторы также подчёркивают, что production workload нельзя считать статичным: популярность моделей и структура запросов меняются на горизонте месяцев.
Paper: A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing
arXiv:
2608.13573
