Машиннное обучение | Наука о данных Библиотека: post #1456 — TG.ME

🔥 Год production-трафика показал: быстрый LLM-serving начинается не со scheduler, а с понимания поведения пользователей

Исследователи из Harvard и University of Chicago проанализировали год production-трафика Chutes - миллиарды запросов к тысячам моделей. Главный вывод: реальные LLM-нагрузки сильно меняются со временем, поэтому короткие synthetic benchmarks дают слишком упрощённую картину.


Пользователь часто возвращается к той же модели с растущим контекстом. Если следующий запрос попадёт на тот же GPU, уже вычисленную часть prompt можно переиспользовать.

А обычный load balancer, который просто равномерно раскидывает запросы между GPU, может уничтожить эту cache locality.


Нужно одновременно учитывать:

* историю запросов;
* affinity к модели и prompt prefix;
* состояние cache;
* изменение traffic pattern со временем.

Авторы также подчёркивают, что production workload нельзя считать статичным: популярность моделей и структура запросов меняются на горизонте месяцев.

Paper: A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing
arXiv: 2608.13573
❤3
August 18, 2026 1.4K 10