Если коротко: эпоха, когда инференс был просто одним прогоном нейросети закончилась, наступила эпоха Inference 2.0 (sic!)
В корпоративном секторе сейчас правят бал агентные системы. Один пользовательский запрос дробится на кучу задач: один агент достает данные из базы, второй анализирует, третий проверяет на соответствие политикам безопасности. Плюс поверх всего висит RAG, векторные базы и графы знаний. Инференс превратился в оркестрацию целого рабочего процесса.
Из-за этого архитектура систем сильно меняется:
Во-первых, метрики. Важны уже не голые токены в секунду, а время до полезного ответа. И этот ответ должен быть не только быстрым, но и авторизованным, и задокументированным для аудита. Если платформа А генерирует текст в два раза быстрее, но платформа Б быстрее подтягивает корпоративный контекст и права доступа, то пользователь быстрее получит результат именно от Б. Выбор в пользу Б очевиден.
Во-вторых, бутылочные горлышки. Ускорять только матричные умножения уже бессмысленно. Главная боль — управление памятью. Агенты постоянно дергают одни и те же системные промпты и контекст. Чтобы не гонять одно и то же по кругу, приходится внедрять paged attention (как в vLLM), кэширование префиксов через radix trees и спекулятивное декодирование. Управление KV-кэшем стало важнее, чем пиковые флопсы.
В-третьих, железо и интерконнекты. HBM на ускорителях не резиновая, поэтому в ход идут CXL для шеринга памяти между CPU и ускорителями без лишних копирований. А рутину вроде шифрования, сетевой сериализации и проверок прав доступа скидывают на DPU и SmartNIC, чтобы разгрузить GPU. Сам рантайм теперь работает как диспетчер: векторный поиск едет на CPU, тяжелая математика на GPU, а проверки политик — на хостовые ядра. Сеть из фона переехала прямо в критический путь выполнения запроса.
В общем , будущее наступило. А вы n8n уже активно пользуетесь, или чем-то еще?
