Отличный материал для тех, кто проектирует инфраструктуру под LLM под… — Карлсон, который живет до Сrash'a | IoT, АСУТП, Linux, AI — TG.ME

Отличный материал для тех, кто проектирует инфраструктуру под LLM под промпредприятия.

Если коротко: эпоха, когда инференс был просто одним прогоном нейросети закончилась, наступила эпоха Inference 2.0 (sic!)

В корпоративном секторе сейчас правят бал агентные системы. Один пользовательский запрос дробится на кучу задач: один агент достает данные из базы, второй анализирует, третий проверяет на соответствие политикам безопасности. Плюс поверх всего висит RAG, векторные базы и графы знаний. Инференс превратился в оркестрацию целого рабочего процесса.

Из-за этого архитектура систем сильно меняется:

Во-первых, метрики. Важны уже не голые токены в секунду, а время до полезного ответа. И этот ответ должен быть не только быстрым, но и авторизованным, и задокументированным для аудита. Если платформа А генерирует текст в два раза быстрее, но платформа Б быстрее подтягивает корпоративный контекст и права доступа, то пользователь быстрее получит результат именно от Б. Выбор в пользу Б очевиден.

Во-вторых, бутылочные горлышки. Ускорять только матричные умножения уже бессмысленно. Главная боль — управление памятью. Агенты постоянно дергают одни и те же системные промпты и контекст. Чтобы не гонять одно и то же по кругу, приходится внедрять paged attention (как в vLLM), кэширование префиксов через radix trees и спекулятивное декодирование. Управление KV-кэшем стало важнее, чем пиковые флопсы.

В-третьих, железо и интерконнекты. HBM на ускорителях не резиновая, поэтому в ход идут CXL для шеринга памяти между CPU и ускорителями без лишних копирований. А рутину вроде шифрования, сетевой сериализации и проверок прав доступа скидывают на DPU и SmartNIC, чтобы разгрузить GPU. Сам рантайм теперь работает как диспетчер: векторный поиск едет на CPU, тяжелая математика на GPU, а проверки политик — на хостовые ядра. Сеть из фона переехала прямо в критический путь выполнения запроса.


В общем , будущее наступило. А вы n8n уже активно пользуетесь, или чем-то еще?
🤔
EDN
Inference 2.0: How enterprise AI is reshaping AI system architectures - EDN
Enterprise AI is turning inference from a model-level computation into a context-aware workflow. System architects must now reconsider what AI performance really means.
August 11, 2026 193 1