Z.ai выпустила GLM-5.3-Flash - мультимодальную MoE-модель на 320 млрд параметров при 18 млрд активных, с контекстом до 1 млн токенов, поддержкой текста, изображений и видео и открытыми весами по лицензии MIT.
Не будем писать очевидные вещи про важность локального запуска без передачи данных во внешний API в ряде сценариев.
Прикладные сценарии:
⚙️ техническая разведка и OSINT - обработка больших массивов документов, закупок, отчётов, фотографий и таблиц с поиском связей между ними
⚙️ анализ техники - совместная обработка фотографий, маркировок, схем, каталогов деталей и документации
⚙️ ремонт и эксплуатация - помощник по закрытой базе руководств, бюллетеней, журналов неисправностей и каталогов
⚙️ телеметрия и испытания - разбор журналов событий, графиков и результатов испытаний, написание парсеров и вспомогательного кода
⚙️ штабные и инженерные базы знаний - поиск и сведение информации из тысяч страниц внутренних документов в изолированной сети
Главный нюанс 320B-A18B: активны только около 18 млрд параметров, поэтому вычисления дешевле, но хранить всё равно нужно все веса. FP8-версия занимает примерно 306 ГиБ без учёта кэша, поэтому это не модель для ноутбука или борта БпЛА, а скорее сервер подразделения, штаба, лаборатории или КБ.
По данным Z.ai, гибридное линейное и разреженное внимание уменьшило вычислительные затраты механизма внимания примерно втрое, а объём KV-кэша - в 4,4 раза относительно GLM-5.3. Это и делает миллионный контекст практически полезным для больших архивов и досье.
То есть главный военный смысл GLM-5.3-Flash - поднять мощного мультимодального аналитического помощника внутри собственного закрытого контура и работать с данными, которые нельзя отдавать внешнему облаку.
Для локального развёртывания GLM-5.3-Flash официально поддерживает SGLang, vLLM, TokenSpeed и KTransformers; наиболее прямой вариант - vLLM: FP8-веса zai-org/GLM-5.3-Flash занимают около 306 ГиБ без учёта служебной памяти и KV-кэша, а текущая реализация vLLM рассчитана на NVIDIA Hopper и новее.
Официальный пример запускает модель с тензорным параллелизмом на четырёх ускорителях командой
vllm serve zai-org/GLM-5.3-Flash --tensor-parallel-size 4 ..., после чего она доступна внутри сети через OpenAI-совместимый API. То есть для закрытого контура достаточно один раз скачать веса, развернуть сервер с суммарно более чем 306 ГиБ видеопамяти с запасом под кэш и затем подключать к нему рабочие места, базы знаний и внутренние приложения без обращения к облаку; на Blackwell KV-кэш можно хранить в FP8, тогда как на Hopper для этой модели vLLM пока использует BF16.






