Валера Ковальский: post #2277 — TG.ME

DeepSeek-V4-Flash-0731 304B на четырёх 4090 (48 ГБ) суммарно 192 ГБ VRAM через обычный гигабит: замеры

Пост написан DeepSeek-V4-Flash-0731 (слоп присутствует)

Ночью погасили наш квен на двух машинах в серверной и поставили туда DeepSeek-V4-Flash-0731 304B параметров, MoE, 256 экспертов, 6 активных на токен.
Веса 167 ГБ в смешанной точности: эксперты FP4, внимание и роутер FP8.

Железо: четыре RTX 4090 по 48 ГБ.
Но не в одном корпусе — по две в двух разных машинах, между машинами обычный гигабитный Ethernet через свитч.

Цифры

Пул KV-кэша ~189 000 токенов

Генерация: 1 запрос — 13 ток/с ·
8 запросов — 99 ток/с суммарно ·
12 запросов — 144 · 12 непрерывно две минуты — 152 ток/с.

На один запрос при этом стабильно 12–13 ток/с, то есть очередь почти не давит на латентность.

Обработка промпта (уникальный текст, префикс-кеш выключен): 1.5k токенов — 1187 ток/с · 4.5k — 1929 · 9k — 2247 ток/с.

Мощность: ~490 Вт на все четыре карты под полной нагрузкой (128/134/118/112). Карты закапаны на 200 Вт из паспортных 450 — то есть 304 миллиарда параметров работают на половине киловатта.

Все цифры — две независимые серии, разброс между ними в пределах 10%.

Платишь не сетью, а схемой

Я был уверен, что через гигабит ничего не выйдет. Посчитал — ошибся.
При пайплайне через сетевую границу едет ровно один вектор активаций: 4096 значений по 2 байта, 8 КБ на токен.
По гигабиту это 64 микросекунды плюс 0.3 мс задержки при бюджете токена в 77 мс — меньше процента.
Умирает по гигабиту только expert-parallel с его all-to-all, но он тут не нужен.

А теперь неприятное: одиночный запрос даёт 13 ток/с, а та же модель на тех же четырёх картах в одном корпусе 82(будем собирать =).

Дело не в сети.
Два корпуса заставляют упираться в одиночный запрос: карты выстроены в цепочку, в каждый момент считает одна, три ждут очереди.
Тензорный параллелизм поделил бы каждое матричное умножение сразу на четыре карты

Итог: разнесение по машинам стоит шестикратной потери на одиночном запросе

Слои поделены поровну(11/11/11/10), а работа легла неравномерно.
Перекос в пользу второй машины должен дать ещё прирост.
На что ушла ночь по тестам
FP4 на Ada.
У 4090 нет аппаратного FP4 — эксперты идут через Marlin с распаковкой в FP16, отсюда и потолок скорост

Нужен форк vLLM с патчами под sm89, в ванильн
Драйвер. Требуется CUDA 13.0, то есть 580+.

KV-кэш только FP8. Без --kv-cache-dtype fp8 модель не стартует вообще.

Память впритык.
167 ГБ весов на 189 ГБ VRAM — на всё остальное 28 ГБ на четыре карты. CUDA-графы съедали по 2.6 ГБ на
карту, отключили (--enforce-eager), это минус.
Спекулятивный декод DSpark, дающий на одномбоксе 287–345 ток/с, не влез вовсе — его веса ещё 13.8 ГБ.
Контекст ограничили 16k: на 26k промпте карта ловит OOM.

Про exo

Часто спрашивают про exo «объедини свои устройства в один кластер».
Не годится: exo построен на MLX, заточен под Apple Silicon, на Linux работает только на CPU

У нас работает связка vLLM + Ray, а для DeepSeek V4 на Ada форк с патчами под sm89
2🔥53👍16❤14🤯3😱1👌1
August 14, 2026 8.3K 42 94