MiniMax H3 Max: 36-кратное ускорение и открытые веса Огненные… — Метаверсище и ИИще — TG.ME

MiniMax H3 Max: 36-кратное ускорение и открытые веса

Огненные новости.

На этих двух роликах - обычный MiniMax H3 (синий галстук) в облаке Minimax Design и новый H3 Max на fal при одинаковых параметрах и на 15 секунд, 720p. 
Результат слегка непристойный: обычный H3 генерировал ролик около 6 минут, H3 Max - около 10 секунд. То есть примерно 36x разницы, причем качество как по мне чравнимо. Важно: это не чистый benchmark весов, а сравнение двух разных production-инфраструктур.

Конечно, у fal наверняка огромная дурь для инференсв, но 36x почти наверняка не объясняются одной только дурью.

А щас держите Мега новость:

fal подтвердили, что веса H3 Max будут опубликованы. На вопрос, будет ли открыт и Ref2V, ответил: “yes, working on it”. То есть речь, судя по всему, идет не просто об API, а о полноценном открытом checkpoint H3 Max и в перспективе reference-to-video версии.

И тут интересно покумекать о том, что это будут за веса, код, железо под столом.

Думаю, что ждать, что скачанный H3 Max автоматически окажется локально в 36 раз быстрее H3, не стоит. 

fal делали саму модель и inference stack практически одновременно: post-training/RL, вероятно сильно меньшее число sampling steps, оптимизированный attention, fused CUDA/Triton kernels, mixed precision, parallelism, VAE и управление памятью. 

Поэтому часть безумной скорости находится в весах, а часть - в инфраструктуре fal. И именно соотношение этих двух частей будет главным вопросом после релиза. 

Мой прогноз: просто открытые веса дадут несколько иксов относительно обычного H3, а после появления нормального SGLang/LightX2V/ComfyUI runtime, quantization и оптимизированных kernels разрыв вполне может вырасти до 8-15x

Ускорение 36x локально - утопия. Имхо.

Грубая пацанская оценка H3 Max для 15 сек / 720p после community-оптимизаций:

RTX 4090 24 GBquant/offload -десятки секунд\минуты

RTX 5090 32 GB ~30-90 с

H100 80 GB ~10-30 с

H200 141 GB ~7-20 с

B200 192 GB единицы - десятки секунд

После релиза критически важны четыре вещи: число sampling steps, отличие архитектуры от H3, рабочая precision и то, откроет ли fal вместе с весами свои inference kernels/runtime.

https://fal.ai/learn/devs/introducing-h3-max-by-fal

Но новость просто агнищще - Минимаксищще становится сакральным жупелом всей видео генерации.

Я не пощщу по нему апдейты - их примерно 10-20 в день, если брать Лоры, оптимизаторы, кванты, туторы, гайды, вае, шмае, удлинняторы и увеличаторы тайминга и разрешения.

Уже писал, что все это отслеживается тут:
https://github.com/wildminder/awesome-minimax-H3

@cgevent
🔥48❤18
August 28, 2026 5.9K 12 148