Вышел MOSS-VL-Realtime - 11B vision-language model для потокового… — Python Community — TG.ME

Вышел MOSS-VL-Realtime - 11B vision-language model для потокового видео.

Не просто “загрузил ролик и получил ответ”, а режим, где модель непрерывно обрабатывает timestamped frames и может отвечать в любой момент по тому, что уже увидела.

Контекст - 256K, лицензия - Apache 2.0.

Что заявлено по бенчмаркам:

* 70.2 avg на OVOBench
* 47.2 avg на ProactiveVideoQA
* 66.0 на OmniMMI Proactive Alerting

MOSS-VL-Realtime умеет молчать, если визуальных данных пока недостаточно, а потом обновлять ответ, когда сцена меняется. Для видеоагентов это важнее, чем просто “ответить красиво”: модель должна не фантазировать раньше времени.

Есть online inference в стиле session/queue, offline API для изображений и видео, а также Instruct и Base checkpoints.

Похоже на шаг к VLM, которые работают не с готовым файлом, а с живым потоком: наблюдают, ждут, уточняют и реагируют по мере появления новых кадров.

ModelScope: https://modelscope.ai/models/openmoss/MOSS-VL-Realtime

@Python_Community_ru
t.me/Python_Community_ru/3206Translating to English…
July 21, 2026 696 8