🚀 NUEVO: LongCat-Video de Meituan – Modelo Fundacional de Generación de Video
Meituan ha lanzado LongCat-Video, un modelo de generación de video de 13.6B parámetros que destaca por su arquitectura unificada y su capacidad para generar videos largos con estabilidad.
🔥 Características Principales:
* Arquitectura Unificada: Maneja Text-to-Video, Image-to-Video y Video-Continuation en un solo modelo.
* Videos Largos: Entrenado nativamente para generación prolongada, evitando la deriva de color y la degradación de calidad en videos de varios minutos.
* Inferencia Eficiente: Genera videos a 720p y 30fps en minutos gracias a una estrategia coarse-to-fine y Block Sparse Attention.
* RLHF Multi-Recompensa: Optimizado con GRPO, ofreciendo calidad comparable a soluciones comerciales líderes.
🎭 Versión Avatar 1.5:
Se ha liberado una versión mejorada para generación de avatares impulsada por audio:
* Mejor Sincronización Labial: Reemplaza Wav2Vec2 con Whisper-Large para mayor precisión.
* Inferencia Rápida: Acelerada a 8 pasos mediante distillation.
* Multistream: Soporte para múltiples entradas de audio y dominios estilizados (anime, animales, etc.).
📊 Rendimiento Comparativo (MOS Internal):
* Text-to-Video: Empuja 3.76 en Text-Alignment y 3.38 en Overall Quality, compitiendo de cerca con modelos propietarios como Veo3 y PixVerse.
* Eficiencia: Con solo 13.6B parámetros (densos), iguala o supera a modelos MoE de 28B como Wan 2.2.
📂 Recursos Disponibles:
* Código y pesos en 🤗 HuggingFace.
* Reporte técnico.
* Licencia: MIT.
Ideal para desarrolladores e investigadores que buscan modelos de código abierto de alto rendimiento en generación de video.
🔗 Repositorio: meituan-longcat/LongCat-Video
@todoIA