Inteligencia Artificial: post #34972 — TG.ME

🚀 NUEVO: LongCat-Video de Meituan – Modelo Fundacional de Generación de Video

Meituan ha lanzado LongCat-Video, un modelo de generación de video de 13.6B parámetros que destaca por su arquitectura unificada y su capacidad para generar videos largos con estabilidad.

🔥 Características Principales:
* Arquitectura Unificada: Maneja Text-to-Video, Image-to-Video y Video-Continuation en un solo modelo.
* Videos Largos: Entrenado nativamente para generación prolongada, evitando la deriva de color y la degradación de calidad en videos de varios minutos.
* Inferencia Eficiente: Genera videos a 720p y 30fps en minutos gracias a una estrategia coarse-to-fine y Block Sparse Attention.
* RLHF Multi-Recompensa: Optimizado con GRPO, ofreciendo calidad comparable a soluciones comerciales líderes.

🎭 Versión Avatar 1.5:
Se ha liberado una versión mejorada para generación de avatares impulsada por audio:
* Mejor Sincronización Labial: Reemplaza Wav2Vec2 con Whisper-Large para mayor precisión.
* Inferencia Rápida: Acelerada a 8 pasos mediante distillation.
* Multistream: Soporte para múltiples entradas de audio y dominios estilizados (anime, animales, etc.).

📊 Rendimiento Comparativo (MOS Internal):
* Text-to-Video: Empuja 3.76 en Text-Alignment y 3.38 en Overall Quality, compitiendo de cerca con modelos propietarios como Veo3 y PixVerse.
* Eficiencia: Con solo 13.6B parámetros (densos), iguala o supera a modelos MoE de 28B como Wan 2.2.

📂 Recursos Disponibles:
* Código y pesos en 🤗 HuggingFace.
* Reporte técnico.
* Licencia: MIT.

Ideal para desarrolladores e investigadores que buscan modelos de código abierto de alto rendimiento en generación de video.

🔗 Repositorio: meituan-longcat/LongCat-Video

@todoIA
❤5👍1
August 21, 2026 983 11