📝 #مقاله یک روش برای generative future video modeling معرفی میکند؛ یعنی مدلی که با دیدن چند فریم گذشته، چند آینده محتمل را پیشبینی کند. ایده اصلی این است که بهجای نمایش هر فریم با تعداد زیادی توکن فضایی، تغییر بین دو فریم پیاپی را فقط با یک توکن دلتا نمایش بدهیم. این توکنساز DeltaTok نام دارد و مدل نهایی DeltaWorld است. 🤖🎬
مدلهای پیشبینی آینده معمولاً دو مشکل دارند: یا discriminative هستند و فقط یک آینده میانگینشده تولید میکنند، یا اگر مولد باشند، مثل diffusion یا autoregressive video models، بسیار پرهزینهاند و برای هر نمونه آینده به چندین forward pass نیاز دارند. مقاله میگوید در کاربردهایی مثل خودرو خودران 🚗، یک پیشبینی واحد کافی نیست، چون آینده چندین حالت ممکن دارد.
ایده DeltaTok بهجای فشردهکردن کل فریم، فقط تفاوت ویژگیهای دو فریم پیاپی را فشرده میکند. فریمها ابتدا با یک Vision Foundation Model مثل DINOv3 به فضای feature تبدیل میشوند؛ سپس DeltaTok از ویژگیهای فریم قبلی و فعلی، یک delta token میسازد که نشان میدهد چگونه باید ویژگیهای فریم قبلی به فریم فعلی تبدیل شوند. دیکودر هم با گرفتن فریم قبلی و همین توکن، ویژگیهای فریم جدید را بازسازی میکند. 🔍🔄
اگر پیشبینی در فضای feature انجام شود و فقط تغییر بین فریمها مدل شود، یک توکن برای هر فریم میتواند کافی باشد. نتیجه، مدلی است که چند آینده محتمل تولید میکند، اما بسیار سبکتر و سریعتر از world modelهای مولد رایج است. ⚡️✨
🔸 A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens
#مدلهای_بنیادی #مدل_مولد #هوش_مصنوعی #بینایی_مدل_بنیادی #پردازش_تصویر #پردازش_فیلم
🎯@InfoSecTube
📌YouTube channel
🎁Boost Us
arXiv.org
A Frame is Worth One Token: Efficient Generative World Modeling...
Anticipating diverse future states is a central challenge in video world modeling. Discriminative world models produce a deterministic prediction that implicitly averages over possible futures,...

June 15, 2026 292 3