InfoSecTube: post #2489 — TG.ME

📝 #مقاله یک روش برای generative future video modeling معرفی می‌کند؛ یعنی مدلی که با دیدن چند فریم گذشته، چند آینده محتمل را پیش‌بینی کند. ایده اصلی این است که به‌جای نمایش هر فریم با تعداد زیادی توکن فضایی، تغییر بین دو فریم پیاپی را فقط با یک توکن دلتا نمایش بدهیم. این توکن‌ساز DeltaTok نام دارد و مدل نهایی DeltaWorld است. 🤖🎬

مدل‌های پیش‌بینی آینده معمولاً دو مشکل دارند: یا discriminative هستند و فقط یک آینده میانگین‌شده تولید می‌کنند، یا اگر مولد باشند، مثل diffusion یا autoregressive video models، بسیار پرهزینه‌اند و برای هر نمونه آینده به چندین forward pass نیاز دارند. مقاله می‌گوید در کاربردهایی مثل خودرو خودران 🚗، یک پیش‌بینی واحد کافی نیست، چون آینده چندین حالت ممکن دارد.

ایده DeltaTok به‌جای فشرده‌کردن کل فریم، فقط تفاوت ویژگی‌های دو فریم پیاپی را فشرده می‌کند. فریم‌ها ابتدا با یک Vision Foundation Model مثل DINOv3 به فضای feature تبدیل می‌شوند؛ سپس DeltaTok از ویژگی‌های فریم قبلی و فعلی، یک delta token می‌سازد که نشان می‌دهد چگونه باید ویژگی‌های فریم قبلی به فریم فعلی تبدیل شوند. دیکودر هم با گرفتن فریم قبلی و همین توکن، ویژگی‌های فریم جدید را بازسازی می‌کند. 🔍🔄

اگر پیش‌بینی در فضای feature انجام شود و فقط تغییر بین فریم‌ها مدل شود، یک توکن برای هر فریم می‌تواند کافی باشد. نتیجه، مدلی است که چند آینده محتمل تولید می‌کند، اما بسیار سبک‌تر و سریع‌تر از world modelهای مولد رایج است. ⚡️

🔸 A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens

#مدلهای_بنیادی #مدل_مولد #هوش_مصنوعی #بینایی_مدل_بنیادی #پردازش_تصویر #پردازش_فیلم

🎯@InfoSecTube
📌YouTube channel
🎁Boost Us
arXiv.org
A Frame is Worth One Token: Efficient Generative World Modeling...
Anticipating diverse future states is a central challenge in video world modeling. Discriminative world models produce a deterministic prediction that implicitly averages over possible futures,...
June 15, 2026 292 3