این مقاله بررسی می‌کند که توانایی برنامه‌ریزی چندمرحله‌ای و بلندمدت… — DeepMind AI Expert — TG.ME

این مقاله بررسی می‌کند که توانایی برنامه‌ریزی چندمرحله‌ای و بلندمدت در Agentهای مبتنی بر مدل‌های زبانی چگونه در مراحل مختلف آموزش شکل می‌گیرد. نویسندگان با ایجاد یک محیط کنترل‌شده نشان می‌دهند که در مرحله Pre-training، ساخت یک World Model داخلی برای پیش‌بینی تغییر وضعیت محیط، از پیش‌بینی مستقیم Action بهتر است. همچنین یادگیری مهارت‌های کوچک و جداگانه برای حل مسائل بلندمدت کافی نیست و حتی مقدار کمی داده Long-Horizon می‌تواند Generalization را به‌طور محسوسی بهتر کند. در مقابل، trajectoryهای ضعیف یا اشتباه اثر بسیار منفی دارند، زیرا خطاها در طول مراحل متعدد جمع و تقویت می‌شوند.
در مرحله Post-training، مقاله GRPO، On-Policy Distillation یا OPD و Multi-Teacher OPD یا MOPD را بررسی می‌کند. نتیجه این است که OPD در مسائل طولانی و زمانی که کیفیت Pre-training پایین است، معمولاً از GRPO پایدارتر عمل می‌کند؛ اما انتقال دانش از Teacher نامتناسب می‌تواند دانش قبلی Student را خراب کند. در حالت چند Teacher نیز اگر الگوهای برنامه‌ریزی آن‌ها سازگار یا مشترک باشند، MOPD می‌تواند باعث Generalization و ترکیب قابلیت‌ها شود، ولی الگوهای کاملاً متضاد می‌توانند به Catastrophic Forgetting منجر شوند.

پیام اصلی مقاله این است که Pre-training پایه اصلی توانایی Planning را ایجاد می‌کند و Post-training عمدتاً آن توانایی‌های موجود را تقویت، تنظیم یا ترکیب می‌کند، نه اینکه الزاماً آن‌ها را از صفر بسازد.

▪️ The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

#یادگیری_تقویتی #مقاله

☑️ @AI_DeepMind
@AI_Person
❤6
August 25, 2026 4.9K 48