در حالت Greedy، توکنهای Draft تا نخستین اختلاف با Target پذیرفته میشوند؛ اما در Sampling، پذیرش با احتمال مشخص و modified rejection sampling انجام میشود، نه بر مبنای «درست یا غلط بودن» توکن.
در نسخهی lossless، توزیع خروجی Targetتا حدود خطاهای عددی سختافزارحفظ میشود». میزان افزایش سرعت نیز به acceptance rate، اندازهی batch، هزینهی Draft و سختافزار وابسته است.
با توجه به حساسیت عملکرد عاملهای معاملاتی مبتنی بر LLM به زمان پاسخ، Speculative Decoding میتواند بهعنوان یک روش بالقوه برای کاهش تأخیر تولید در سامانههای معاملاتی LLMمحور بررسی شود؛ بااینحال، اثربخشی آن در HFT واقعی نیازمند ارزیابی تجربی مستقل است
▪️ Win Fast or Lose Slow: Balancing Speed and Accuracy in Latency-Sensitive Decisions of LLMs
#مقاله #اقتصاد #مالی
✅ @AI_DeepMind
🔸 @AI_Person
7September 6, 2026 1.8K 20