🔥 AutoSaddler - автоматическая оптимизация harness для AI-агентов
Идея простая: модель сама анализирует неудачные запуски агента и переписывает prompts, tools, hooks и middleware.
Но ключевая проблема - улучшение на одном наборе задач легко ломает поведение на других.
AutoSaddler решает это через held-out development set:
- анализирует failed traces
- патчит harness как обычный код
- проверяет обновление на задачах, которых модель не видела при исправлении
- сохраняет патч только если он реально улучшает общую работу агента
Авторы показывают, что без такой проверки автоматическая оптимизация может в итоге дать результат хуже исходного hand-written harness.
Полезная идея для тех, кто вручную или через LLM тюнингует агентов: считать не только исправленные ошибки, но и новые регрессии.
https://arxiv.org/abs/2608.23041

5
3
2August 28, 2026 1K 66