Машинное обучение RU: post #3513 — TG.ME

🔥 AutoSaddler - автоматическая оптимизация harness для AI-агентов

Идея простая: модель сама анализирует неудачные запуски агента и переписывает prompts, tools, hooks и middleware.

Но ключевая проблема - улучшение на одном наборе задач легко ломает поведение на других.

AutoSaddler решает это через held-out development set:

- анализирует failed traces
- патчит harness как обычный код
- проверяет обновление на задачах, которых модель не видела при исправлении
- сохраняет патч только если он реально улучшает общую работу агента

Авторы показывают, что без такой проверки автоматическая оптимизация может в итоге дать результат хуже исходного hand-written harness.

Полезная идея для тех, кто вручную или через LLM тюнингует агентов: считать не только исправленные ошибки, но и новые регрессии.

https://arxiv.org/abs/2608.23041
❤5👍3🤔2
August 28, 2026 1K 66