Оптимизация расходов на кодинговых агентов строится на двух рычагах: Harness сокращает количество передаваемых токенов и итераций, а Smart Routing снижает стоимость каждого конкретного токена за счет подбора оптимальной модели.
1. Как Harness снижает расходы (Экономия токенов)
Harness (обвязка агента) контролирует то, как LLM взаимодействует с кодом, файловой системой и терминалом. Плохой Harness передает в модель гигабайты лишнего контекста, а эффективный использует следующие механизмы:
Сжатие и фильтрация контекста (Context Pruning): При запуске тестов терминал может выдать тысячи строк логов. Неэффективный Harness отправляет в модель всё подряд. Эффективный — парсит вывод и передает модели только упавший стектрейс и конкретные 10–20 строк кода вокруг ошибки.
Кэширование промптов (Prompt Caching): Harness структурирует запросы так, чтобы базовый контекст репозитория и системные инструкции оставались статичными на протяжении всей сессии. Это позволяет задействовать KV-кэширование на стороне API провайдеров, снижая стоимость входящих токенов на 80–90%.
Компактные протоколы вызова инструментов (Tool Overheads): Для выполнения команд (прочитать файл, выполнить git status) тяжелые агенты генерируют раздутые JSON-схемы. Легковесные агенты (например, Pi) используют лаконичный текстовый синтаксис, экономя сотни токенов на каждом шаге.
Суммаризация истории: При длительной работе над задачей Harness автоматически сжимает проделанные шаги в краткое резюме, обрезая устаревшую историю диалога и предотвращая экспоненциальный рост длины контекста.
2. Как Smart Routing снижает расходы (Экономия на стоимости моделей)
Не все задачи требуют интеллекта топовых моделей стоимостью $15–$60 за миллион токенов. Smart Routing распределяет нагрузку по уровням сложности (Tiers):
Классификация задач (Task Tiering):
Простые задачи (добавление фиче-флага, обновление зависимостей, написание базовых unit-тестов) автоматически направляются на дешевые или открытые модели (GLM 5.2, DeepSeek-V3, Llama 3.3). Их стоимость в 10–30 раз ниже.
Сложные задачи (архитектурный рефакторинг, отладка межпотоковых гонок) отдаются флагманским моделям вроде Claude 3.7 Sonnet или GPT-4.5.
Каскадный метод (Escalation Strategy): Задача сначала отправляется дешевой и быстрой модели. Harness запускает linter и unit-тесты. Если тесты пройдены — задача закрыта с минимальными затратами. Если дешевая модель не справилась за 1-2 попытки, контекст автоматически передается («эскалируется») на тяжелую модель с включенным режимом рассуждений (Extended Thinking).
Динамический бюджет рассуждений (Reasoning Effort Routing): Маршрутизатор регулирует параметр количества токенов на «мыслительный процесс». На рутинных задачах reasoning отключается вовсе, а на сложных — выставляется максимум.
Совокупный экономический эффект
Компонент
Без оптимизации
С использованием Harness + Smart Routing
Объем контекста на шаг
50,000 – 100,000 токенов
5,000 – 15,000 токенов (за счет Pruning)
Стоимость 1000 токенов
$0.015 (только топовая LLM)
$0.001 – $0.003 (в среднем за счет Routing)
Повторные вызовы API
До 80% токенов платные
До 85% токенов идут из Prompt Cache (скидка 90%)
В совокупности сочетание умного обрезания контекста и динамо-маршрутизации моделей снижает итоговый чек за использование AI-агентов на 50–70%, сохраняя точность решения задач на уровне 95%+ от показателей самых дорогих систем.
https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase