🔥 Harbor - единый фреймворк для тестирования и улучшения AI-агентов
Сравнивать Claude Code, OpenHands, Codex CLI и других агентов сложно: у каждого свои команды, окружения и форматы результатов.
Harbor превращает это в единый воспроизводимый пайплайн. Он позволяет запускать разные модели и coding-агентов на одинаковых задачах в изолированных контейнерах.
Что умеет Harbor:
- тестировать разные модели и AI-агенты;
- запускать Terminal-Bench, SWE-Bench и Aider Polyglot;
- создавать собственные бенчмарки и окружения;
- параллельно проводить тысячи экспериментов;
- собирать rollouts для RL-оптимизации;
- работать локально через Docker или в облачных sandbox-сервисах.
Установка:
uv tool install harbor
Пример запуска:
harbor run \
--dataset [email protected] \
--agent claude-code \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4
Harbor используется как evaluation harness для Terminal-Bench 2.0 и распространяется по лицензии Apache 2.0.
По сути, это инфраструктурный слой для команд, которым нужно не просто запускать AI-агентов, а системно измерять их качество, сравнивать конфигурации и улучшать модели на реальных задачах.
GitHub:
https://github.com/harbor-framework/harbor
@Python_Community_ru

GitHub
GitHub - harbor-framework/harbor: Framework for evaluating and improving agents
Framework for evaluating and improving agents . Contribute to harbor-framework/harbor development by creating an account on GitHub.
t.me/Python_Community_ru/3230Translating to English…
August 5, 2026 619 7