Harbor - единый фреймворк для тестирования и улучшения AI-агентов… — Python Community — TG.ME

🔥 Harbor - единый фреймворк для тестирования и улучшения AI-агентов

Сравнивать Claude Code, OpenHands, Codex CLI и других агентов сложно: у каждого свои команды, окружения и форматы результатов.

Harbor превращает это в единый воспроизводимый пайплайн. Он позволяет запускать разные модели и coding-агентов на одинаковых задачах в изолированных контейнерах.

Что умеет Harbor:

- тестировать разные модели и AI-агенты;
- запускать Terminal-Bench, SWE-Bench и Aider Polyglot;
- создавать собственные бенчмарки и окружения;
- параллельно проводить тысячи экспериментов;
- собирать rollouts для RL-оптимизации;
- работать локально через Docker или в облачных sandbox-сервисах.

Установка:


uv tool install harbor

Пример запуска:


harbor run \
--dataset [email protected] \
--agent claude-code \
--model anthropic/claude-opus-4-1 \
--n-concurrent 4

Harbor используется как evaluation harness для Terminal-Bench 2.0 и распространяется по лицензии Apache 2.0.

По сути, это инфраструктурный слой для команд, которым нужно не просто запускать AI-агентов, а системно измерять их качество, сравнивать конфигурации и улучшать модели на реальных задачах.

GitHub:
https://github.com/harbor-framework/harbor

@Python_Community_ru
GitHub
GitHub - harbor-framework/harbor: Framework for evaluating and improving agents
Framework for evaluating and improving agents . Contribute to harbor-framework/harbor development by creating an account on GitHub.
August 5, 2026 619 7