Даже странно что за 9 месяцев с момента появления скиллов я ни разу про них не написал. Пора закрыть этот гэп, потому что скиллы стали де-факто стандартом для повторяемых инструкций агенту и основным способом расширения его возможностей.
Что такое скилл
Скилл - повторяемый способ решения целого класса задач: инструкции, скрипты, шаблоны, документацию и критерии проверки.
Скилл упаковывается в папку с SKILL.md в определенном формате + файлы скриптов, примеров, инструкций и других артефактов. Так выглдяит типичная папка скилла:
code-review/
├── SKILL.md
├── scripts/
├── references/
└── assets/
В
SKILL.md есть metadata, по которым агент понимает, когда использовать skill, и сами инструкции:---
name: code-review
description: Reviews pull requests for bugs,
security issues and project conventions.
Use when asked to review a PR.
---
1. Read the project instructions.
2. Inspect the diff and related code.
3. Run relevant tests.
4. Report findings by severity.
Скиллы подгружаются в контекст постепенно:
1. Агент всегда видит только
name и description - около 100 токенов на skill.2. Полный
SKILL.md загружается, только когда skill подходит задаче - рекомендация до 5 000 токенов.3. Скрипты и references читаются только при необходимости.
Это позволяет подключить много скиллов и не загружать все инструкции в контекст сразу. Формат уже поддерживают Claude Code, Codex, GitHub Copilot, Cursor и другие инструменты.
Как использование скиллов влияет на качество
Качество должно улучшаться, но результат сильно зависит от качества самого скилла.
В SkillsBench протестировали 87 задач из 8 областей на 18 комбинациях моделей и agent harnesses. Curated skills повысили средний pass rate с 33,9% до 50,5%. Для отдельных конфигураций прирост составил от 4,1 до 25,7 процентов. Skills из 2-3 сфокусированных модулей работали лучше больших пакетов документации.
Если же добавить этап поиска скилла, то результаты ухудшаются. В исследовании с каталогом из 34 000 скиллов преимущество почти исчезало по мере усложнения поиска. Retrieval и адаптация найденного скилла под запрос повысили результат Claude Opus 4.6 на Terminal-Bench 2.0 с 57,7% до 65,5%.
Качество публичных скиллов низкое. Авторы анализа 138 133 файлов SKILL.md нашли нарушения спецификации в 89,3%.
Более того использование скилла может ухудшить результат. Данная статья отмечает падение pass rate на 16 из 84 задач SkillsBench. Часто агент выполнял избыточный процесс, запускал ненужные проверки или следовал инструкции, не подходящей окружению.
Как начать работать со скиллами
Я бы не советовал скачивать всё подряд из маркетплейсов. Скиллы могут содержать исполняемые скрипты и небезопасные инструкции.
Нормальный процесс выглядит так:
1. Найти скилл в доверенном каталоге или создать под повторяющуюся задачу.
2. Проверить
SKILL.md, скрипты, зависимости и требуемые разрешения.3. Подключить его на уровне пользователя или конкретного репозитория.
4. Сравнить выполнение одинаковых задач со скиллом и без него.
5. Исправлять скилл после реальных ошибок агента.
Рассказ как делать eval скиллов заслуживает отдельного поста, но точно нужен code review + несколько тестовых прогонов.
Откуда брать скиллы
1. Из публичных репозиториев или каталогов - самый популярный skills.sh.
2. Создавать самому с помощью AI агентов. Можно делать это проактивно, но, на мой взгляд, эффективнее анализировать свои задачи и создавать скиллы на основе повторяющихся задач и сессий для них. Гайд по созданию скиллов от Антропик
3. На уровне компании и проекта должны быть репоризитории с уже существующими и проверенными скиллами.
@max_about_ai



