Тестировать модели наугад — это не стратегия, это трата денег.
Smevals — фреймворк с открытым кодом для структурированной оценки LLM. Вы пишете набор тестов (YAML-файлы), запускаете их на нужных конфигурациях моделей, а затем оцениваете результаты отдельной командой. Прогоны и оценки разделены — можно переоценивать старые запуски с новыми проверками без повторного вызова API.
Главная идея: один eval = один вопрос о модели. Например, «умеет ли GPT-4o генерировать валидный SVG?». Под него пишутся задачи, конфигурации моделей и чекеры — от простой проверки строки до вызова другой модели в качестве судьи.
Визуализация — локальный веб-сервер или статический HTML-отчёт с таблицей лидеров по моделям. Третья итерация идеи от автора — и, судя по архитектуре, наконец правильная. ⚙️
Разбираем ИИ-инструменты для бизнеса →
ИИ Инструменты | Контент-завод | База знаний

August 5, 2026 25