Вышли результаты v4 — мы на 27-м.
Честно — ждали лучшего.
Год назад мы были топ-1, но год в AI — это вечность, и за это время изменились не только модели, но и то, как их оценивают.
Давайте разберёмся:
Главный способ оценки text-to-image моделей — user-арены ⚔️
Механика там простая: тебе анонимно показывают две картинки по одному промпту, ты выбираешь лучшую.
Победитель +1, проигравший -1.
Год назад всё было понятно — выигрывал тот, у кого меньше косяков. Три руки, шесть пальцев, четыре глаза — досвидания
Сейчас качество у всех подтянулось, и победитель определяется тем, совпала ли картинка с настроением голосующего. Это уже не про качество — это про эстетику и вкус конкретного рандомного юзера.
Некоторые пошли дальше — покупают датасеты арен и обучают модели прямо на них. Читерство? Да. Работает? Тоже да.
Ну и контрольный вопрос: как модель от ChatGPT на первом месте при наличии nano banana 2? Комментарии излишни.
Поэтому высокое место в таблице — далеко не всегда лучшая модель в реальной работе.
Кстати, я вслепую из 5 картинок в трёх выбрал нашу. Так что за модель — спокоен.
Бенчмарки — бенчмарками, а мы продолжаем работать




