#LLM
Услышала про новую версию открытой ллм модели Google Gemma 4 и решила локально потестить современные модели на конкретной задаче, чтобы понять на сколько вообще имеет смысл делать себе агента на локальной модели. В том числе хочу сделать eval для универа в дипломной работе в рамках сравнения локальной модели и какого-нибудь флагмана по api, чтобы сравнить качество результатов.
Чатгпт собрал мне топ последних моделей. Я установила себе Gemma 4 31b QAT, Nvidia Nemotron 3 Nano Omni 30B A3B, Qwen 3.6 35B A3b, OpenAI/GPT OSS 120B.
Для всех 4 моделей делала запрос на русском языке, потому что хочу, чтобы был русский язык, без промптов, с дефолтными настройками, с mcp modelcontextprotocol/server-filesystem, чтобы модели в LM Studio имели доступ к фалйовой системе.
Первый запрос был просьбой описать картинку:
Gemma - дал довольно подробное описание на русском языке с деталями и настроением
Nemotron - описал в общих чертах на английском языке
Qwen - описал на русском языке, я бы сказала, что чуть подробнее, чем Gemma
GPT - нет функции чтения изображений 🙁
Итого - с задачей справились Gemma и Qwen. Nemotron может, но слабо.
Второй запрос: изучи файлы по пути [lectionsPlugin - мой проект плагина для браузера] - что это за проект и какие там решения сделаны.
Gemma - подробное изучение, чтение файлов, достаточно подробное описание на русском языке. Задача решена хорошо. На русском языке
Nemotron - главное разочарование. Использовал тулы 2 раза - список директорий и дерево файлов. Ответил на английском, используя свои догадки о том, что ему кажется зачем нужен этот сервис. Догадки неплохие, но очень буквальные и топорные. Уровень старых локальных моделей, чуть лучше.
Qwen - Хороший результат на русском языке, использовал только три тулы - дерево и массовое чтение файлов, самое интересное, что он прочитал именно файлы для агентов, а не файлы проекта. Были догадки, но в целом справился плюс/минус неплохо. Однако, кмк хуже, чем Gemma.
GPT - Батарея вызовов тулов и размышлений. Очень глубокое погружение, самый большой расход по токенам и по времени. Очень развернутый, форматированный, структурированный ответ. Он детально описал структуру проекта, архитектуру, выделил стек технологий, описал как пользоваться. Все четко, по делу. Никаких проблем не замечено. Идеальный ответ на русском языке.
Третий запрос: а сделай код-ревью и найди ошибки/проблемы в коде. Чтобы ты улучшил
Gemma - обнаружил критические проблемы с архитектурой, предложил годные улучшения в плане кода, неплохая структура ответа. Объем ответа средний. На русском языке
Nemotron - Впервые полноценно ответил на русском, использовал форматирование в ответе и подходящие эмоджи. Не использовал тулы, выводы делал на основе того, что ему было уже известно из истории (дерево проекта). Выводы поэтому бесполезны.
Qwen - Ответ на русском, использовал тулы, чтобы прочитать файлы с кодом, но не все. Предложений по улучшению немного и они вообще не в тему. Я бы сказала, что он провалил эту задачу.
GPT - Переиспользовал контекст, уже не повторял вызовы тулов, очень долго думал - пости 43 секунды, а затем выдал структурированный подробный отчет с приоритезацией. Правда, весь отчет на английском языке, но здесь я его прощаю, так как в остальном отчет очень хороший. Блин, топовый отчет, на самом деле. Мне даже клауд код, кажется, делал код-ревью хуже, с учетом промптов и тп.
3June 13, 2026 203