Спустя 10 дней после релиза, модель на 305 млрд параметров опубликована под лицензий MIT.
Чекпоинт экспериментальный, её собрали на архитектуре V4-Flash, добавили визуальные модули и дообучили на понимание изображений, что бы получился агент, который умеет разбирать скриншоты, читать графики и работать с инструментами.
На ApexBench модель берет 36,5 балла против 26,2 у предыдущей V4-Flash-0731.
Тут сравнение не совсем честное - старая модель не поддерживает изображения во входных данных.
На Agents' Last Exam новинка дает 27,3 против 25,7 у Opus 4.8, на ZeroBench - 35,0 против 34,0.
На ApexBench и Chartography от того же Opus пока отстает - 36,5 против 39,4 и 64,3 против 65,0.
Toolathlon-Verified - 75,9 против 70,3 у предшественницы, NL2Repo - 57,7 против 54,2. Просела только Cybergym, 75,3 против 76,7.
На DeepSWE модель обходит и Opus 4.8 - 59,3 против 58,0.
На Terminal Bench 2.1 уступает - 83,9 против 85,0.
В репозитории лежат токенизатор, минимальный инференс на PyTorch с визуальным энкодером, DFlash-вниманием, MoE, Hyper-Connections и прямым проходом DSpark.
Картинки можно подавать и блоками в стиле OpenAI, и компактной записью через теги. Запускается через vLLM, SGLang, Transformers и Docker.
Cообщество уже сделало квантованные версии для локального запуска.
@ai_machinelearning_big_data
#news #ai #ml

