#дайджест
Дайджест AI/ML за неделю 24–30 августа 2026
LLM
Z.ai: GLM-5.3-Flash
Открытая MoE 320B, 18B активных, 1М и нативным зрением. Модель обучили с нуля, а не дистиллировали GLM-5.3.
У Flash 45 слоев против 92 у GLM-4.5, а attention требует в три раза меньше вычислений и в 4.4 раза меньше KV-кэша, чем у большой GLM-5.3.
На Terminal-Bench 2.1 модель получила 84.3% против 85% у Opus 4.8. Зрение тоже не декоративное: 62.4% на OfficeQA Pro.
Веса есть. До 9 сентября API стоит $0.075/$0.25. Потом тариф удвоится.
Блогпост, Веса, Цены
Alibaba: Qwen3.8-Flash-Next
Qwen открыла мультимодальную MoE. Основная модель содержит 125B параметров, еще 51B N-gram Embedding, а на каждом токене активируется всего 6B. Контекст 262К
Много всяких архитектурных фич, команда называет эту модель превью архитектуры Qwen4: Qwen Sparse Attention, Gated Residual, N‑gram embedding и другие ругательные слова, есть смысл почитать.
По большинству бенчей бьет Opus 4.6 и DeepSeek-4V-Flash.
Есть веса, по API $0.15/$0.47.
Блогпост, Техрепорт, Веса
Видео
Google: Gemini Omni 1.1 Flash
Google обновила Omni Flash и добавила базовый минимум в 2026г: Можно задавать первый и последний кадры, продлевать сцену, использовать короткое видео как референс
Генерация до 10с, но можно продлевать до 40с.
Цена составляет $0.03 за секунду в 360p, $0.10 в 720p, $0.15 в 1080p и $0.30 в 4K. 1080p и 4K получают апскейлом из 720р.
Блогпост, Документация
fal: H3 Max
fal взяла открытый MiniMax H3, дообучила его на новых данных и одновременно переписала инференс. Основной упор сделали на скорость.
Пятисекундное видео генерируется меньше чем за 3 секунды(!). Это в 35 раз быстрее API MiniMax H3.
По качеству находится среди топов в Design Arena и Artificial Analysis.
Доступна только через API, весов нет. $0.05/сек 480p и $0.08/сек 768p.
Блогпост, Модель
Аудио
Google: Gemini 3.5 Transcribe и Transcribe Live
Google выпустила две отдельные speech-to-text модели. gemini-3.5-transcribe транскрибирует, расставляет спикеров и таймкоды.
gemini-3.5-transcribe-live принимает поток и возвращает расшифровку с задержкой меньше секунды.
Обе могут удалять "эээ", самоисправления и другие артефакты человеческого инференса.
Обычная версия стоит примерно $0.005 за минуту, Live $0.009.
Блогпост, Документация, Цены
Разное...
OpenAI: Jalapeño
OpenAI показала измерения своего первого inference-чипа. Проверили на опенсорсе размеров 120B-1T, сравнивая с GB200 и GB300.
По тестам самой OpenAI, Халапеньо выдает в 1.5–1.9 раза больше ток/Вт и в 1.7–3.6 раза меньшую end-to-end задержку.
Откуда такие чудеса?
OAI говорит, из-за вертикальной интеграции от чипа, до архитектуры моделей, и собственно самих моделей в разработке. За девять месяцев родили чип. Затем Codex с Astra за два месяца оптимизировал под него модели.
Развертывание в инфраструктуре OpenAI начнется до конца года.
Результаты
Stanford: Q-Learning With World Models
Статья про то как использовать WM в RL не уча модель эксплуатировать галлюцинации. В QWM Policy и Q-функция обучаются только на реальных переходах, но перед действием агент предлагает несколько движений, World model воображает короткое будущее для каждого и выбирает ветку с максимальной ожидаемой наградой. Получается небольшой tree search перед каждым движением робота. На части бенчмарков есть хороший прирост.
Статья
Keenable: поисковик для агентов
Наши слоны из Keenable вышли из тени и выпустили SOTA агентный поиск.
Это веб-индекс заточенный под агентов. Возвращает ссылки, извлеченный текст страниц, можно в Markdown, еще есть Time Machine. Задержка - меньше 250 мс.
Также выпустили бэнчмарк NEEDLE с ежедневно обновляющимися вопросами из интернетов, чтобы нельзя было выучить ответы.
Первые 100 тысяч запросов бесплатные, затем $4 за 1к, и от $1 за 1к при нагрузке от 100 запросов/сек.
Сайт, NEEDLE
OpenAI прекращает предоставлять свои модели Cursor с 12 ноября, так как не доверяют Маску.
Заявление. Инструкция что и как будет
8
1
1
1September 1, 2026 2.1K 1 19