Российские математики вывели свою модель на первое место в ARC-AGI
Mostik показала новый способ связывать большие и маленькие AI-модели без передачи текста между ними.
Обычно одна модель пишет промежуточный ответ, а другая его читает. Mostik вместо этого передаёт скрытые внутренние состояния через небольшой обучаемый bridge. Сами модели при этом остаются замороженными.
Первый эксперимент связал GLM-5.2 на 753B параметров с Qwen-3.5 на 4B.
Большая модель только читает задачу, передаёт внутреннее состояние и останавливается. Ответ уже генерирует маленькая модель.
Результаты:
- 4B-модель закрыла около 50% разрыва до 753B
- собственная точность маленькой модели выросла примерно на 25%
- на более сложных поднаборах прирост доходил до 2x
- связка требует в 2,5 раза меньше вычислений, чем модель среднего размера с сопоставимым качеством
- latent hand-off давал до +10 п.п. по сравнению с обычной передачей текста
Большая модель не тратит дорогой decoding на написание советов для маленькой. Она делает только prefill, а генерацию берёт на себя дешёвая модель.
Mostik считает, что такой подход можно использовать для multi-agent систем, дистилляции, специализации моделей и даже исследования внутренних представлений.
https://mostik.ai/read-more
https://x.com/Machinelearrn/status/2095484584691441747
Forwarded fromMachine learning Interview

106
20
11
5
1September 3, 2026 4.2K 18 60