Сбер представил STARM — open-source-фреймворк для обучения рекурсивных reasoning-моделей
Решение объединило лучшие компоненты архитектур HRM, TRM и URM с собственными наработками команды:
Новый подход к reasoning: гибридная архитектура повышает стабильность обучения и качество рассуждений.
Новые SOTA-метрики: итоговые модели существенно опережают по качеству предыдущие open-source-аналоги.
Адаптивные вычисления: модель выполняет ровно столько вычислительных шагов, сколько требует сложность задачи. Полные результаты исследований и замеры качества доступнына Хабре.