Алгоритмические задачи — всё ещё один из главных челленджей для классических языковых моделей. Справляться с ними помогают рекурсивные модели, способные адаптировать объём вычислений под сложность задачи.
Долгое время ориентиром здесь были модели вроде HRM, URM и TRM. При создании STARM команда Сбера опиралась на исследование этих архитектурных решений: авторы воспроизвели их и выбрали наиболее эффективные компоненты. Итогом стал мощный open-source Python-фреймворк для обучения рассуждающих моделей на основе рекурсивных архитектур.
Что под капотом и почему это важно:
Забирайте инструменты для своих экспериментов






