Появилась интересная работа Self-Play Pretraining with Zero Data.
Идея: два Transformer'а обучаются с нуля. Generator пишет программы для минимальной универсальной машины Тьюринга, их выполнение генерирует последовательности байтов, а Learner учится предсказывать следующий байт. Generator обучается через RL так, чтобы создавать данные “at the frontier of the learner’s capabilities” — получается адаптивный curriculum.
При этом natural data в gradient updates вообще не используются.
После такого pretraining авторы видят zero-shot перенос на текст, изображения, аудио, речь, музыку и код: loss на реальных данных предсказуемо уменьшается с ростом self-play compute. Также появляется in-context learning, а Generator самостоятельно находит знакомые математические последовательности.
Идея авторов — получить потенциально неограниченный источник данных, “limited by compute rather than human knowledge”.
Пока это proof of concept: модели <25M параметров, context 4K. Ещё одна важная оговорка: DCLM и DNA использовались для выбора гиперпараметров, хотя в обучение весов эти данные не попадали.
https://www.alphaxiv.org/pdf/2609.30063



















