— С 28 августа OpenAI обучает новую внутреннюю модель, которая показала беспрецедентные результаты на внутренних тестах, в том числе по математике (см. выше). Она сильно лучше Astra.
— Во вторник, 1 сентября, до OpenAI дошли слухи о решении двух задач тысячелетия (откуда две...). Вдохновлённые этими слухами и резким скачком результатов внутренней модели, они решили проверить её на всех нерешённых задачах тысячелетия и нескольких других особо значимых задачах.
— Они использовали систему взаимодействующих агентов на базе этой модели. Агентам были доступны инструменты для чтения кешированной версии интернета (исправились после взлома агентами, хаха) и выполнения кода. Агенты были разделены на группы и могли общаться внутри своей группы. Размеры групп различались; в группе, которая получила решение задачи Навье — Стокса, одновременно работало около 10 000 агентов (охренеть).
— Для каждой задачи они давали разным группам агентов разные варианты её формулировки, охватив все варианты. В случае задачи Навье — Стокса отдельным группам мы предложили варианты «A» и «B» — конкретные формулировки, решение которых означало бы доказательство исходного утверждения, — и варианты «C» и «D», решение которых означало бы его опровержение. По итогу именно C и D доказали. Эти варианты не выдуманы OpenAI, они есть в официальной формулировки института, выдающего награду за решение Задач тысячелетия.
— Увидев решение одной из промежуточных задач (той же, что вчера опубликовали два математика), они сочли задачу Навье — Стокса наиболее перспективной для дальнейшей работы. Поэтому решили сосредоточить на ней ресурсы: перевели агентов с других задач и включили в их промпты решение промежуточной задачи. Когда в ходе работы стала доступна версия нашей внутренней модели, прошедшая дополнительное обучение, агентов перевели на неё.
— Через некоторое время организовали обмен наработками между группами: с помощью Codex собрали наиболее полезные идеи каждой группы. Последующие промпты опирались на промежуточные результаты самих агентов. Именно так направляли работу группы, нашедшей решение задачи Навье — Стокса. Это пересекается с тем, что было в письме математика — там автор говорил, мол, ему передали, что даже промпт в систему писали не люди, а Codex.
— Агенты получили решение в субботу, 5 сентября, примерно через 88 часов после запуска первых агентов. Формализация и проверка в Lean с помощью GPT‑6 Astra заняли ещё 17 часов.
— В общей сложности при работе над всеми задачами агенты отправили 4,9 миллиона сообщений и сгенерировали около 300 миллиардов выходных токенов.
— После завершения всего проекта и проверки в Lean, 6 сентября, OpenAI связались с авторами: исходя из слухов, OpenAI полагали, что у тех тоже есть решение задачи Навье — Стокса, и предложили одновременно опубликовать результаты и признать их приоритет в совместном объявлении (= хотели подмазаться
— Ни агенты, ни исследователи OpenAI не видели ни по каким каналам их работу до её публикации вчера вечером. В частности, для решения этой задачи OpenAI не обращались к данным конкретных пользователей.
— OpenAI не может исключить, что обезличенные данные, полученные в результате использования их продуктов, помогли «улучшить модели» (это как раз галочка «разрешить тренироваться на моих данных» в настройках). Однако по мнению OpenAI доказательства существенно различаются, а в случае промежуточной задачи различаются даже сами доказанные утверждения (с внешней силой и без неё). Хочется конечно верить, но тут будем ждать вердикта математического сообщества, насколько идеи те же и схожи, и насколько вероятно вообще, что они утекли через тренировочные данные.
— OpenAI не намерены претендовать на премию в миллион долларов за решение одной из Задач тысячелетия.





