Data Portal | DS & ML: post #1041 — TG.ME

Безумие: теперь можно буквально в прямом эфире смотреть, как обучают модель на 535 млрд параметров.

Профессор Стэнфорда и основатель simile_ai Перси Лян объявил, что на этой неделе официально стартует обучение их новой модели Marin 535B-A23B. И весь процесс обучения будет полностью открытым.

У Marin 535 млрд параметров, из которых 23 млрд активны. Для обучения команда подготовила 18,75 трлн токенов данных и развернула 11 стоек GB200 NVL72 — это примерно 792 ускорителя GB200.

Обучение планируют вести непрерывно около трёх месяцев. Общий объём вычислений составит примерно 2,7×10²⁴ FLOPs. После этого начнётся дополнительное обучение модели.

Перед запуском основной модели команда сначала обучила так называемую Scaling Ladder из четырёх моделей — от 1,6B-A61M до 27,7B-A1.2B. Эти меньшие модели использовали, чтобы заранее предсказать потери и поведение основной модели на 535 млрд параметров.

Теперь основное обучение уже запущено, и любой желающий может в реальном времени следить за кривыми обучения. Данные, журналы экспериментов и возникающие инженерные проблемы тоже будут постепенно публиковаться.

Подобное уже было. В 2022 году, когда BigScience обучала BLOOM на 176 млрд параметров, прогресс обучения и TensorBoard тоже были открыты.

Но теперь Marin поднимает масштаб публичного обучения сразу до 535 млрд параметров.

Судя по всему, это одно из крупнейших обучений большой модели, за которым человечество когда-либо могло наблюдать публично.

Следующие три месяца должны быть очень интересными. Насколько конкурентоспособной получится модель — это отдельный вопрос. Мне гораздо интереснее увидеть, как именно обучают и настраивают MoE-модель размером более 500 млрд параметров и сколько раз всё успеет сломаться по дороге.

Такие возможности появляются крайне редко. По сути, перед всем миром открывают эксперимент по обучению модели стоимостью в десятки миллионов долларов — то, что обычно могут видеть только сотрудники крупнейших ИИ-лабораторий.
August 23, 2026 671 9