Data Portal | DS & ML: post #1049 — TG.ME

Если хотите разобраться, как обучить большую модель с нуля, рекомендую посмотреть вот это ↓

Сооснователь ARC Prize и создатель Keras Франсуа Шолле недавно посоветовал путь для изучения LLM с нуля.

Он сказал, что если вам 17 лет или вообще сколько угодно и вы хотите с нуля научиться создавать LLM, просто прочитайте главы 15 и 16 его книги *Deep Learning with Python*.

Я бегло их просмотрел, и эти две главы точно стоит сохранить.

Глава 15 начинается с самых базовых языковых моделей и постепенно доходит до

Character-level Language Model → Seq2Seq → Attention → QKV → Scaled Dot-Product Attention → Multi-Head Attention → Self-Attention → Transformer

Там даже есть отдельный раздел с объяснением того, почему вообще работает Dot-Product Attention.

Сам он говорит, что это одно из лучших объяснений этой темы.

Автор не останавливается на формулах вроде QKᵀ / √d. Он начинает с Word2Vec и пространства эмбеддингов, а затем объясняет, как Transformer слой за слоем через Attention постепенно превращает связи между токенами в отношения расстояний в векторном пространстве.

Глава 16 ещё практичнее. В ней напрямую показывают, как обучить mini-GPT с нуля.

Разбирается, как взять почти 1 миллиард токенов из C4, собрать словарь SentencePiece на 32 тысячи токенов, настроить mini-GPT на 41 миллион параметров с 8 слоями, 8 головами внимания и размером скрытого состояния 512, а затем самостоятельно собрать конвейер данных, сделать weight tying, прогрев скорости обучения, предобучение и генерацию с temperature и top-k.

От токенизатора, конвейера данных, causal attention, weight tying и прогрева скорости обучения до предобучения, greedy decoding, temperature и top-k sampling. По сути, вас шаг за шагом проводят через полный процесс обучения GPT.

Для этого даже не нужен дорогой сервер.

В официальном примечании указано, что весь пример можно запустить на бесплатной T4 в Google Colab. Обучение займёт около 6 часов. На A100 — чуть больше часа.

Дальше в книге разбираются Gemma, SFT, RLHF, RAG и мультимодальные модели.

Поэтому если меня спросят

«Я никогда раньше не обучал большую модель. С чего начать?»

Эти две главы действительно могут быть отличной отправной точкой.

Третье издание *Deep Learning with Python* сейчас доступно для бесплатного чтения онлайн, а все сопутствующие ноутбуки полностью открыты. Их можно просто загрузить в Colab и запустить.

В 2026 году для изучения LLM уже необязательно сразу садиться и разбирать сотню научных статей.

Если один раз самостоятельно обучить GPT на 41 миллион параметров от подготовки данных до генерации текста, очень многие концепции после этого естественным образом складываются в единую картину.
August 25, 2026 355 32