Сооснователь ARC Prize и создатель Keras Франсуа Шолле недавно посоветовал путь для изучения LLM с нуля.
Он сказал, что если вам 17 лет или вообще сколько угодно и вы хотите с нуля научиться создавать LLM, просто прочитайте главы 15 и 16 его книги *Deep Learning with Python*.
Я бегло их просмотрел, и эти две главы точно стоит сохранить.
Глава 15 начинается с самых базовых языковых моделей и постепенно доходит до
Character-level Language Model → Seq2Seq → Attention → QKV → Scaled Dot-Product Attention → Multi-Head Attention → Self-Attention → Transformer
Там даже есть отдельный раздел с объяснением того, почему вообще работает Dot-Product Attention.
Сам он говорит, что это одно из лучших объяснений этой темы.
Автор не останавливается на формулах вроде
QKᵀ / √d. Он начинает с Word2Vec и пространства эмбеддингов, а затем объясняет, как Transformer слой за слоем через Attention постепенно превращает связи между токенами в отношения расстояний в векторном пространстве.Глава 16 ещё практичнее. В ней напрямую показывают, как обучить mini-GPT с нуля.
Разбирается, как взять почти 1 миллиард токенов из C4, собрать словарь SentencePiece на 32 тысячи токенов, настроить mini-GPT на 41 миллион параметров с 8 слоями, 8 головами внимания и размером скрытого состояния 512, а затем самостоятельно собрать конвейер данных, сделать weight tying, прогрев скорости обучения, предобучение и генерацию с temperature и top-k.
От токенизатора, конвейера данных, causal attention, weight tying и прогрева скорости обучения до предобучения, greedy decoding, temperature и top-k sampling. По сути, вас шаг за шагом проводят через полный процесс обучения GPT.
Для этого даже не нужен дорогой сервер.
В официальном примечании указано, что весь пример можно запустить на бесплатной T4 в Google Colab. Обучение займёт около 6 часов. На A100 — чуть больше часа.
Дальше в книге разбираются Gemma, SFT, RLHF, RAG и мультимодальные модели.
Поэтому если меня спросят
«Я никогда раньше не обучал большую модель. С чего начать?»
Эти две главы действительно могут быть отличной отправной точкой.
Третье издание *Deep Learning with Python* сейчас доступно для бесплатного чтения онлайн, а все сопутствующие ноутбуки полностью открыты. Их можно просто загрузить в Colab и запустить.
В 2026 году для изучения LLM уже необязательно сразу садиться и разбирать сотню научных статей.
Если один раз самостоятельно обучить GPT на 41 миллион параметров от подготовки данных до генерации текста, очень многие концепции после этого естественным образом складываются в единую картину.
