Как устроена нейросеть
Илья Белых
12 июня 2017 года восемь исследователей — семеро сотрудников Google и стажер из Университета Торонто — выложили на arXiv статью “Attention Is All You Need” — «Внимание — всё, что нужно». В ней описана архитектура нейросети, получившая название «трансформер». Прошло девять лет, и на этой архитектуре построены все флагманские языковые модели: ChatGPT и Claude, Gemini и Llama, DeepSeek и GigaChat. При общей базовой архитектуре они различаются тем, на каких данных модель обучали, сколько в ней настраиваемых параметров и как ее доводили после основного обучения. Эта колонка разбирает сам принцип: что такое веса и обучение, почему создание модели стоит больше ста миллионов долларов, а один короткий запрос к готовой — доли цента, чем чат-бот отличается от агента и что такое оркестраторы, которые доводят задачу до результата без человека на каждом шаге. Терминов по дороге встретится много; основные собраны в шпаргалку.
https://www.trv-science.ru/2026/08/kak-ustroena-neuroset/

18
4
1August 29, 2026 1.8K 1 73