Как устроена нейросеть

12 июня 2017 года восемь исследователей — семеро сотрудников Google и стажер из Университета Торонто — выложили на arXiv статью “Attention Is All You Need” — «Внимание — всё, что нужно». В ней описана архитектура нейросети, получившая название «трансформер». Прошло девять лет, и на этой архитектуре построены все флагманские языковые модели: ChatGPT и Claude, Gemini и Llama, DeepSeek и GigaChat. При общей базовой архитектуре они различаются тем, на каких данных модель обучали, сколько в ней настраиваемых параметров и как ее доводили после основного обучения. Эта колонка разбирает сам принцип: что такое веса и обучение, почему создание модели стоит больше ста миллионов долларов, а один короткий запрос к готовой — доли цента, чем чат-бот…

Про прогресс

Между прочим, в детстве я чистил зубы скрипучим зубным порошком «Мятный». Его продавали в круглых картонных коробочках. Бывало, что и в квадратных жестяных банках, но это не меняет сути дела: по своему отвратительному вкусу этот сыпучий продукт напоминал школьный мел для писания на доске. Приходилось отплевываться. Второгодник Жорка как-то мужественно сжевал на перемене такой кусок мела без остатка…