Как устроена нейросеть

12 июня 2017 года восемь исследователей — семеро сотрудников Google и стажер из Университета Торонто — выложили на arXiv статью “Attention Is All You Need” — «Внимание — всё, что нужно». В ней описана архитектура нейросети, получившая название «трансформер». Прошло девять лет, и на этой архитектуре построены все флагманские языковые модели: ChatGPT и Claude, Gemini и Llama, DeepSeek и GigaChat. При общей базовой архитектуре они различаются тем, на каких данных модель обучали, сколько в ней настраиваемых параметров и как ее доводили после основного обучения. Эта колонка разбирает сам принцип: что такое веса и обучение, почему создание модели стоит больше ста миллионов долларов, а один короткий запрос к готовой — доли цента, чем чат-бот…

Головоломки, снежинки и перестановки

Известной проблемой научно-популярных текстов по математике является то, что математику сложно объяснять без формул, что называется, на естественном языке. И хотя совсем от формульных выражений избавиться при рассказе о ней невозможно, я решил попробовать рассказать об одном математическом сюжете на уровне бытовой мотивации. И в местах, где нужно пользоваться соответствующими теоремами, ограничиться ссылками на доказательства.