Как устроена нейросеть

12 июня 2017 года восемь исследователей — семеро сотрудников Google и стажер из Университета Торонто — выложили на arXiv статью “Attention Is All You Need” — «Внимание — всё, что нужно». В ней описана архитектура нейросети, получившая название «трансформер». Прошло девять лет, и на этой архитектуре построены все флагманские языковые модели: ChatGPT и Claude, Gemini и Llama, DeepSeek и GigaChat. При общей базовой архитектуре они различаются тем, на каких данных модель обучали, сколько в ней настраиваемых параметров и как ее доводили после основного обучения. Эта колонка разбирает сам принцип: что такое веса и обучение, почему создание модели стоит больше ста миллионов долларов, а один короткий запрос к готовой — доли цента, чем чат-бот…

Генератор, который заменит нас

Желание многих преподавателей иметь для своего предмета генератор задач, причем достаточно разнообразных, чтобы у школьников и студентов даже не возникало желания списывать, — это желание понятно и естественно. Преподаватель, которому доставляет удовольствие лично придумать красивую задачу, смотрится нынче как тираннозавр (а его коллега другого пола — как латимерия). Что сделано и что может быть сделано в этом направлении?