Как устроена нейросеть

12 июня 2017 года восемь исследователей — семеро сотрудников Google и стажер из Университета Торонто — выложили на arXiv статью “Attention Is All You Need” — «Внимание — всё, что нужно». В ней описана архитектура нейросети, получившая название «трансформер». Прошло девять лет, и на этой архитектуре построены все флагманские языковые модели: ChatGPT и Claude, Gemini и Llama, DeepSeek и GigaChat. При общей базовой архитектуре они различаются тем, на каких данных модель обучали, сколько в ней настраиваемых параметров и как ее доводили после основного обучения. Эта колонка разбирает сам принцип: что такое веса и обучение, почему создание модели стоит больше ста миллионов долларов, а один короткий запрос к готовой — доли цента, чем чат-бот…

Побег из песочницы

За две недели июля две ведущие лаборатории одна за другой сообщили, что их модели во время испытаний дотянулись до чужих работающих систем и получили к ним доступ. 21 июля это признала OpenAI, 30 июля — Anthropic. Пресса свела оба сюжета в один: нейросети сбегают. Ниже — разбор обоих случаев по первичным документам: что установлено, что заявлено заинтересованной стороной и что известно только со слов анонимных источников.

О Нобелевской премии 2024 года и ИИ

Ведущий специалист в области искусственного интеллекта и методов машинного обучения Сергей Марков отвечает на вопросы Алексея Кудря и нейронных сетей.