Трансформер

Трансформер (transformer) — это архитектура нейросети, представленная в статье Google 2017 года «Attention Is All You Need», которая заменила более ранние рекуррентные архитектуры (RNN/LSTM) в качестве фундамента современных языковых моделей ИИ. Её ключевое новшество — механизм самовнимания (self-attention), который позволяет модели при обработке каждого токена динамически оценивать релевантность каждого другого токена во входных данных — параллельно, а не последовательно, что делает трансформеры одновременно более способными улавливать дальние взаимосвязи в тексте и значительно более эффективными для обучения на современном GPU/TPU-железе, поскольку вычисления внимания хорошо распараллеливаются сразу на множестве процессоров. Это важно для разработчиков в основном как фоновый контекст: практически каждая LLM, с которой вы будете интегрироваться — Claude, GPT, Gemini, Llama, Mistral — является трансформером (или близким архитектурным вариантом), поэтому понимание базовой формы объясняет реальное, наблюдаемое поведение. Трансформер обрабатывает текст через уложенные друг на друга слои, каждый из которых сочетает подслой самовнимания (какие токены должны влиять на какие другие токены) и подслой прямого распространения (feed-forward, далее трансформирующий представление каждого токена), а финальный слой выдаёт распределение вероятностей по словарю для того, какой токен идёт следующим. Упрощённый конкретный пример: при вводе «Кот сидел на ___» механизм внимания трансформера позволяет модели заметить, что «кот» и «сидел» сильно релевантны для предсказания следующего слова, придавая им больший вес, чем «на», и выдаёт распределение вероятностей, сильно склоняющееся к словам вроде «коврике», «полу» или «стуле». Архитектурно трансформеры бывают трёх видов, релевантных разным задачам: только-энкодер (encoder-only, как BERT — хорош в понимании/классификации, лежит в основе многих моделей эмбеддингов), только-декодер (decoder-only, как GPT и Claude — хорош в генерации, авторегрессивно предсказывает следующий токен) и энкодер-декодер (encoder-decoder, как T5 — хорош в задачах «последовательность-в-последовательность», например переводе). Почти все современные чат-ориентированные LLM — это декодер-only трансформеры. Знание этого помогает объяснить, почему LLM обрабатывают вход не последовательно (внимание уделяется всем токенам сразу, а не читается слева направо, как человеком), почему более длинные входные данные стоят больше вычислений (стоимость внимания в исходном дизайне масштабируется примерно квадратично с длиной последовательности, хотя более новые техники это смягчают) и почему одна и та же базовая архитектура питает и крошечную модель на устройстве, и топовую модель с триллионом параметров. Распараллеливаемый дизайн трансформера — это именно то, что сделало возможной текущую эпоху масштабирования ИИ: поскольку вычисление внимания для каждого токена может выполняться одновременно на множестве ядер GPU, а не ждать завершения предыдущего токена (как того требовали более старые рекуррентные архитектуры), трансформеры можно было обучать на гораздо больших датасетах за гораздо меньшее реальное время — соответствие железа и архитектуры, которое напрямую позволило скачок от маленьких исследовательских моделей к сегодняшним массивным топовым LLM. Разработчикам не нужно самим реализовывать внутренности трансформера (практически к каждой модели обращаются через API или готовую библиотеку), но понимание этой параллельной, управляемой вниманием структуры объясняет, почему порядок и структура промпта реально влияют на качество вывода, и почему техники вроде ретривала, сокращающие нерелевантный контекст, как правило улучшают результаты.

Похожие термины

Ещё термины: Основы ИИ