Диффузионная модель (Diffusion Model)

Диффузионная модель — это архитектура генеративного AI, доминирующий подход, лежащий в основе современной генерации изображений (Midjourney, Stable Diffusion, DALL-E), а также всё чаще генерации аудио и видео, — которая работает, обучаясь обращать вспять процесс постепенного добавления случайного шума к данным. Во время обучения модели показывают изображения с постепенно увеличивающимся уровнем шума, пока они не превратятся в чистые помехи, и она учится предсказывать и убирать этот шум шаг за шагом. При генерации этот процесс запускается в обратном направлении: начиная с чистого случайного шума, модель итеративно устраняет его за много шагов (направляемая текстовым промптом через технику под названием classifier-free guidance), постепенно превращая случайные помехи в связное изображение, соответствующее промпту. Это архитектурно отличается от трансформерных LLM, генерирующих текст токен за токеном — диффузионные модели генерируют целое изображение постепенно и целостно за множество проходов уточнения, а не по одной дискретной единице за раз, хотя современные мультимодальные системы всё чаще сочетают трансформерные компоненты (для понимания текстового промпта) с диффузионными компонентами (для собственно синтеза изображения). Это важно для разработчиков SaaS в сфере AI-изображений и творческих инструментов, где диффузионные модели являются движком таких продуктовых функций, как генераторы AI-портретов, создатели маркетинговых материалов, инструменты для макетов продукта и генераторы логотипов. Конкретный пример: функция "создать hero-изображение" в дизайнерском SaaS-инструменте отправляет промпт вроде `"минималистичное предметное фото керамической кофейной кружки на деревянном столе, мягкий утренний свет, малая глубина резкости"` в API диффузионной модели (например, Stable Diffusion XL или DALL-E 3); модель начинает со случайного шумового изображения размера целевого выходного файла, затем примерно за 20-50 шагов устранения шума — каждый шаг немного приближает изображение к тому, что описано в промпте, как это понимает подключённый текстовый энкодер — пока не появится всё более чёткая, связная фотография. Разработчики, интегрирующие диффузионные модели, настраивают такие параметры, как guidance scale (насколько строго вывод следует промпту против того, сколько творческой свободы берёт модель) и число шагов (больше шагов обычно означает более высокое качество, но более медленную и дорогую генерацию), и всё чаще используют техники дообучения вроде LoRA для обучения диффузионных моделей определённому визуальному стилю или эстетике бренда. Диффузионные модели также вычислительно тяжелее на одну генерацию, чем большинство вызовов LLM для генерации текста, потому что создание одного изображения требует множества последовательных шагов устранения шума (каждый из которых сам по себе является прямым проходом через нейросеть), а не однопроходной генерации текста токен за токеном — поэтому API генерации изображений обычно имеют заметно более высокую задержку (секунды, а не миллисекунды) и стоимость за генерацию по сравнению со сравнимым по длине текстовым ответом, и поэтому техники, сокращающие требуемое число шагов (например, дистиллированные варианты "turbo" или "lightning" популярных диффузионных моделей), стали коммерчески важны для функций генерации изображений в реальном времени или большого объёма.

Похожие термины

Ещё термины: Основы ИИ