[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-image-captioning::ru":3,"gloss-cluster-image-captioning::ru":20,"gloss-next-image-captioning::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"image-captioning","output","Описание изображений (Captioning)","Описание изображений (captioning) — это генерация ИИ текстового описания на естественном языке для визуального контента — неподвижного изображения или видео, — чаще всего используемая для доступности (alt-текст для программ чтения с экрана), индексации\u002Fпоиска контента и автоматической генерации метаданных. Обратите внимание, что это отличается от субтитров (timed captions — синхронизированный экранный текст произносимого диалога, пересекающийся с транскрибацией); «описание изображений» в смысле ИИ\u002Fмашинного обучения относится к тому, как модель зрения описывает, что изображено на картинке («золотистый ретривер ловит фрисби в парке»). Современное описание изображений выполняется визуально-языковыми моделями — мультимодальными LLM (GPT-4o, Claude, Gemini) или специализированными моделями (BLIP-2, LLaVA), обученными на больших парных датасетах изображение-текст, — которые совместно кодируют изображение и генерируют связное описание, причём их можно направлять на разный уровень детализации или конкретный фокус («опиши это для незрячего пользователя, делая акцент на функции, а не эстетике» против «напиши SEO-оптимизированный alt-атрибут менее чем в 125 символов»), давая разработчикам единый гибкий API вместо необходимости отдельных специализированных моделей под каждый сценарий описания. Почему это важно для SaaS-разработчиков: автоматическое описание изображений требуется в масштабе для любой платформы со значительным объёмом пользовательского визуального контента — электронная коммерция (автогенерация alt-текста для тысяч фото товаров, как для соответствия доступности вроде WCAG, так и для SEO по поиску изображений), платформы стоковых фото\u002FDAM (автотегирование и описание материалов для облегчения поиска) и социальные\u002Fконтентные платформы, обслуживающие пользователей с нарушениями зрения. Это малозатратная, высокоценная с точки зрения соответствия требованиям функция, поскольку ручное написание alt-текста для большой медиабиблиотеки утомительно и часто пропускается. Конкретный пример — платформа электронной коммерции автогенерирует alt-текст в масштабе: (1) при загрузке фото товара фоновая задача отправляет изображение в визуально-языковую модель с промптом «Напиши краткий, описательный alt-текст для этого фото товара менее чем в 125 символов, подходящий для доступности и SEO. Не начинай с 'изображение'. Укажи материал, цвет и ключевые визуальные детали»; (2) модель возвращает «Матовая чёрная керамическая пуровер-воронка для кофе с деревянным ободком на белом фоне»; (3) alt-текст сохраняется в поле `image_alt` товара и рендерится в теге `\u003Cimg alt=\"...\">`, немедленно улучшая как доступность для незрячих покупателей через программы чтения с экрана, так и право на трафик из поиска по картинкам Google; (4) ночная пакетная задача заполняет задним числом alt-текст для ранее пустого устаревшего каталога товаров, обрабатывая фиксированный размер пакета за запуск для контроля затрат на API, и помечает любое изображение с низкой уверенностью модели (например, неоднозначное лайфстайл-фото вместо чистого предметного снимка) для ручного написания человеком.","Описание изображений\u002Fвидео — это генерация ИИ текстового описания визуального контента на естественном языке для доступности, SEO и индексации.",null,[11,14,17],{"slug":12,"name":13},"image-generation","Генерация изображений",{"slug":15,"name":16},"optical-character-recognition","Оптическое распознавание символов (OCR)",{"slug":18,"name":19},"transcription","Транскрибация (Transcription)",[21,25,29,33,36,40,43,46,49,52,55,58],{"slug":22,"category":5,"name":23,"updated_at":24},"abstention","Отказ от ответа","2026-08-24T03:30:02+00:00",{"slug":26,"category":5,"name":27,"updated_at":28},"ai-copywriting","ИИ-копирайтинг","2026-08-24T02:46:38+00:00",{"slug":30,"category":5,"name":31,"updated_at":32},"ai-watermarking","Водяные знаки ИИ","2026-08-24T02:46:37+00:00",{"slug":34,"category":5,"name":35,"updated_at":32},"aspect-ratio-control","Управление соотношением сторон",{"slug":37,"category":5,"name":38,"updated_at":39},"audio-generation","Генерация звука (Audio Generation)","2026-08-24T02:46:36+00:00",{"slug":41,"category":5,"name":42,"updated_at":32},"audio-super-resolution","Аудио-суперразрешение",{"slug":44,"category":5,"name":45,"updated_at":39},"avatar-generation","Генерация аватара (Avatar Generation)",{"slug":47,"category":5,"name":48,"updated_at":39},"background-removal","Удаление фона (Background Removal)",{"slug":50,"category":5,"name":51,"updated_at":32},"batch-image-generation","Пакетная генерация изображений",{"slug":53,"category":5,"name":54,"updated_at":28},"brand-voice","Голос бренда",{"slug":56,"category":5,"name":57,"updated_at":28},"cfg-scale","CFG Scale (шкала classifier-free guidance)",{"slug":59,"category":5,"name":60,"updated_at":32},"character-consistency","Консистентность персонажа"]