output
Словарь ↗Описание изображений (Captioning)
Описание изображений (captioning) — это генерация ИИ текстового описания на естественном языке для визуального контента — неподвижного изображения или видео, — чаще всего используемая для доступности (alt-текст для программ чтения с экрана), индексации/поиска контента и автоматической генерации метаданных. Обратите внимание, что это отличается от субтитров (timed captions — синхронизированный экранный текст произносимого диалога, пересекающийся с транскрибацией); «описание изображений» в смысле ИИ/машинного обучения относится к тому, как модель зрения описывает, что изображено на картинке («золотистый ретривер ловит фрисби в парке»). Современное описание изображений выполняется визуально-языковыми моделями — мультимодальными LLM (GPT-4o, Claude, Gemini) или специализированными моделями (BLIP-2, LLaVA), обученными на больших парных датасетах изображение-текст, — которые совместно кодируют изображение и генерируют связное описание, причём их можно направлять на разный уровень детализации или конкретный фокус («опиши это для незрячего пользователя, делая акцент на функции, а не эстетике» против «напиши SEO-оптимизированный alt-атрибут менее чем в 125 символов»), давая разработчикам единый гибкий API вместо необходимости отдельных специализированных моделей под каждый сценарий описания. Почему это важно для SaaS-разработчиков: автоматическое описание изображений требуется в масштабе для любой платформы со значительным объёмом пользовательского визуального контента — электронная коммерция (автогенерация alt-текста для тысяч фото товаров, как для соответствия доступности вроде WCAG, так и для SEO по поиску изображений), платформы стоковых фото/DAM (автотегирование и описание материалов для облегчения поиска) и социальные/контентные платформы, обслуживающие пользователей с нарушениями зрения. Это малозатратная, высокоценная с точки зрения соответствия требованиям функция, поскольку ручное написание alt-текста для большой медиабиблиотеки утомительно и часто пропускается. Конкретный пример — платформа электронной коммерции автогенерирует alt-текст в масштабе: (1) при загрузке фото товара фоновая задача отправляет изображение в визуально-языковую модель с промптом «Напиши краткий, описательный alt-текст для этого фото товара менее чем в 125 символов, подходящий для доступности и SEO. Не начинай с 'изображение'. Укажи материал, цвет и ключевые визуальные детали»; (2) модель возвращает «Матовая чёрная керамическая пуровер-воронка для кофе с деревянным ободком на белом фоне»; (3) alt-текст сохраняется в поле `image_alt` товара и рендерится в теге `<img alt="...">`, немедленно улучшая как доступность для незрячих покупателей через программы чтения с экрана, так и право на трафик из поиска по картинкам Google; (4) ночная пакетная задача заполняет задним числом alt-текст для ранее пустого устаревшего каталога товаров, обрабатывая фиксированный размер пакета за запуск для контроля затрат на API, и помечает любое изображение с низкой уверенностью модели (например, неоднозначное лайфстайл-фото вместо чистого предметного снимка) для ручного написания человеком.
Похожие термины