core-ai
Словарь ↗Базовая (фундаментальная) модель
Foundation model (базовая, или фундаментальная модель) — это крупномасштабная модель, обычно LLM, но также мультимодальная или модель компьютерного зрения, предобученная на широком, разнообразном датасете (значительная часть публичного интернета, книг, репозиториев кода) для развития общих способностей, с явным намерением адаптировать её впоследствии для конкретных прикладных задач, а не использовать только для одной узкой цели. Термин (введён Стэнфордским центром исследований базовых моделей в 2021 году) отражает сдвиг в том, как создаётся ИИ: вместо обучения отдельной модели с нуля для каждой задачи (анализ тональности, перевод, суммирование — каждой своя модель), вы один раз обучаете одну огромную универсальную модель за огромные деньги, а затем дёшево и многократно «адаптируете» её — через промптинг, RAG или дообучение — под сотни разных приложений. Claude, GPT-4/5, Gemini и Llama — всё это базовые модели; чат-бот поддержки клиентов SaaS-компании, ассистент код-ревью и генератор маркетинговых текстов могут быть построены на одной и той же базовой модели, различаясь только промптами, извлечённым контекстом и (иногда) дообучением. Это важно для разработчиков как ментальная модель для решений «строить самим или покупать»: практически ни одна SaaS-компания сегодня не обучает базовую модель с нуля (вычислительные затраты непомерны для всех, кроме горстки хорошо финансируемых AI-лабораторий) — вместо этого весь слой AI-продукта строится поверх базовых моделей, доступных через API или размещаемых самостоятельно открытых весов. Конкретный пример: legal-tech стартап не обучает собственную языковую модель для понимания контрактов; он берёт базовую модель вроде Claude, добавляет пайплайн RAG поверх корпуса шаблонов контрактов и судебной практики, пишет детальный системный промпт, задающий поведение юридической проверки, и выпускает «ассистента проверки контрактов» — реальная способность понимания языка полностью унаследована от базовой модели, а дифференциация продукта происходит от данных, промптов и workflow, построенного вокруг них. Базовые модели обычно делят на закрытые (доступ только через API, как Claude и GPT) и с открытыми весами (скачиваемые файлы модели, которые можно размещать у себя и модифицировать, как Llama и Mistral) — это различие важно для приватности данных, глубины кастомизации и стоимости в масштабе. Парадигма базовых моделей также переосмысливает то, как SaaS-компании думают о своём техническом рве: поскольку базовая языковая способность в значительной степени коммодитизирована и доступна любому конкуренту через те же API, устойчивая дифференциация всё больше приходит из проприетарных данных (то, что вы можете извлекать и на что можете заземлять ответы, недоступное конкурентам), интеграции в workflow (насколько глубоко AI-функция вплетена в существующую поверхность продукта) и инфраструктуры оценки/контроля качества (насколько надёжно вы можете сохранять точность AI-функции в масштабе) — а не от самой модели, к которой любой хорошо финансируемый конкурент может получить доступ на сопоставимых условиях.
Похожие термины