[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-small-language-model::ru":3,"gloss-cluster-small-language-model::ru":23,"gloss-next-small-language-model::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"small-language-model","core-ai","Малая языковая модель (SLM)","Малая языковая модель (Small Language Model, SLM) — это языковая модель, намеренно построенная и обученная в гораздо меньшем масштабе параметров, чем передовые LLM — обычно от нескольких сотен миллионов до нескольких миллиардов параметров против десятков или сотен миллиардов (или больше) у передовых моделей — оптимизированная для эффективной работы на ограниченном оборудовании, включая потребительские ноутбуки, телефоны и даже встраиваемые устройства, а не требующая GPU дата-центра. SLM жертвуют частью общих возможностей и широты знаний ради резкого выигрыша в скорости, стоимости, приватности и простоте развёртывания: хорошо обученная SLM может выполнять инференс с почти мгновенной задержкой прямо на устройстве, с нулевой платой за токен через API и без того, чтобы какие-либо данные покидали устройство, — ценой меньшей эффективности в сложных, открытых задачах рассуждения по сравнению с передовой моделью. Это важно для разработчиков SaaS и приложений в конкретных, ценных сценариях использования, где такой компромисс оправдан: функции на устройстве, которые должны работать офлайн или с строгими гарантиями приватности (локальный поиск\u002Fсуммаризация в приложении для заметок, предсказание следующего слова в клавиатуре, голосовой ассистент на устройстве), узкие, чётко определённые задачи, где дообученная малая модель может сравняться по точности с гораздо более крупной общей моделью (классификация, простое извлечение данных, генерация в определённом формате), и чувствительные к стоимости высоконагруженные приложения, где маршрутизация простых запросов на SLM с эскалацией только сложных на передовую модель резко снижает общие расходы на API. Конкретный пример: мобильное приложение для заметок хочет предложить функции «суммировать эту заметку» и «извлечь пункты действий», которые работают мгновенно, офлайн и без отправки чьих-либо личных заметок в облачный API. Разработчики встраивают небольшую (примерно 1-3 миллиарда параметров), квантованную модель с открытыми весами прямо в приложение, выполняя инференс полностью на устройстве пользователя — функция отвечает менее чем за секунду с нулевым сетевым обращением и без утечки данных с телефона, принимая, что резюме получаются несколько менее отточенными, чем то, что произвела бы облачная передовая модель, потому что для этой конкретной задачи и требования приватности такой компромисс явно в пользу малой модели на устройстве. Модели Apple на устройстве, семейство Phi от Microsoft и семейство Gemma от Google — яркие примеры SLM, спроектированных именно для этого эффективного, повсеместно развёртываемого сценария использования. SLM также всё чаще используются как «быстрый первый проход» в двухуровневой архитектуре, а не исключительно как самостоятельное решение: лёгкая SLM напрямую обрабатывает простые, высоко достоверные случаи (или выполняет первичную классификацию\u002Fсортировку), эскалируя только действительно неоднозначные или сложные случаи к более крупной передовой модели — этот паттерн улавливает большую часть выигрыша малой модели по стоимости и задержке, сохраняя качество передового уровня на той более сложной подгруппе запросов, которая в этом реально нуждается, вместо того чтобы навязывать выбор «всё или ничего» между уровнями моделей для всей функции целиком.","SLM — компактная языковая модель, обычно до нескольких миллиардов параметров, созданная для эффективной работы на скромном оборудовании или устройстве.",null,[11,14,17,20],{"slug":12,"name":13},"distillation","Дистилляция знаний (Knowledge Distillation)",{"slug":15,"name":16},"latency","Задержка (Latency)",{"slug":18,"name":19},"parameter","Параметр",{"slug":21,"name":22},"quantization","Квантизация",[24,28,32,36,39,42,45,48,51,54,57,60],{"slug":25,"category":5,"name":26,"updated_at":27},"agentic","Агентный AI (Agentic AI)","2026-08-24T02:46:36+00:00",{"slug":29,"category":5,"name":30,"updated_at":31},"alignment-tax","Налог на выравнивание (Alignment Tax)","2026-08-24T02:46:37+00:00",{"slug":33,"category":5,"name":34,"updated_at":35},"artificial-intelligence","Искусственный интеллект (ИИ)","2026-08-24T02:46:38+00:00",{"slug":37,"category":5,"name":38,"updated_at":27},"attention","Внимание (Attention)",{"slug":40,"category":5,"name":41,"updated_at":35},"beam-search","Лучевой поиск",{"slug":43,"category":5,"name":44,"updated_at":31},"benchmark-contamination","Загрязнение бенчмарка (Benchmark Contamination)",{"slug":46,"category":5,"name":47,"updated_at":31},"catastrophic-forgetting","Катастрофическое забывание (Catastrophic Forgetting)",{"slug":49,"category":5,"name":50,"updated_at":35},"computer-vision","Компьютерное зрение",{"slug":52,"category":5,"name":53,"updated_at":31},"constitutional-ai","Конституционный ИИ (Constitutional AI)",{"slug":55,"category":5,"name":56,"updated_at":27},"context-window","Контекстное окно",{"slug":58,"category":5,"name":59,"updated_at":35},"deep-learning","Глубокое обучение",{"slug":61,"category":5,"name":62,"updated_at":27},"diffusion-model","Диффузионная модель (Diffusion Model)"]