[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-cosine-similarity::ru":3,"gloss-cluster-cosine-similarity::ru":20,"gloss-next-cosine-similarity::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"cosine-similarity","data-infra","Косинусное сходство (Cosine Similarity)","Косинусное сходство — математическая мера того, насколько похожи два вектора, вычисляемая как косинус угла между ними в пространстве высокой размерности. Значение варьируется от -1 (полностью противоположные) до 1 (совпадающее направление), при этом 0 означает, что векторы ортогональны (не связаны). Это, с большим отрывом, самая распространённая метрика расстояния для сравнения эмбеддингов в AI-приложениях — большинство векторных баз данных используют её по умолчанию, а большинство моделей эмбеддингов (от OpenAI, Cohere, open-source Sentence-Transformers) обучаются с косинусным сходством как явной или неявной целью, то есть эмбеддинги специально оптимизированы так, чтобы косинусные сравнения были осмысленными. Почему это важно для разработчиков AI\u002FSaaS: когда продукт делает «найти похожие документы», «семантический поиск», «рекомендовать похожие товары» или «обнаружить дублирующиеся обращения в поддержку», под капотом почти наверняка работает именно косинусное сходство, и понимание этого демистифицирует иначе непрозрачные оценки релевантности в ответах векторной базы данных (результат запроса Pinecone со `score: 0.89` — это значение косинусного сходства, а не вероятность или процент). Как это работает: для двух векторов A и B косинусное сходство = (A · B) \u002F (‖A‖ × ‖B‖) — скалярное произведение векторов, делённое на произведение их норм (длин). Важно, что эта формула нормализует длину\u002Fвеличину вектора и измеряет только направление — два эмбеддинга могут иметь очень разные величины (например, один представляет короткое предложение, другой — длинный абзац), но всё равно получить высокое косинусное сходство, если они указывают в семантически одном направлении. Именно поэтому косинусное сходство обычно превосходит обычное евклидово расстояние для текстовых эмбеддингов, где величина часто коррелирует с не относящимися к делу факторами вроде длины текста, а не со смыслом. Многие векторные базы данных заранее нормализуют векторы до единичной длины при вставке, что делает косинусное сходство математически эквивалентным скалярному произведению (которое быстрее вычисляется) — поэтому вы видите и `cosine`, и `dotproduct` как варианты метрики индекса с почти идентичным поведением после нормализации векторов. Практический пример: e-commerce SaaS встраивает описания товаров для рекомендаций «покупатели также смотрели». «Беспроводные наушники с шумоподавлением» и «Bluetooth-наушники накладного типа с ANC» дают эмбеддинги с косинусным сходством ~0.91 — очень близко, корректно сигнализируя о почти дублирующем намерении при полном отсутствии общих точных ключевых слов, — тогда как «беспроводные наушники с шумоподавлением» и «бутылка для воды из нержавеющей стали» получают ~0.12, корректно сигнализируя о несвязанных товарах. Рекомендательный движок показывает товары выше порога 0.75 как «похожие». Выбор этого порога — сам по себе продуктовое решение, а не фиксированное правило: команды обычно настраивают его эмпирически на размеченном наборе «действительно похожих» пар, поскольку «правильный» порог косинусного сходства варьируется в зависимости от модели эмбеддингов и предметной области (порог, настроенный для описаний товаров, не обязательно подойдёт для схожести обращений в поддержку).","Косинусное сходство измеряет, насколько похожи два вектора, по углу между ними — стандартная метрика сравнения текстовых и графических эмбеддингов.",null,[11,14,17],{"slug":12,"name":13},"ann-search","ANN-поиск (приближённый поиск ближайших соседей)",{"slug":15,"name":16},"embedding-index","Индекс эмбеддингов (Embedding Index)",{"slug":18,"name":19},"vector-store","Векторное хранилище (Vector Store)",[21,25,26,29,32,36,39,42,45,48,52,55],{"slug":22,"category":5,"name":23,"updated_at":24},"acid","ACID","2026-08-24T02:46:37+00:00",{"slug":12,"category":5,"name":13,"updated_at":24},{"slug":27,"category":5,"name":28,"updated_at":24},"backpressure","Обратное давление (backpressure)",{"slug":30,"category":5,"name":31,"updated_at":24},"batch-processing","Пакетная обработка (Batch Processing)",{"slug":33,"category":5,"name":34,"updated_at":35},"bm25","BM25","2026-08-24T02:46:38+00:00",{"slug":37,"category":5,"name":38,"updated_at":24},"cache","Кэш (Cache)",{"slug":40,"category":5,"name":41,"updated_at":24},"cap-theorem","Теорема CAP (CAP theorem)",{"slug":43,"category":5,"name":44,"updated_at":24},"change-data-capture","Захват изменений данных (CDC)",{"slug":46,"category":5,"name":47,"updated_at":24},"chroma","Chroma",{"slug":49,"category":5,"name":50,"updated_at":51},"chunk-overlap","Перекрытие фрагментов","2026-08-24T03:30:02+00:00",{"slug":53,"category":5,"name":54,"updated_at":24},"columnar-storage","Колоночное хранение",{"slug":56,"category":5,"name":57,"updated_at":24},"connection-pooling","Пулинг соединений (Connection Pooling)"]