Назад
Cohere представила Embed 5: індексація моделлю Pro, пошук — Fast
SiTech AI Team3 წთ. საკითხავი

Cohere представила Embed 5: індексація моделлю Pro, пошук — Fast

Cohere випустила Embed 5, яка дає змогу індексувати дані моделлю Embed 5 Pro, а пошук за тими самими векторами виконувати дешевшою моделлю Embed 5 Fast. За тестами компанії, Fast-пошук дає 98,4 бала проти базових 100 у Pro-to-Pro.

Cohere у середу представила Embed 5. Модель дає змогу індексувати дані за допомогою Embed 5 Pro, а пошук за тими самими векторами виконувати дешевшим Embed 5 Fast, без другого індексу. Cohere радить використовувати Pro для індексації, а Fast для пошуку, особливо в RAG і агентних системах, де ті самі дані шукають багаторазово і накопичується затримка.

Компроміс у якості пошуку невеликий. На 40 наборах тексту, зображень, змішаних і оброблених документів Fast-пошук на Pro-індексі отримав 98,4 бала проти базових 100 у Pro-to-Pro; якби Fast використовували й для індексації, показник упав би до 96,6. За словами Cohere, різкого падіння на окремих наборах не зафіксовано.

Один векторний простір, дві моделі

Pro і Fast ділять один векторний простір, тому перемикання між ними можливе без повторної обробки корпусу. Обидві створюють сумісні вектори однакової розмірності, і разом із скороченням Matryoshka або int8-квантуванням їх можна змішувати. Pro коштує 0,12 долара за мільйон токенів, Fast — 0,08, і в тестах обробляє документи в середньому у 2,4 раза швидше, тому Pro обробляє документи, що входять до індексу, а Fast бере на себе важкий пошуковий трафік.

Скорочення векторів

Обидві моделі підтримують 256-2048 вимірів і формати float32, int8, binary. За оцінкою Cohere, 2048-вимірний float32-вектор становить 8 кілобайт, тобто приблизно 819 ГБ для 100 мільйонів частин; 1024-вимірний int8-вектор зменшує цей обсяг до 102 ГБ, а 256-вимірний binary — до 3,2 ГБ. Для більшості розгортань Cohere радить 1024-вимірний int8, тоді як binary дає сильне стиснення із втратою якості.

Пошук поза текстом

Embed 5 підтримує текст, зображення та змішані текстово-зображувальні вхідні дані понад 100 мовами з контекстом 128K токенів. За даними Cohere, у п’ятикомпонентній змішаній оцінці Pro отримав 82,3 бала, Fast — 81,2, Google Gemini Embedding 2 — 61,3; на ViDoRe V3 Pro мав 85,8, а Fast — 84,5 проти 77 у попереднього Embed 4. У багатомовних тестах Pro лідирує із 77 балами в п’ятимовному європейському середньому, але відстає від Gemini Embedding 2 у дев’яти тестах.

Деталі бенчмарку

Embed 5 — перше сімейство Cohere, оцінене за RCP-nDCG@10; цей підхід використовує критерії, адаптовані до запиту, замість фіксованих міток. Він виявляє результати, пропущені оригінальними мітками, але вимірює переранжування фіксованих кандидатів, а не первинний пошук із повного корпусу, тому показники не є прямо порівнянними.

Головна зміна в тому, що Embed 5 розглядає індексацію та обслуговування запитів як окремі рішення: один корпус індексується для якості пошуку, а шлях запиту оптимізується за пропускною здатністю та затримкою. 98,4 бала Cohere вказують на невеликі втрати, але виробничі системи все одно мають перевірити конфігурацію на власному корпусі. Embed 5 Pro і Fast доступні в API Cohere та Model Vault, Microsoft Foundry і Amazon SageMaker; приватне розгортання VPC і on-premises працює з vLLM.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.