Cohere Embed 5 вышла 30 сентября 2026 года и предлагает редкую для RAG-систем роскошь: индексировать корпус одной моделью, а запрашивать его другой без пересборки векторной базы. По данным The New Stack, в тестах Cohere быстрый режим запросов сохранил 98,4 балла качества относительно базового сценария Pro-to-Pro, принятого за 100.
Новая линейка состоит из двух вариантов: embed-v5.0-pro и embed-v5.0-fast. Pro рассчитана на максимальное качество при офлайн-индексации и критичных сценариях поиска. Fast — на низкую задержку, высокий поток запросов, интерактивный поиск, агентные циклы и RAG, где стоимость каждого пользовательского вопроса быстро превращается в строку бюджета. Главный технический трюк в том, что обе модели работают в общем embedding space: документы можно один раз прогнать через Pro, а потом искать по этим же векторам через Fast.
Для команд, которые уже строили production RAG, это звучит не как косметика, а как снятие неприятного ограничения. Обычно смена embedding-модели означает переиндексацию: заново нарезать документы, пересчитать векторы, переложить их в базу, проверить recall и надеяться, что ничего не поехало в правах доступа, фильтрах и метаданных. На больших корпусах это не «вечерний скрипт», а миграция с риском деградации поиска. Cohere пытается разделить два режима: дорогой и качественный путь для документов, быстрый и более дешевый путь для запросов.
В опубликованных тестах Cohere сравнивала связку Pro-индекс плюс Fast-запросы с базовой схемой Pro-индекс плюс Pro-запросы. На 40 наборах данных, куда входили текст, изображения, смешанные документы и распарсенные документы, Fast-вариант набрал 98,4 против 100 у Pro-to-Pro. Это не значит, что у всех в проде будет ровно такая же просадка — корпоративные базы знаний редко похожи на аккуратный benchmark. Но сама идея важна: поставщик модели заявляет, что быстрый query path почти не ломает качество ранжирования при уже построенном качественном индексе.
По ценам Cohere тоже разводит роли. Для текста Pro указан по $0,12 за миллион токенов, Fast — по $0,08 за миллион токенов. Разница выглядит небольшой, пока запросов тысяча в день. Но в агентных сценариях один пользовательский запрос может запускать несколько поисковых итераций: планирование, уточнение, retrieval, повторный retrieval, проверка ответа. Там экономия на query-модели начинает ощущаться гораздо быстрее, чем в классическом чат-боте с одним поиском по базе знаний.
Cohere Embed 5 также поддерживает мультимодальные входы: текст, изображения и смешанные страницы, например PDF с таблицами, схемами и подписями. Для энтерпрайза это не декоративная функция. Финансовые отчеты, техническая документация, договоры, презентации и тикеты часто живут не в чистом markdown, а в документах, где смысл размазан между текстом, таблицами и визуальными блоками. Если embedding-модель теряет половину страницы при парсинге, дальше уже не спасут ни хороший reranker, ни большой языковой модельный слой.
Еще одна практичная деталь — поддержка более 100 языков и контекстное окно до 128 тыс. токенов. Для русскоязычных команд это особенно интересно не из-за красивой цифры, а из-за типичной смеси данных: русский интерфейс, английская документация, локальные регламенты, код, Jira-комментарии, Confluence-страницы и PDF от подрядчиков. Хороший multilingual retrieval в таких системах часто важнее, чем очередная прибавка в генерации ответов.
Cohere отдельно продвигает гибкость хранения: Matryoshka embeddings с размерами 256, 512, 768, 1024, 1536 и 2048, а также выходы в float, int8 и binary. Для разработчиков это означает больше вариантов компромисса между качеством, памятью и скоростью. Можно не сразу покупать самый жирный векторный индекс на весь корпус, а подобрать размерность под задачу: поиск по справке продукта, юридический архив, кодовую базу или мультимодальные документы будут вести себя по-разному.
С осторожностью стоит относиться к новой метрике RCP-nDCG@10, которую Cohere использует для оценки. Она полезна тем, что проверяет ранжирование документов относительно критериев релевантности для конкретного запроса, но это не полный эквивалент боевого retrieval pipeline. В реальной системе качество ломается не только на модели: его портят chunking, OCR, фильтры доступа, устаревшие документы, гибридный поиск, reranking и банальная грязь в базе знаний. Benchmark показывает потенциал, но не отменяет локальных тестов на своих запросах.
Доступность у релиза вполне корпоративная: Cohere API, Model Vault, Microsoft Foundry и Amazon SageMaker. Для IT-директоров и платформенных команд это важнее, чем кажется: модель можно примерять не только в публичном API, но и в более контролируемых средах. Вопрос теперь не в том, появятся ли быстрые embedding-модели для RAG, а в том, кто первым научится менять скорость, цену и качество retrieval без болезненной переиндексации каждого крупного корпуса. Подробности о тестах и релизе приводит .