Стартап Inception Labs представил Mercury — языковую модель, которая генерирует ответы в 10 раз быстрее ChatGPT, Claude и Gemini. Компания заменила стандартную авторегрессивную архитектуру диффузионным подходом.
Обычные LLM создают текст последовательно — токен за токеном. Mercury работает по принципу диффузионных моделей: сначала генерирует "шумный" вариант всего ответа, затем постепенно "очищает" его до финального результата. Это позволяет параллелизовать вычисления.
По заявлению Inception Labs, Mercury создает развернутые тексты за секунды там, где GPT-4 тратит десятки секунд. Качество ответов при этом остается сопоставимым с топовыми моделями.
Обещания без доказательств
Компания не предоставила независимых бенчмарков или детальных технических характеристик. Остается неясным, как Mercury поддерживает логическую связность в длинных диалогах — главную проблему диффузионных подходов к тексту.
Если заявления подтвердятся, Mercury может стать прорывом для чат-ботов реального времени, автодополнения кода и быстрых саммари. Но пока это экспериментальная технология без публичного доступа.
Inception Labs обещает открыть тестирование Mercury в Q1 2024.