AI И НЕЙРОСЕТИ

Springboards хочет вытащить LLM из режима группового мышления

7 — число, которое ChatGPT, Claude и Gemini часто выбирают как «случайное». Springboards пытается сломать это однообразие LLM.

✍️ Редакция iTech News | 02.07.2026 | ⏱ 5 мин | Источник: MIT Technology Review
🔮

Если попросить ChatGPT, Claude или Gemini назвать случайное число от 1 до 10, слишком часто всплывает 7. Австралийский стартап Springboards решил превратить этот странный фокус в продукт и предлагает модель Flint, которая должна ломать однообразие LLM там, где бизнесу нужны не усредненные ответы, а новые ходы. Для разработчиков, продуктовых команд и маркетинга это важный сигнал: проблема у больших моделей не только в галлюцинациях, но и в том, что они слишком охотно думают как все.

Как пишет MIT Technology Review, Springboards показывает это на простых, но показательных примерах. В демо сооснователь и CEO компании Pip Bingemann сначала просит популярные чат-боты выдать случайное число от 1 до 10: ChatGPT и Claude снова приходят к 7. Flint в одном запуске тоже отвечает 7, а в другом выдает 3.7916. Затем идет тест попроще: назвать марку автомобиля. Ожидаемые ответы у массовых моделей, по словам Bingemann, обычно крутятся вокруг Toyota или Honda, тогда как Flint в показе назвал Ford F-150. В задаче на рекламный слоган для New Balance и Claude, и ChatGPT выдали одинаковое «Run your way», а Flint предложил другой, пусть и не гениальный, вариант: «Built to last, run to win».

Смысл тут не в том, что Flint обязательно умнее или креативнее в каждом ответе. Фокус в другом: mainstream-модели слишком часто сходятся к самым вероятным и безопасным формулировкам. Для кода, поиска информации и рутинных рабочих сценариев это даже плюс. Но когда речь идет о брейншторме, названии продукта, новой кампании или гипотезе для выхода на рынок, усреднение быстро превращается в налог на мышление. Команда просит ИИ придумать что-то свежее, а получает «неон», «бархат», «статику» и еще десяток идей, которые уже лежат в презентациях у конкурентов.

Почему модели начинают говорить одинаково

У этой истории уже есть исследовательский фон. В ноябре группа ученых опубликовала работу Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond), где показала высокий уровень повторяемости как внутри одной модели, так и между разными моделями. Исследователи 50 раз задавали 25 LLM открытые вопросы и обнаружили, что ответы подозрительно часто схлопываются к одним и тем же образам. В примере с метафорой времени из 1250 ответов многие снова и снова сваливались к формулировкам вроде «время — это река» или «время — ткач». Для пользователей проблема особенно коварна тем, что интерфейс чат-бота создает ощущение персонального диалога. На деле человек нередко получает почти тот же ответ, что и тысячи других пользователей до него.

OpenAI, как пересказывает MIT Technology Review, признает саму логику этого компромисса: если учить модель быть надежной, связной и предсказуемой, она естественным образом тянется к знакомым высоковероятным ответам. Если же сильнее давить на новизну, растет риск слабых или менее надежных результатов. И это, пожалуй, главный инженерный нерв всей темы. Однообразие LLM не выглядит громкой аварией, как галлюцинация или утечка данных. Оно тише и поэтому опаснее: продукт вроде бы работает, текст получается гладким, но пространство вариантов незаметно сужается до среднего по рынку мнения.

Что именно делает Flint

Springboards не тренировал фундаментальную модель с нуля. Flint построен поверх Qwen 3 от Alibaba, что для небольшой команды выглядит скорее трезвым инженерным выбором, чем слабостью. По словам CTO Kieran Browne, компания сначала попробовала стандартный путь: поднять temperature, то есть общий уровень случайности в генерации. Но это быстро упирается в грубую настройку. На высоких значениях модель может становиться несвязной; в одном из тестов, как рассказывает Browne, ответ модели OpenAI на максимальной температуре посреди фразы переключался с английского на код. Springboards сделал ставку на более локальный подход: не разгонять случайность по всему ответу, а находить те точки, где разнообразие действительно полезно. Если пользователь спрашивает, куда поехать в Европе, не нужно делать случайным каждое слово; достаточно сильнее варьировать место назначения и несколько смысловых развилок вокруг него.

Именно поэтому Flint сейчас подается не как универсальная замена ChatGPT или Claude, а как инструмент для творческих задач. У Springboards уже есть продукт для рекламных и маркетинговых команд, где можно комбинировать ответы разных моделей, перетаскивая удачные куски текста в новый вариант. Flint в этой конструкции играет роль «раздражителя средней температуры по палате» и должен подбрасывать менее очевидные идеи. Стратег Zoe Scaman, которая тестировала систему, рассказывает, что в задаче о переизобретении финансовой компании для молодежи три крупные модели снова пошли по знакомой дорожке про финансовую грамотность в «веселом и модном» формате. Flint, по ее словам, предложил посмотреть шире и фактически переупаковать само понятие накопления богатства. Это уже не готовый продуктовый план, но по крайней мере новая траектория мысли. При этом Scaman оговаривается: Flint пока прототип, и под нагрузкой или при слишком сильном давлении на идею он может сбоить.

Для рынка здесь просматривается довольно прагматичный вывод. Следующий виток конкуренции в генеративном ИИ может пойти не только по линии «кто точнее отвечает» или «у кого больше контекстное окно», но и по линии управляемого разнообразия. Разработчикам это намекает на новый класс настроек и метрик для open-ended задач. Продуктовым командам — на необходимость тестировать модели не только на correctness, но и на ширину пространства идей. А бизнесу в целом — на простую вещь: если весь отдел использует одинаковые LLM с одинаковыми промптами, он рискует не ускорить креатив, а автоматизировать банальность.

Открытый вопрос теперь звучит так: смогут ли большие платформы добавить в свои модели «режим выхода из среднего», не развалив при этом надежность и связность. Если да, борьба с однообразием LLM станет таким же важным направлением, как борьба с галлюцинациями. Если нет, вокруг генеративного ИИ быстро вырастет отдельный слой нишевых моделей и инструментов для тех задач, где хороший ответ не должен быть самым вероятным. Источник с демонстрациями и цитатами команды Springboards — MIT Technology Review.

Поделиться: Telegram X LinkedIn