Модель Astra от OpenAI, по данным The New Stack, сгенерировала доказательства для 10 давно известных теорем в математике и научных дисциплинах, а стоимость прогона по токенам составила около $2 тыс. Для русскоязычной IT-аудитории это важный сдвиг: frontier-рассуждение перестает быть красивым демо и начинает выглядеть как вполне измеримый инженерный ресурс с понятной ценой за попытку.
Как пишет The New Stack, OpenAI показала крупное исследовательское обновление вокруг внутренней версии Astra, которую компания рассматривает как следующую frontier-модель. Суть не в том, что ИИ снова выиграл какой-нибудь табличный бенчмарк и не в том, что он ловко решил набор коротких задач на олимпиадный манер. Речь о другом уровне нагрузки: длинные цепочки рассуждений, полноценные доказательства и результат, который имеет смысл не потому, что красиво выглядит в чате, а потому, что его можно проверять как научный артефакт. И вот здесь цифра в $2 тыс. выглядит почти важнее самих заголовков: OpenAI фактически показывает рынок, сколько может стоить один заход на «исследовательский» режим модели.
Контекст у этой истории тяжелый и местами неловкий, как у любого быстро растущего AI-рынка. Еще 20 февраля 2026 года OpenAI публиковала результаты по First Proof — исследовательскому математическому челленджу из 10 задач, где внутренняя модель строила проверяемые попытки доказательств. Тогда компания отдельно подчеркивала, что это не аккуратный лабораторный тест: в ряде случаев были дополнительные уточнения, ручной отбор лучших попыток и верификация со стороны экспертов. По итогам OpenAI считала, что как минимум пять доказательств имеют высокие шансы оказаться корректными, а еще несколько требуют проверки; одну из попыток, которую сначала сочли верной, позже пришлось признать ошибочной. Это важная деталь. Она напоминает: между «модель выдала впечатляющий текст» и «математическое сообщество приняло доказательство» лежит довольно длинная дистанция, и OpenAI уже сталкивалась с этой границей на практике.
Но и списывать новый апдейт в категорию чистого хайпа уже не получается. 20 мая 2026 года OpenAI сообщила, что ее внутренняя модель автономно опровергла давнее предположение в дискретной геометрии, связанное с задачей о единичных расстояниях, сформулированной Полем Эрдешем еще в 1946 году. Компания тогда опубликовала сам текст доказательства, сопроводительные комментарии внешних математиков и получила очень сильные оценки от исследователей калибра Тима Гауэрса и Ноги Алона. То есть нынешний рассказ про Astra не падает с неба: за ним уже есть несколько месяцев движения от стандартной «LLM хорошо считает на бенчмарках» к гораздо более неприятной для скептиков формуле «LLM умеет держать длинную аргументацию на уровне, который хотя бы стоит профессиональной проверки».
Для разработчиков и руководителей здесь особенно интересен не только научный слой, но и экономика. История про теоремы обычно звучит как что-то из мира академии, где бюджеты, сроки и метрики живут по своим правилам. Но цифра около $2 тыс. резко возвращает разговор в привычную для IT систему координат. Получается, что сложное рассуждение теперь можно обсуждать примерно так же, как GPU-счет, прогон интеграционных тестов или дорогой security-аудит: сколько стоит одна успешная попытка, сколько нужно повторов, как устроена верификация и где заканчивается ROI. Если перевести это на язык бизнеса, то главная новость не в том, что модель Astra добралась до теорем. Главная новость в том, что frontier-мышление начинает продаваться и оцениваться как сервисная единица работы.
Отсюда и практический вывод для рынка. Чем мощнее становятся модели, тем бессмысленнее сравнивать их только по цене за миллион токенов. Гораздо важнее цена за завершенную задачу, особенно если задача длинная, требует нескольких проходов и дорогой человеческой проверки на выходе. Для научных применений это очевидно уже сейчас. Для корпоративной разработки тот же принцип скоро придет в code review, поиск уязвимостей, проектирование архитектуры, генерацию тестовых сценариев и внутренние R&D-задачи. И если один дорогостоящий прогон заменяет недели ручного перебора гипотез, разговор о «слишком дорогих токенах» быстро теряет былую драму.
Впрочем, рынок уже обжигался на преждевременных фанфарах. Осенью 2025 года OpenAI пришлось откатывать громкие заявления о якобы решенных задачах Эрдеша после критики со стороны математиков: оказалось, что модель нашла решения, уже существовавшие в литературе. Поэтому к любой новой истории такого масштаба разумно прикладывать старую инженерную привычку: сначала артефакты, потом восторг. Если есть текст доказательства, внешняя проверка, понятная методика и ясное описание затрат, новость стоит обсуждать всерьез. Если нет, это пока просто дорогой и очень убедительный демо-режим.
Следующий раунд конкуренции в AI, похоже, пройдет уже не за самый громкий бенчмарк, а за способность превращать длинное рассуждение в проверяемый результат с предсказуемой себестоимостью. Если сегодня модель Astra оценивают по доказательствам теорем и токен-чеку на $2 тыс., завтра те же вопросы будут задавать системам для физики, биологии, материаловедения и сложной инженерной разработки. Первоисточник: .