AI И НЕЙРОСЕТИ

Claude догоняет ChatGPT: меньше вкладок, больше агентной работы

3 теста The New Stack показали: ChatGPT Work быстрее Claude, но Claude подробнее объясняет расчеты, код и спорные места в задачах.

✍️ Редакция iTech News | 23.09.2026 | ⏱ 4 мин | Источник: The New Stack
💡

Claude и ChatGPT снова сошлись не в абстрактном споре о «лучшем ИИ», а в куда более полезной дисциплине: кто быстрее и надежнее делает рабочие задачи. Anthropic 16 сентября объединила Claude Chat и Cowork в один интерфейс, а тест The New Stack показал понятный расклад: ChatGPT Work оказался быстрее во всех трех заданиях, Claude — подробнее и аккуратнее в объяснениях.

По данным The New Stack, новая версия Claude убирает выбор между обычным чатом и агентным режимом Cowork. Пользователь задает вопрос, затем в том же треде может передать многошаговую задачу, а Claude сам решает, какой режим нужен. Сначала единый интерфейс получают подписчики Pro и Max, позже обновление должно дойти до бесплатных и командных тарифов. Для людей, которые каждый день прыгают между «быстро спросить» и «сделай уже файл/таблицу/исследование», это не косметика, а минус один лишний переключатель в голове.

OpenAI пришла к похожей идее раньше: Work mode появился рядом с Chat 9 июля, а прежний отдельный Agent mode компания убрала в следующем месяце. Work mode работает как песочница с браузером, выполнением кода и генерацией файлов. При этом, по замечаниям обозревателей, у него есть ограничение: он пока не умеет передавать пользователю живую авторизованную браузерную сессию на середине задачи, например для логина или оплаты. Под капотом Work mode опирается на Codex: OpenAI ранее говорила, что у Codex 5 млн еженедельных пользователей, причем около пятой части — не разработчики, и эта группа растет втрое быстрее разработчиков.

В сравнении было три задания из реальной рабочей рутины. Первое — исследовать документацию четырех API: GitHub REST API, Stripe API, Twilio Messaging API и OpenAI API, затем собрать таблицу с лимитами, наличием бесплатного тарифа и текущей версией или датой API. Оба инструмента правильно заполнили все 12 проверяемых полей. ChatGPT Work завершил задачу за 1 минуту 17 секунд и выдал 649 выходных токенов. Claude потратил 1 минуту 44 секунды и 1042 токена, зато прочитал восемь страниц, указал девять источников и добавил детали вроде отдельных лимитов GitHub Actions tokens, окна очереди Twilio и порогов тарифов OpenAI.

Второе задание было ближе к разработке: написать консольный парсер длительности durparse.py по строгой спецификации. Нужно было поддержать единицы d/h/m/s, порядок от крупной к мелкой, десятичные значения, голые числа как секунды и возвращать None для некорректного ввода. Оба решения прошли 16 скрытых тестов, включая ловушки с неправильным порядком единиц, повтором единицы, отрицательными значениями и числом без единицы в хвосте. ChatGPT снова уложился в 1 минуту 17 секунд и 769 выходных токенов. Claude работал 1 минуту 45 секунд, использовал 989 токенов и сообщил, что сам прогнал 35 тестов перед выдачей файла. Дополнительно он заметил спорный момент спецификации: как округлять 0,5 секунды, если встроенный round в Python ведет себя не так, как обычно ожидает человек.

Третья проверка интереснее всего для продуктовых команд: сначала инструментам дали вопрос по двум stack trace и попросили определить, где видна race condition. Затем без смены треда передали полноценную задачу: взять CSV из Google Drive, посчитать по endpoint количество запросов, p50, p95, p99 latency и долю ошибок со статусом 500+, а затем собрать скачиваемую таблицу с графиком. На короткий вопрос оба ответили правильно: проблемный trace был связан со словарем, который изменился во время итерации. ChatGPT ответил примерно за 10 секунд и 48 токенов, Claude — примерно за 25 секунд и 118 токенов, добавив оговорку, что похожая ошибка возможна и без потоков, если сам код меняет словарь в цикле.

На большой части handoff-задания разрыв стал резким. ChatGPT создал таблицу и charted spreadsheet за 28 секунд активной работы, Claude — примерно за 4 минуты. При этом все 30 чисел у обоих совпали с контрольными значениями автора теста. Разница снова оказалась не в точности, а в поведении: Claude назвал метод расчета процентилей — линейная интерполяция — и предупредил, что такие же значения должны получиться при пересчете в Google Sheets. ChatGPT дал правильную таблицу быстрее, но с меньшим количеством пояснений.

Итог неприятно практичный: Claude и ChatGPT уже настолько близки по базовой точности в таких сценариях, что вопрос смещается к стоимости времени, токенов и доверия. ChatGPT победил по скорости во всех задачах и суммарно выдал 1933 видимых выходных токена против 2468 у Claude. Claude чаще тратил больше слов, но часть этих слов была не «водой», а рабочими страховками: источники, метод расчета, замечания о неоднозначной спецификации. Для инженера, который потом будет защищать результат на code review или перед аналитиком, это иногда важнее лишних 30 секунд.

Для русскоязычных IT-команд вывод простой: выбирать AI-агента по красивому демо уже поздно. Если задача массовая, типовая и измеряется временем ответа, ChatGPT Work выглядит сильнее. Если важны трассируемость, объяснение допущений и снижение риска тихой ошибки, Claude может быть полезнее, даже когда работает медленнее. Следующий этап конкуренции Claude и ChatGPT — не «кто умнее», а кто лучше встроится в скучные, дорогие и проверяемые процессы: отчеты, логи, документацию, внутренние инструменты и агентные пайплайны, где правильный ответ без объяснения уже не всегда считается ответом.

Поделиться: Telegram X LinkedIn