- В реальных тестах со сложными проблемами наблюдаемости модели GPT-5 и GPT-5.1 Codex оказались единственными, которые предоставляли интегрированный, компилируемый код, готовый к развертыванию в рабочей среде.
- Claude Code преуспел в архитектуре и обширной документации, но его решения содержали критические ошибки и не интегрировались в существующий конвейер, что требовало последующей ручной работы.
- GPT-5.1 Codex превзошел GPT-5 по скорости, архитектурной чистоте и эффективности токенов, что привело к значительно более дешевому решению, чем Claude для той же задачи.
- GPT-5.1-Codex-Max добавляет режимы сжатия и глубокого анализа, что делает его агентским движком, способным работать часами с большими репозиториями, не теряя при этом хода событий.

Если вы проводите дни за программированием, вы, вероятно, заметили настоящий лавинный поток инструментов для программирования ИИ в последнее время : GPT-5.1 Codex, GPT-5 Codex, Claude Code, Kimi K2 Thinking, Sonnet 4.5, Haiku… Список пополняется почти еженедельно, и каждый поставщик утверждает, что у него есть лучший помощник для разработки. Но когда дело доходит до практического применения и использования их в реальных проектах, различия становятся очевидными.
В последние недели несколько команд сравнивали GPT-5.1 Codex, GPT-5 Codex, Claude Code и Kimi K2 Thinking в строгих условиях: большие репозитории, интеграция с реальными конвейерами разработки, нагрузочное тестирование и сложные задачи мониторинга. Здесь нет простых задач по программированию, а скорее поиск ошибок и функций, которые могут привести к сбоям в работе. Из всех этих данных вытекает довольно убедительный вывод: кодексы OpenAI, и в частности GPT-5.1 Codex, предоставляют наиболее «реально развертываемый код».
GPT-5.1 Codex против Claude Code: краткий обзор дуэли
Когда кто-то говорит о «бенчмарке GPT-5.1 Codex против Claude Code», на самом деле сравниваются две совершенно разные философии управления кодом . GPT-5.1 Codex (и его эволюция, GPT-5.1-Codex-Max) изначально разрабатывался как движок для агентов, работающих долгие часы над одним и тем же репозиторием: он понимает контекст, редактирует файлы, запускает тесты и исправляет собственные ошибки. Claude Code, с другой стороны, отлично справляется с объяснением кода, проектированием архитектур и генерацией документации, но часто оказывается неэффективным, когда дело доходит до настоящей интеграции изменений в существующую кодовую базу.
В реальных тестах в рамках проектов по мониторингу эта разница была очевидна: только модели Codex генерировали интегрированный и готовый к использованию код , в то время как Клод и Кими создавали эффектные архитектуры, креативные идеи и множество строк кода… но с критическими ошибками, сбоями интеграции или просто кодом, который даже не компилировался.
Как проводился бенчмарк: реальные проблемы, а не игрушки
Чтобы сделать тест производительности значимым, типичное задание типа «напишите функцию, которая переворачивает строку» было полностью исключено. Вместо этого были выбраны две сложные задачи в рамках платформы мониторинга , имеющие очень специфические требования к производительности и надежности и соответствующие передовым методам тестирования и реализации в разработке программного обеспечения :
Первая задача: разработать и внедрить статистическую систему обнаружения аномалий , способную определять базовые показатели ошибок, вычислять z-баллы и скользящие средние, обнаруживать всплески скорости изменения и обрабатывать более 100 000 логов в минуту с задержкой менее 10 мс. Все это должно быть интегрировано в существующий конвейер обработки данных.
Вторая задача: решение проблемы распределенной дедупликации оповещений, когда несколько процессоров обнаруживают одну и ту же аномалию почти одновременно. Необходимо было избегать дубликатов с интервалом менее 5 секунд, допускать задержки синхронизации до 3 секунд и обрабатывать сбои процессоров, не допуская зависания системы.
Четыре протестированные модели — GPT-5 Codex, GPT-5.1 Codex, Claude Code и Kimi K2 Thinking — получали одинаковые запросы в одной и той же IDE (Cursor) и в одном и том же репозитории. Измерялись затраченное время, количество использованных токенов, стоимость в долларах, качество кода, количество критических ошибок и, что очень важно, действительно ли результат был связан с существующей кодовой базой или оставался «параллельным прототипом».
Результаты теста 1: Статистическое обнаружение аномалий
В первом тесте целью было, чтобы каждая модель обеспечивала готовый к использованию детектор статистических аномалий: расчеты скорости, скользящие окна, z-оценки, резкие изменения, аккуратная обработка деления на ноль и интеграция в класс AnomalyDetector и в реальном трубопроводе.
Клод Код Запуск произошёл с большим успехом: тысячи новых строк кода, обширная документация, несколько статистических механизмов (z-оценка, EWMA, проверка обменного курса) и даже синтетические бенчмарки. На бумаге всё выглядело как учебник по инженерному делу. Но когда код был запущен, обнаружилась обратная сторона: функция обменного курса, которая возвращала Infinity когда предыдущее окно было равно нулю, а затем toFixed() о той ценности, которая вызвала Немедленная ошибка диапазонаКроме того, базовая система не была по-настоящему подвижной, а тесты были недетерминированными (с использованием Math.random()И в довершение всего, Ничего из этого не было связано с реальным трубопроводом.Результат: впечатляющий прототип, но запустить его в производство в таком виде невозможно.
Попытка Кодекс GPT-5 Это было гораздо более прагматично. Примерно за 18 минут он сгенерировал хорошо интегрированный код, с чистыми изменениями всего в несколько сотен строк, прямо на занятии AnomalyDetector и фактические точки входа. Они позаботились об обработке крайних случаев (например, Number.POSITIVE_INFINITY перед звонком toFixed()), реализовали инкрементную статистику в скользящих окнах со сложностью O(1) и выровняли временные интервалы с настенными часами для предсказуемости. Тестирование модулей Они были детерминированными, и результат запускался в системе, не затрагивая практически ничего другого.
О Кодекс GPT-5.1Он применил ещё более чистый архитектурный подход. Вместо временных контейнеров он использовал скользящие окна на основе выборок с указателями начала и конца и выделенным классом. RollingWindowStats для выполнения сумм и сумм квадратов. Он тщательно контролировал деление на ноль, используя такие константы, как MIN_RATE_CHANGE_BASE_RATEОн ограничил базовую частоту обновления для экономии ресурсов и написал детерминированные тесты с контролируемыми временными метками. За 11 минут он создал больше строк сети, чем GPT-5, но с более простой архитектурой, лучшим управлением памятью и таким же качеством «готовности к развертыванию»..
Четвертый участник, Kimi K2 Thinking , выбрал креативное решение, объединившее поддержку потоковых логов и пакетные метрики, добавив обнаружение на основе MAD и EMA. На бумаге это выглядело неплохо, но в основе лежала ошибка: базовая линия обновлялась перед оценкой каждого значения, из-за чего z-оценка приближалась к нулю, а аномалии практически никогда не срабатывали . Более того, это привело к ошибке компиляции в TypeScript и повторило ту же проблему деления на ноль, что и у Claude. Хуже того, код даже не компилировался и не был должным образом связан с системой.
Вывод первого раунда совершенно очевиден: только два кодекса (GPT-5 и GPT-5.1) предоставили функциональный, интегрированный и достаточно надежный код . GPT-5.1 сравнялся по стоимости с Claude (около 0,39 доллара в этом тесте), но за меньшее время и с более чистой архитектурой.
Результаты теста 2: распределенная дедупликация оповещений
Вторая задача представляла собой классическую проблему распределенной координации : несколько процессоров могли обнаружить одну и ту же аномалию практически одновременно. Необходимо было предотвратить срабатывание дублирующих оповещений при обнаружении в течение 5-секундного интервала, при этом допуская некоторую рассинхронизацию часов и потенциальные сбои в работе процессов.
Клод снова блеснул в плане дизайна. Он предложил архитектура на трех уровнях: кэш L1, блокировка базы данных L2 и уникальные ограничения L3. Он использовал NOW() из базы данных, чтобы не зависеть от тактовой частоты процессора, он хорошо справлялся с снятием блокировки в случае потери соединения и включал почти 500 строк тестов, охватывающих конфликты, рассогласование тактовой частоты и сценарии сбоев. Однако, как и в первом тесте, К процессору ничего не было подключено., а некоторые детали реализации (например, слишком толстые ключи блокировки или временное окно, применяемое ко всем активным оповещениям) снизили практическую полезность.
В параллели, Кодекс GPT-5 Он выбрал решение, основанное на таблице дедупликации с резервированием и истечением срока действия, координируемой через транзакции и FOR UPDATE. Код он был непосредственно интегрирован в processAlertОн использовал время сервера и достаточно хорошо справлялся с коллизиями, хотя в пункте была небольшая гонка. ON CONFLICT что в экстремальных условиях позволяло двум процессорам пройти одну и ту же проверку перед фиксацией. Это было не идеально, но очень близко к тому, что можно было развернуть с небольшой корректировкой.
Движение Кодекс GPT-5.1 Он был еще более минималистичным и эффективным: вместо дополнительных досок он опирался на PostgreSQL проверяет блокировки con una función acquireAdvisoryLock который генерировал ключи с использованием SHA-256 на паре service:alertTypeВ этом режиме система проверяла наличие недавних активных оповещений в течение 5-секундного окна и, если их не было, добавляла новое. Если аналогичное оповещение уже существовало, уровень серьёзности обновлялся, если новое было выше. Всё это происходило с последовательное использование временных меток сервера для управления перекосами и правильно очищенные блоки finallyРезультат: более простая логика, без вспомогательных таблиц и без гонки, которую затянула GPT-5.
В этом тесте Kimi Да, ему удалось интегрировать свою логику в processAlert и использовать дискретные 5-секундные блоки с атомарными операциями добавления и повторения с отсрочкой. Сама идея была неплохой, но реализация снова подвела в ключевых деталях: когда две одновременные операции добавления имели одинаковый createdAtрасчет флага isDuplicate Он был отменен, и оповещения были помечены неправильно; более того, пересчет контейнера при откате даже не применялся в запросе, поэтому Они продолжали попытки снова и снова начать тот же конфликт.Короче говоря, хорошая интуиция, плохое исполнение.
И снова во втором раунде готовый к развертыванию код был получен с помощью GPT-5 и GPT-5.1 Codex , при этом GPT-5.1 явно превосходил конкурента по чистоте кода и отсутствию состояний гонки, и все это по цене около 0,37 доллара по сравнению с 0,60 доллара для GPT-5.
Затраты: почему Codex оказывается дешевле Claude
Если смотреть только на цену за миллион токенов, может показаться, что Claude Sonnet 4.5 и GPT-5.1 находятся в одной лиге. Однако, если углубиться в более детальные показатели этих бенчмарков, становится ясно, что Codex предлагает больше за меньшие деньги . В двух объединенных тестах затраты составили приблизительно следующее:
- Клод: в общей сложности около 1,68 долл.
- Кодекс GPT-5: около 0,95 долл. (на 43% дешевле, чем у Клода).
- Кодекс GPT-5.1: приблизительно 0,76 долл. США (примерно на 55% меньше, чем у Клода).
- Кими: По оценкам, 0,51 долл. США, но с большой неопределенностью из-за отсутствия разбивки затрат.
Ключевой момент заключается в том, что Claude взимает больше за каждый выходной токен (15 долларов в месяц против 10 долларов в месяц у GPT-5.1) и, кроме того, склонен генерировать много дополнительного текста из-за своего стиля "размышляй вслух" и подробной документации. С другой стороны, Codex выигрывает от кэширования контекста в своем CLI, повторно используя большие объемы входных токенов без повторной полной оплаты. Добавьте к этому тот факт, что GPT-5.1 был более эффективен с точки зрения количества используемых токенов, чем GPT-5, и в результате получается мастер, который не только генерирует больше полезного кода, но и экономит ваши деньги.
В мире тарифных планов с фиксированной ценой, таких как «20 евро в месяц», это означает нечто вполне ощутимое: с Codex вы можете работать над кодом гораздо больше часов, прежде чем достигнете лимита . В отличие от этого, с планами Claude довольно часто опытные пользователи достигают лимита даже на самых дорогих подписках, в то время как с Codex Pro превышение лимита происходит редко, за исключением случаев экстремального использования.
Что предлагает GPT-5.1-Codex-Max: агенты, которые работают весь день
Над GPT-5.1 Codex существует вариант, специально разработанный для очень длительной и детальной работы с кодовой базой : GPT-5.1-Codex-Max. Эта модель ориентирована не на «обычный чат», а скорее на функционирование в качестве агентского движка в экосистеме Codex и OpenAI Codex CLI . Чтение огромных репозиториев, изменение множества файлов, запуск наборов тестов и поддержание управления в течение нескольких часов — всё это часть его ДНК.
Ключевое отличие заключается в компактизации . Вместо того чтобы полагаться исключительно на огромное контекстное окно, модель может обобщать и сжимать более старые части сессии, сохраняя при этом важные детали. Это как если бы она «сжимала» уже предпринятые шаги, чтобы освободить место для новых команд, не забывая при этом важные решения. Благодаря этому она может работать с огромными монорепозиториями, взаимодействовать с множеством сервисов одновременно и при этом помнить о проектных решениях, принятых много часов назад.
Ещё один интересный момент — уровни сложности рассуждений . Режим «Средний» подходит для повседневных задач (обычные тикеты, небольшие функции, незначительные рефакторинги) с хорошей задержкой. Режим «Очень высокий» предоставляет модели больше времени на внутренние вычисления и более длительные процессы обдумывания, жертвуя скоростью ради большей надёжности в сложных задачах: масштабные рефакторинги, устаревшие конвейеры, изобилующие подводными камнями, трудновоспроизводимые состояния гонки и т. д. Для задач, которые обычно занимают у опытного разработчика целый день, этот режим компенсирует это.
В тестах, специфичных для агентов, GPT-5.1-Codex-Max значительно превосходит стандартный GPT-5.1 Codex: больше задач выполнено в SWE-bench Verified и Lancer, улучшена производительность в Terminal Bench и, что наиболее важно, обеспечивается большая способность сохранять спокойствие во время длительных сессий, не отвлекаясь. Для многих команд это означает, что агент может обработать весь тикет от начала до конца, а не просто время от времени создавать патчи.
Безопасность, песочница и ответственное использование модели
Когда вы предоставляете агенту доступ к вашему терминалу и репозиторию, вполне естественно возникновение проблем с безопасностью. Codex и GPT-5.1-Codex-Max разработаны для работы всегда в изолированной среде . В облаке агент работает в контейнере с отключенной по умолчанию сетевой связью, а исходящий трафик разрешен только при явном включении. Локально он использует механизмы изоляции macOS, Linux или Windows (или WSL) для ограничения доступа к определенным файлам.
На всех поверхностях Codex действуют два повторяющихся правила: сеть не открывается, если вы ей этого не укажете , и агент не может редактировать файлы за пределами настроенной рабочей области. Это, в сочетании со специальным обучением, позволяющим избегать деструктивных команд, значительно повышает вероятность того, что модель предусмотрительно очистит каталог, чем удалит половину проекта, неправильно истолковав фразу типа «очистите это».
Что касается атак с внедрением вредоносного кода (например, вредоносного текста, пытающегося обмануть ИИ, заставив его игнорировать правила и раскрыть секреты), обучение по методологии Codex делает упор на то, чтобы рассматривать весь внешний текст как недостоверный, что подкрепляется автоматизированными методами тестирования моделей ИИ . На практике это означает отклонение запросов на утечку данных, отказ от загрузки закрытого кода на внешние веб-сайты и явное предпочтение следованию инструкциям системы и разработчиков, а не чему-либо, найденному в документации или на веб-страницах.
GPT-5.1 Codex в сравнении с Claude и другими моделями в повседневном использовании
После анализа конкретных критериев оценки и возможностей Codex-Max общая картина становится совершенно ясной: каждая модель занимает свою идеальную нишу , и разумнее всего не ограничиваться одной моделью для всего, а знать, когда использовать каждый инструмент.
GPT-5.1 Codex (и его вариант Max) особенно хорошо подходят, когда требуется интегрированный код с вниманием к защите от ошибок и минимальным запасом прочности . В обоих тестах на наблюдаемость он, наряду с GPT-5, оказался единственным, который обеспечил реализации, которые можно было развернуть в производственной среде без переписывания половины файла. Кроме того, стоимость выполнения задачи была самой низкой среди всех, с улучшением эффективности по сравнению с GPT-5 и соотношением цены и производительности, которое трудно превзойти.
Claude Sonnet 4.5 / Claude Code превосходно справляется с задачей, когда вам нужен архитектурный дизайн, подробная документация и понятные объяснения . Представьте себе обзоры архитектуры, обширные технические документы, руководства по миграции… Их решения, как правило, очень хорошо обоснованы и хорошо объяснены, с многоуровневым анализом защиты и компромиссов, который приятно читать. Цена: прототипы, которые затем нужно вручную настраивать, больше критических ошибок, чем кажется на первый взгляд, и значительно более высокая стоимость токена.
Kimi K2 Thinking предлагает множество креативных и альтернативных подходов . В своих экспериментах он тестировал интересные идеи, такие как использование временных сегментов для дедупликации данных или смешивание MAD и EMA в обнаружении аномалий. Кроме того, его интерфейс командной строки недорог, хотя и несколько недоработан. Проблема в том, что он часто допускает ошибки в деталях основной логики: порядок обновления статистики, деление на ноль, инвертированные флаги и т. д. Он отлично подходит для вдохновения, но для его доработки и тестирования требуется серьезное время.
Наконец, общие модели GPT-5.1 (Instant и Thinking) и такие модели, как Gemini или Llama, служат основой для смешанных задач (документация, анализ данных, взаимодействие с пользователем), но когда задача основана исключительно на коде и агентах, пакет Codex в настоящее время предлагает сочетание глубины, цены и инструментов , которому довольно сложно найти равных.
Если рассматривать все вместе — два бенчмарка наблюдаемости, долгосрочное использование в IDE, таких как VS Code и Cursor, компактность Codex-Max, режимы рассуждений и разницу в стоимости — общее впечатление довольно ясно: в области «ИИ, который действительно программирует и предоставляет достойные запросы на слияние», GPT-5.1 Codex заслужил свое место в качестве основного инструмента . Claude Code остается отличным помощником для архитектурного планирования и создания исчерпывающей документации, а Kimi или аналогичные модели предлагают искру и альтернативы, но когда дело доходит до создания кода, который компилируется, интегрируется и не дает сбоев с первой попытки, сторона Codex обычно в конечном итоге одерживает верх.