Модель GPT-5.4 заняла первое место в тестировании Vibe Code Bench v1.1 с результатом 67,42%, что на 5,7 процентных пункта превышает предыдущий рекорд GPT-5.3 Codex (61,77%). Третью позицию занимает Claude Opus 4.6 без режима рассуждений с 57,57%. Бенчмарк оценивал не только умение исправлять ошибки или добавлять функции, но и уровень способности модели создавать рабочее веб-приложение с нуля — от пустой папки до готового сервиса на основе текстового описания. В набор входило 100 задач, разделенных на публичные и тестовые. Участникам предоставлялся доступ к браузеру, терминалу и стандартным сервисам для разработки. Сложность заданий варьировалась от создания социальных сетей до трекеров привычек. На каждое приложение модели предоставлялось до пяти часов, а результаты оценивались через тестирование функционала. Интересно, что Claude Opus 4.6 достигает высоких результатов с меньшими затратами, чем его соперники. Несмотря на успехи, около одной трети решений от GPT-5.4 все еще имеет проблемы, а результаты варьируются от почти полной работоспособности до полной неработоспособности. Впечатляющий прогресс наблюдается по сравнению с прошлым годом, когда результаты были значительно ниже.