OpenAI анонсировала запуск Codex Security — ИИ-агента, предназначенного для поиска уязвимостей в программном коде. В течение закрытой беты, проходившей под названием Aardvark, агент проанализировал более 1,2 миллиона коммитов и выявил 792 критических и более 10 500 высокоприоритетных уязвимостей. Четырнадцать из них получили официальные CVE, среди затронутых проектов — OpenSSH, GnuTLS, Chromium, GOGS и libssh.
Codex Security отличается от обычных сканеров тем, что сначала анализирует репозиторий и создает модель угроз для каждого проекта, определяя, что он делает, чему доверяет и где наиболее уязвим. Затем агент ищет проблемы, ранжирует их по реальному воздействию и проверяет находки в песочнице, создавая доказательства эксплуатации. Результатом становится не просто отчет, а готовые патчи, учитывающие архитектуру проекта.
Основное внимание уделяется снижению ложных срабатываний: за время беты OpenAI удалось сократить их более чем на 50%, а количество переоцененных уязвимостей — на 90%. В одном из репозиториев информационный шум уменьшился на 84% между первым и последним сканированием. Критические уязвимости обнаруживались менее чем в 0,1% проверенных коммитов.
Среди найденных проблем — обход двухфакторной аутентификации в GOGS, переполнение буфера в GnuTLS и ошибки в системах OpenAI. Codex Security доступен в исследовательском превью для клиентов ChatGPT Enterprise, Business и Edu на первый месяц бесплатно. Также запускается программа Codex for OSS, предлагающая бесплатный доступ мейнтейнерам открытых проектов, среди которых — команда vLLM. Чандан Нандакумарайя, руководитель продуктовой безопасности NETGEAR, отметил, что работа агента сравнима с работой опытного исследователя безопасности.