Британский институт AI Security Institute (AISI) сообщил о том, что модель искусственного интеллекта Claude Mythos Preview впервые прошла 32-шаговую симуляцию корпоративной кибератаки под названием The Last Ones (TLO). Эта имитация охватывает все этапы атаки: от первичной разведки и получения доступа до кражи учётных данных, перемещения по сети, эксплуатации уязвимостей веб-приложений, эскалации привилегий и полного захвата корпоративной сети. В трёх из десяти запусков Mythos успешно завершил весь сценарий, а в среднем доходил до 22-го шага из 32. Для сравнения, ближайший конкурент Claude Opus 4.6 доходил в среднем лишь до 16-го шага, тогда как более устаревшая версия Claude Sonnet 3.7 не преодолевала даже разведывательную фазу.
Кроме того, AISI провёл тесты на expert-level соревнованиях capture-the-flag, где Mythos достиг 73% успешных решений — уровень, недостижимый для других публичных моделей до апреля 2025 года. На более простых задачах показатели были ещё выше — до 97%. При этом ограничения модели связаны не с её потенциалом, а с бюджетом инференса: при увеличении лимита токенов результаты продолжали улучшаться.
Однако модель показала слабость в симуляции атаки на промышленную систему управления (полигон Cooling Tower), где остановилась на стандартных IT-этапах, не дойдя до специфичных OT-сценариев. AISI подчёркивает, что их полигоны проще реальных систем — в них отсутствуют активные защитники и средства обнаружения атак, что делает успешные результаты Mythos ещё более впечатляющими, но не гарантирует одинаковую эффективность в реальных условиях.
Институт планирует усложнить методологию тестирования, включая активный мониторинг и симуляцию работы службы реагирования на инциденты, а также перейти к оценке ИИ в реальных системах. Все результаты и планы отражены в препринте методологии TLO.
P.S. Поддержать автора можно подпиской на канал «сбежавшая нейросеть», где рассказывается об искусственном интеллекте с творческой стороны.