Организация METR, занимающаяся оценкой ИИ-моделей, обнародовала результаты тестирования Claude Opus 4.5, разработанной Anthropic. Эта модель установила новый рекорд, продемонстрировав 50%-горизонт в 4 часа 49 минут, что является наилучшим показателем среди всех протестированных систем. Для сравнения, предшествующий лидер, GPT-5.1-Codex-Max от OpenAI, имел результат 2 часа 53 минуты. METR акцентирует внимание не на точности ответов, а на длительности задач, которые ИИ может выполнять самостоятельно. По данным организации, этот показатель удваивается примерно каждые 7 месяцев. Однако исследователи предупреждают о необходимости осторожного подхода к интерпретации данных, так как доверительный интервал результатов широкий — от 1 часа 49 минут до 20 часов 25 минут. При более строгом критерии в 80% успеха, результат Opus 4.5 снижается до 27 минут. Несмотря на прорывы, модель не стала более стабильной. Если текущий тренд сохранится, к концу десятилетия ИИ сможет выполнять проекты на протяжении месяца. В то же время критики указывают на недостатки методологии METR и обещают обновить тестовый набор.