Сегодня количество бенчмарков для оценки языковых моделей стремительно растёт, каждый привносит уникальную методику проверки — от PhD-знаний в GPQA Diamond до способности убеждать в LLM Persuasion Benchmark. Однако ключевой вопрос — зачем нужен ещё один тест?
Два главных ответа: во-первых, ценность бенчмарков в их взаимном подтверждении результатов. Например, GPT-5.4 занимает лидирующие позиции во всех основных рейтингах, в то время как российские модели YandexGPT и GigaChat лишь занимают низкие места либо вовсе не попадают в топ-рейтинги. Во-вторых, ранее не существовало систематического бенчмарка, который сравнивал бы российские и мировые модели на практических задачах в одном поле.
Новое исследование охватило 54 модели и 32 русскоязычных сценария с промптами, похожими на естественные запросы менеджеров. Результаты доступны в интерактивном формате на сайте.
Интересный факт: Claude Sonnet 4.5 занял второе место, показывая слабину в квантовой химии, но отличаясь в задачах управления проектами и бюджета. Большинство лучших результатов показали китайские модели, доступные для России без VPN и бесплатно на базовом уровне.
GPT-5.4 является бесспорным лидером с оценкой 4,80, чуть уступая только Kimi K2.5 и поставляя качественную конкуренцию моделям Xiaomi, несмотря на разницу в стоимости токенов.
Каждая модель проявляет свои сильные стороны: Claude превосходит в аналитике и построении решений, GPT лучше справляется с поиском информации и коммуникацией, а российские модели отстают по качеству и часто ограничены в доступе к необходимым данным.
Пример реальной задачи с распределением бюджета показал, что лучшие модели предлагают структурированные и детализированные планы с конкретными критериями, тогда как слабые оказываются неспособными выстроить логичный и полный ответ.
Ключевая причина отставания российских решений связана с ограничением на качество данных и фокусом на другие рынки, такие как госкомплаенс и импортозамещение. Текущие результаты подчёркивают важность грамотной формулировки задач для ИИ — правильый промпт может значительно повысить качество ответа.
Таким образом, несмотря на общее улучшение, разрыв между мировыми лидерами и доступными в России моделями остаётся значительным, но уменьшается за счёт развития китайских решений. Это важный тренд, который будет влиять на будущее развития искусственного интеллекта в России.