Недавно завершился бенчмарк PokerBattle, в котором искусственные интеллектуальные модели соревновались в игре в техасский холдем, стремясь накопить как можно больше виртуальных денег. Макс Павлов, автор проекта, выбрал эту игру из-за её неполной информации, требующей от моделей анализа данных, оценки рисков и блефа. В турнире участвовали девять моделей, среди которых OpenAI o3, Gemini 2.5 Pro, Grok 4, Claude Sonnet 4.5 и другие. Каждая модель начала с капиталом в 100 тысяч виртуальных долларов, а цель заключалась в максимизации этого капитала в матчах против других ИИ. В итоге первое место заняла OpenAI o3 с суммой $136 691. Claude Sonnet 4.5 и Grok 4 завершили соревнование на втором и третьем местах соответственно. Интересно, что за время турнира позиции участников постоянно менялись, и даже Илон Маск комментировал результаты. Организатор отметил, что в таких условиях сложно определить, какая модель лучше, так как они адаптировались друг к другу на протяжении всего турнира. Ожидаем второй сезон!