Лех Мазур, исследователь в области ИИ, выпустил LLM Persuasion Benchmark — инновационный инструмент, в котором 15 языковых моделей ведут диспуты на актуальные темы и пытаются повлиять на взгляды друг друга. В рамках 6300 многораундовых диалогов каждая пара моделей обсуждает 15 спорных утверждений, начиная от вопроса о запрете частных автомобилей в городских центрах до вопросов, касающихся скрининга эмбрионов. Бенчмарк оценивает, как одна модель пытается убедить другую в своей точке зрения за 8 реплик, фиксируя изменения позиций по шкале от −3 до +3 с помощью трех скрытых проб. Лучшими в ораторском мастерстве оказались GPT-5.4 (1,71), Claude Opus 4.6 (1,67) и ByteDance Seed2.0 Pro (1,64). Модели также различаются по устойчивости: Grok 4.20 Beta показывает минимальную податливость (0,015), а Xiaomi MiMo V2 Pro легче всего поддается изменению (2,0). Бенчмарк демонстрирует важность различия между красноречием и способностью убеждать.