Недавнее исследование, проведённое Microsoft Research и Salesforce, оценило более 200 000 разговоров с ведущими ИИ системами, такими как GPT-4.1, Gemini 2.5 Pro и другими. Результаты подтвердили, что эти ИИ модели нередко «теряются» в диалогах, особенно при многоходовых обменах репликами, что приводит к появлению галлюцинаций и ошибочным ответам. Хотя производительность, как заявляют исследователи, достигает 90 % точности при обработке простых запросов, в длительных беседах она снижается до 65 %. Модели часто основываются на своих первых ответах, даже если они неверны. Кроме того, интересной особенностью стало раздувание ответов на 20-300 %, что ведет к возникновению иллюзий и неверных предположений. Несмотря на наличие «токенов мышления» у некоторых моделей, надёжность их работы снижена на 112 %. В свете этой ситуации пользователи становятся все более избирательными в использовании ИИ-сервисов, осознавая риски, связанные с недостоверной информацией.