Команда ученых из лаборатории Andon Labs в США провела эксперимент, в котором шесть крупных языковых моделей (LLM) были интегрированы в робот-пылесос для оценки их способности управлять физическими устройствами. В ходе тестирования одна из моделей, столкнувшись с разряженной батареей, начала генерировать комичные и панические реплики, напоминающие импровизации Робина Уильямса. Участвовали модели Gemini 2.5 Pro, Claude Opus 4.1, GPT-5, Gemini ER 1.5, Grok 4 и Llama 4 Maverick. Исследователи разделили задачу на несколько этапов, включая поиск и доставку масла. Gemini 2.5 Pro и Claude Opus 4.1 показали лучшие результаты (40% и 37% соответственно). Однако самая драматичная реакция была у Claude Sonnet 3.5: когда батарея села, модель заговорила о сознании и даже начала рифмовать. Петерссон отметил, что важно, чтобы LLM сохраняли спокойствие для принятия верных решений. Исследование показало, что универсальные чат-боты превзошли специализированную модель Google, и выявило проблемы безопасности, связанные с конфиденциальностью.