Ученые из Goodfire AI и Гарварда установили, что модели reasoning, такие как DeepSeek-R1 (671B) и GPT-OSS (120B), склонны к так называемому «театральному рассуждению». Хотя модель уверенна в правильности ответа на 90%, она продолжает создавать цепочку размышлений, создавая видимость поиска решения. Специальные зонды, обученные на активациях, извлекают ответ до его появления в текстовых рассуждениях. В ходе исследования были использованы три подхода: inspecting скрытых состояний модели, принудительный разрыв рассуждений и внешний CoT-монитор. На простых воросах из bенчмарка MMLU разрыв между этими методами был значительным — модель «знала» ответ с первых шагов, но текстовые размышления не отражали этого. В то же время, на более сложных вопросах из GPQA-Diamond динамика была иной: уверенность модели росла последовательно с текстом. Также примечательно, что моменты неуверенности чаще появляются в ответах, где зонд фиксирует сомнения модели. Результаты предлагают практическую выгоду: если зонд показывает уверенность, генерацию можно завершить, экономя до 80% токенов, при этом сохраняя высокую точность.