16.09.2026

Классический тест на внимание выявил у ИИ резкое падение точности на длинных заданиях

Современные ИИ-модели способны писать тексты, отвечать на сложные вопросы и решать задачи по программированию, однако новое исследование выявило у них заметную слабость в поддержании внимания. Ученые использовали классический психологический тест Струпа и обнаружили, что точность ведущих моделей резко ухудшается по мере увеличения длины задания.

Тест Струпа десятилетиями применяется в психологии для изучения внимания, концентрации и способности человека подавлять автоматическую реакцию. Участнику показывают названия цветов, напечатанные разными цветами, и просят назвать именно цвет текста, а не прочитать само слово. Например, слово «красный» может быть напечатано синим цветом, что создает конфликт между чтением и визуальным восприятием.

Исследователи решили проверить, насколько хорошо с такой задачей справляются крупные языковые модели. В экспериментах участвовали разные поколения GPT, Claude и Gemini. На коротких последовательностях системы показывали высокую точность и в большинстве случаев правильно следовали инструкции, даже когда написанное слово не совпадало с цветом.

Однако при увеличении количества элементов ситуация резко менялась. GPT-4o правильно выполняла около 91% задания при списке из пяти слов, но при десяти словах точность снижалась примерно до 57%. На последовательностях из 40 элементов модель давала правильный результат лишь примерно в 15% случаев.

Claude 3.5 Sonnet дольше сохраняла стабильность и успешно справлялась с последовательностями длиной до 20 слов. Однако при увеличении списка до 40 элементов ее точность также резко снижалась — примерно до 24%. Похожее поведение исследователи наблюдали у GPT-5, Claude Opus 4.1 и Gemini 2.5.

Дополнительные сложности возникали, когда в одном задании одновременно присутствовали слова, цвет которых совпадал с их значением, и конфликтующие варианты. В некоторых таких тестах точность моделей на несовпадающих элементах падала практически до нуля. Вместо продолжения первоначальной инструкции система все чаще начинала просто воспроизводить написанные слова.

Авторы работы связывают этот эффект с недостаточно устойчивым исполнительным контролем. Языковые модели чрезвычайно хорошо обучены читать и обрабатывать текст, поэтому при усложнении задачи их наиболее привычная реакция начинает доминировать над специальной инструкцией. По сути, модель все хуже подавляет ответ, который статистически является для нее наиболее естественным.

У людей также возникает эффект Струпа: чтение слова происходит автоматически, поэтому назвать цвет конфликтующего текста обычно сложнее и медленнее. Однако человек способен сохранять высокую точность даже при длинных сериях заданий. У ИИ же исследователи обнаружили гораздо более выраженное ухудшение результатов по мере увеличения нагрузки.

Работа показывает, что внешне похожее поведение человека и искусственного интеллекта может опираться на совершенно разные механизмы. Нейросеть способна хорошо имитировать выполнение когнитивной задачи на коротком примере, однако при увеличении длины последовательности ее способность удерживать первоначальную цель может быстро разрушаться.

Это ограничение особенно важно для сценариев, где ИИ должен долго следовать сложной инструкции, обрабатывать большие документы или выполнять длинную последовательность взаимосвязанных действий. Даже если отдельные этапы выглядят простыми, накопление информации и конкурирующих сигналов способно повысить вероятность того, что модель отклонится от исходной задачи.

Исследователи считают, что подобные психологические тесты могут стать полезным инструментом для изучения слабых мест ИИ. Они позволяют оценивать не только знания модели или ее способность рассуждать, но и более фундаментальные свойства — устойчивость внимания, сопротивление отвлекающим сигналам и способность последовательно соблюдать правила на протяжении длинной задачи.

Результаты не означают, что ИИ буквально теряет концентрацию так же, как человек. Речь идет о функциональном сходстве поведения при совершенно другом внутреннем устройстве системы. Тем не менее резкое падение точности показывает, что даже наиболее продвинутые языковые модели пока могут быть значительно менее устойчивыми, чем человек, в задачах, требующих продолжительного контроля над собственными ответами.

Добавить комментарий