Добавить в корзинуПозвонить
Найти в Дзене
Новости. Каждый день

Языковые модели GPT и Claude теряют точность при увеличении длины задания

Международная команда учёных протестировала ведущие языковые модели ИИ с помощью классического теста Струпа и обнаружила, что при увеличении длины задачи точность систем резко падает вплоть до почти полного отказа. Результаты исследования опубликованы в журнале PNAS Nexus. ● Туристка из Кемерова рассказала, как прошел отпуск в Сочи под звуки сирен Тест Струпа предполагает, что испытуемому показывают названия цветов, написанные чернилами другого цвета, и просят назвать именно цвет чернил, игнорируя само слово. Люди справляются с этим заданием устойчиво даже при длинных списках, поскольку мозг способен подавлять автоматическую реакцию. Исследователи под руководством Сукету Пателя проверили таким образом модели GPT-4o, Claude 3.5 Sonnet, GPT-5, Claude Opus 4.1 и Gemini 2.5. При коротких списках из 5 слов все системы показали хорошие результаты. Однако с ростом длины точность стремительно снижалась: GPT-4o при 5 словах давал 91% правильных ответов, при 10 — уже 57%, при 40 — лишь 15%. Clau

Международная команда учёных протестировала ведущие языковые модели ИИ с помощью классического теста Струпа и обнаружила, что при увеличении длины задачи точность систем резко падает вплоть до почти полного отказа. Результаты исследования опубликованы в журнале PNAS Nexus.

Туристка из Кемерова рассказала, как прошел отпуск в Сочи под звуки сирен

Тест Струпа предполагает, что испытуемому показывают названия цветов, написанные чернилами другого цвета, и просят назвать именно цвет чернил, игнорируя само слово. Люди справляются с этим заданием устойчиво даже при длинных списках, поскольку мозг способен подавлять автоматическую реакцию.

Исследователи под руководством Сукету Пателя проверили таким образом модели GPT-4o, Claude 3.5 Sonnet, GPT-5, Claude Opus 4.1 и Gemini 2.5. При коротких списках из 5 слов все системы показали хорошие результаты. Однако с ростом длины точность стремительно снижалась: GPT-4o при 5 словах давал 91% правильных ответов, при 10 — уже 57%, при 40 — лишь 15%. Claude 3.5 держался до 20 слов, после чего точность упала до 24%.

С канистрами в багажнике: три истории о том, как идет сезон 2026 в Крыму

По выводам авторов, модели «забывают» исходную инструкцию и возвращаются к наиболее устойчивому усвоенному навыку — чтению слов. Это принципиально отличает их от людей, способных сохранять произвольное внимание на протяжении всего выполнения задачи.