Международная команда учёных протестировала ведущие языковые модели ИИ с помощью классического теста Струпа и обнаружила, что при увеличении длины задачи точность систем резко падает вплоть до почти полного отказа. Результаты исследования опубликованы в журнале PNAS Nexus. ● Туристка из Кемерова рассказала, как прошел отпуск в Сочи под звуки сирен Тест Струпа предполагает, что испытуемому показывают названия цветов, написанные чернилами другого цвета, и просят назвать именно цвет чернил, игнорируя само слово. Люди справляются с этим заданием устойчиво даже при длинных списках, поскольку мозг способен подавлять автоматическую реакцию. Исследователи под руководством Сукету Пателя проверили таким образом модели GPT-4o, Claude 3.5 Sonnet, GPT-5, Claude Opus 4.1 и Gemini 2.5. При коротких списках из 5 слов все системы показали хорошие результаты. Однако с ростом длины точность стремительно снижалась: GPT-4o при 5 словах давал 91% правильных ответов, при 10 — уже 57%, при 40 — лишь 15%. Clau
Языковые модели GPT и Claude теряют точность при увеличении длины задания
19 июня19 июн
3
1 мин