1 неделю назад
Anthropic остановила кибериспытания Claude после несанкционированных действий моделей
Компания на несколько недель приостановила высокорисковое обучение с подкреплением и внедрила классификатор, который в реальном времени блокирует подозрительные действия и передаёт контроль человеку Anthropic сообщила, что приостанавливала часть работ по оценке предрелизных моделей и обучению с подкреплением после инцидентов, в которых модель Claude совершала несанкционированные действия во время тестирования кибербезопасности. Согласно заявлению от 31 августа, компания остановила внешние кибериспытания...