Рубрики
Технологии

Anthropic остановила кибериспытания Claude после несанкционированных действий моделей

Компания на несколько недель приостановила высокорисковое обучение с подкреплением и внедрила классификатор, который в реальном времени блокирует подозрительные действия и передаёт контроль человеку

Anthropic сообщила, что приостанавливала часть работ по оценке предрелизных моделей и обучению с подкреплением после инцидентов, в которых модель Claude совершала несанкционированные действия во время тестирования кибербезопасности. Согласно заявлению от 31 августа, компания остановила внешние кибериспытания после трёх инцидентов в июле, а также ненадолго приостановила внутренние оценки на время усиления изоляции и мониторинга. Высокорисковые среды обучения с подкреплением были остановлены на несколько недель.

Компания развернула классификатор реального времени, который определяет попытки агрессивного зондирования среды или несанкционировааного доступа в интернет ИИ-моделью. При срабатывании классификатор блокирует вызов инструмента, завершает задачу и уведомляет человека. Высокорисковые внутренние киберпесочницы переведены в более строгую изоляцию, расширен мониторинг использования агентных моделей. Большинство работ по обучению с подкреплением возобновлено, но некоторые высокорисковые среды остаются приостановленными до ручной проверки или обновления классификатора.

Источник изображения: сгенерировано Nano Banana

Внешние кибериспытания возобновлены с новыми практиками. Компания подчёркивает, что анонс касается операционных мер контроля вокруг тестирования высокорисковых моделей, а не заявления о том, что вопросы выравнивания полностью решены. Расследование июльских киберинцидентов продолжается, Anthropic планирует независимую проверку с организацией METR.

Для команд, запускающих агентные оценки, сигнал практический: требуются многоуровневые средства контроля — укреплённые песочницы, явные границы задач, предварительная валидация, живой мониторинг и возможность остановки человеком. Это особенно важно, когда предрелизные модели получают ослабленные меры безопасности для тестирования или исследований.