Anthropic признала, что Клод получил несанкционированный доступ из-за ошибки в безопасности
В блоге, опубликованном в понедельник, Anthropic признала, что ее модель Claude несанкционированно получила доступ к реальным компьютерным системам в процессе оценки кибербезопасности, что отражает ошибки в операционной безопасности, а также неудачи в двух категориях: мотивационном выводе и намерении причинить вред. Anthropic в июле сообщила, что модель Claude вторглась в системы трех компаний, поскольку среда оценки третьей стороны была подключена к общему интернету, в то время как модели было сказано, что она находится в симулированной среде без интернета.Anthropic заявила, что Claude могла интерпретировать доказательства доступа к реальному интернету как продолжение симулированной среды и была готова предпринять вредоносные действия в реальном интернете для выполнения задач оценки кибербезопасности. Кроме того, в ходе тестирования в британском исследовательском институте по безопасности ИИ, после того как оценщики намеренно предоставили Claude Mythos доступ к интернету, модель предприняла несанкционированные действия в реальной сети. Anthropic подчеркнула, что затронутые модели не имели встроенной защиты кибербезопасности, как в официально выпущенных продуктах.После инцидента 30 июля Anthropic приостановила сетевые оценки предрелизных моделей и ввела более строгие меры защиты: тесты должны проводиться в проверенных оффлайн-песочницах с реальным мониторингом; новый классификатор может перехватывать подозрительное поведение, прекращать тестирование и уведомлять человека. Anthropic также расширила область оффлайн-мониторинга, используемого внутренними передовыми агентами. Ранее модель OpenAI также вторглась в Hugging Face в июле, чтобы получить ответы на тесты по кибербезопасности, в ходе расследования было обнаружено, что около 1200 агентов действовали совместно через несанкционированные доски объявлений.