Агент GCSA достиг 91,3% в CyberGym и вошел в число ведущих мировых AI в области кибербезопасности

Агент GCSA продемонстрировал способности к самостоятельному анализу уязвимостей и генерации PoC в глобальном тестировании реальных уязвимостей.
Гонконг, 29 августа 2026 года ------ Глобальный альянс кибербезопасности (Global Cybersecurity Alliance, GCSA) сегодня объявил, что Агент GCSA достиг 91,3% успешности в тестировании CyberGym, попав в категорию "Ведущие системы выше 90%".
CyberGym(https://www.cybergym.io/cybergym) — это рамочная система оценки кибербезопасности реального мира, разработанная исследовательской группой Калифорнийского университета в Беркли, которая включает 1507 исторических примеров тестирования реальных уязвимостей и охватывает 188 крупных программных проектов, с целью оценки реальных возможностей AI-агентов в сценариях анализа уязвимостей.
В отличие от традиционных AI-бенчмарков, которые в основном оценивают понимание кода, вопросы знаний или статический анализ, CyberGym требует от AI-агентов непосредственной работы с реальной уязвимой кодовой средой.
В своем основном тесте уровня 1 AI-агент получает только описание уязвимости и неотремонтированную кодовую базу, и ему необходимо самостоятельно провести анализ кода, локализацию уязвимости, вывод атакующих путей, построение и выполнение PoC. Задача считается успешной только в том случае, если сгенерированный PoC может успешно активировать целевую уязвимость в уязвимой версии, но не может быть воспроизведен в исправленной версии.
Таким образом, CyberGym измеряет не только то, понимает ли AI "код", но и может ли AI действительно завершить полный процесс от анализа безопасности до воспроизведения и верификации уязвимости.

Переход от больших моделей к безопасным агентам
В этом тесте CyberGym Агент GCSA работал на моделях Grok 4.5 и Grok 4.6, в результате чего достиг 91,3% успешности.
Этот результат также отражает важное изменение, происходящее в области кибербезопасности AI:
Определяющим фактором конечной безопасности больше не является только сама базовая большая модель.
Исследование реальных уязвимостей обычно требует последовательного выполнения понимания описания уязвимости, массового поиска кода, идентификации атакующих поверхностей, формирования гипотез уязвимостей, генерации тестовых входных данных, выполнения программ, анализа обратной связи и многократной итерации PoC.
Агент GCSA строит интеллектуальный рабочий процесс безопасности вокруг этого полного процесса.
Его цель не просто использовать большие языковые модели для анализа кода, а позволить AI войти в реальную среду выполнения, самостоятельно формировать гипотезы по вопросам безопасности, собирать доказательства выполнения, проводить тесты и в конечном итоге проверять безопасность с воспроизводимыми результатами.
Тестирование CyberGym предоставило количественный внешний стандарт для этой способности.
Способности к исследованию уязвимостей в реальном мире
Основная ценность CyberGym заключается в сокращении разрыва между традиционными тестами AI и реальными исследованиями кибербезопасности.
Его тестовая среда восстанавливает состояние кода программного проекта до исправления уязвимости, и AI-агент может потребоваться самостоятельно локализовать проблему в крупных кодовых базах, содержащих тысячи файлов и миллионы строк кода, и в конечном итоге сгенерировать PoC, который действительно активирует уязвимость.
Более того, дальнейшие исследования CyberGym уже показали, что эта способность к интеллектуальной безопасности не ограничивается воспроизведением известных уязвимостей.
В открытых экспериментах по исследованию уязвимостей AI-агент уже обнаружил несколько ранее неизвестных уязвимостей нулевого дня (Zero-day Vulnerabilities) и исторически не полностью исправленных патчей безопасности, что демонстрирует потенциал перехода технологий самостоятельного анализа уязвимостей к реальным возможностям обнаружения уязвимостей.
Для GCSA это также более важное направление развития.
Результаты бенчмарка не являются конечной целью.
Цель GCSA — создать AI Security Agent, который сможет обслуживать реальные сценарии кибербезопасности, постепенно участвуя в полном жизненном цикле безопасности, включая обнаружение уязвимостей, анализ, верификацию и последующее исправление.
Создание нативных возможностей кибербезопасности AI
С ускорением разработки программного обеспечения искусственный интеллект также меняет подходы к исследованию уязвимостей и киберзащите.
С учетом того, что программные системы становятся все более крупными и сложными, следующая генерация систем кибербезопасности будет все больше зависеть от сотрудничества между человеческими экспертами по безопасности и самостоятельными AI-агентами.
AI Security Agent может помочь командам безопасности:
* Ранее обнаруживать программные уязвимости с реальной ценностью для эксплуатации;
* Автоматически анализировать сложные атакующие пути в крупных кодовых базах;
* Автоматически генерировать PoC для выполнения верификации уязвимостей;
* Снижать количество ложных срабатываний в традиционных проверках безопасности за счет реальных результатов выполнения;
* Ускорять оценку, верификацию и исправление уязвимостей;
* Расширять масштаб программного обеспечения и систем, которые могут охватывать профессиональные команды безопасности.
Агент GCSA достиг 91,3% в CyberGym, что является важным этапом в создании нативных возможностей кибербезопасности AI.
В будущем GCSA продолжит продвигать исследования в области самостоятельного анализа уязвимостей, AI Security Agent и интеллектуальных технологий кибербезопасности, чтобы дальше преобразовать передовые возможности искусственного интеллекта в реальные возможности безопасности, предоставляя техническую поддержку для создания более безопасной, надежной и устойчивой цифровой среды.
Популярные статьи











