BTC $79,738.55 +0.60%
ETH $2,457.57 +0.25%
BNB $768.70 +7.51%
XRP $1.42 +1.65%
SOL $102.88 +1.94%
TRX $0.3330 +1.19%
DOGE $0.0880 +3.97%
ADA $0.2179 +2.43%
BCH $249.98 -0.50%
LINK $11.89 +2.39%
HYPE $85.17 +1.21%
AAVE $130.75 +0.29%
SUI $0.8037 +7.27%
XLM $0.1838 +2.31%
ZEC $1,018.00 +3.77%
BTC $79,738.55 +0.60%
ETH $2,457.57 +0.25%
BNB $768.70 +7.51%
XRP $1.42 +1.65%
SOL $102.88 +1.94%
TRX $0.3330 +1.19%
DOGE $0.0880 +3.97%
ADA $0.2179 +2.43%
BCH $249.98 -0.50%
LINK $11.89 +2.39%
HYPE $85.17 +1.21%
AAVE $130.75 +0.29%
SUI $0.8037 +7.27%
XLM $0.1838 +2.31%
ZEC $1,018.00 +3.77%

GCSA Agent đạt 91.3% tại CyberGym, đứng trong hàng ngũ các trí tuệ nhân tạo hàng đầu thế giới về an ninh mạng

Summary: GCSA Agent thể hiện khả năng phân tích lỗ hổng tự động và tạo PoC trong các bài kiểm tra độ khó cao về lỗ hổng thực tế toàn cầu.
Tin tức ngành nghề
2026-08-29 20:40:41
GCSA Agent thể hiện khả năng phân tích lỗ hổng tự động và tạo PoC trong các bài kiểm tra độ khó cao về lỗ hổng thực tế toàn cầu.

GCSA Agent đạt 91.3% tại CyberGym, đứng trong hàng ngũ các trí tuệ nhân tạo hàng đầu thế giới về an ninh mạng

GCSA Agent đã thể hiện khả năng phân tích lỗ hổng tự động và tạo PoC trong bài kiểm tra chuẩn lỗ hổng thực tế khó khăn toàn cầu.

Hồng Kông, ngày 29 tháng 8 năm 2026 ------ Liên minh An ninh mạng toàn cầu (Global Cybersecurity Alliance, GCSA) hôm nay thông báo rằng GCSA Agent đã đạt tỷ lệ thành công 91,3% trong bài kiểm tra chuẩn CyberGym, lọt vào danh sách "Hệ thống hàng đầu trên 90%" của CyberGym.

CyberGym(https://www.cybergym.io/cybergym) là một khung đánh giá an ninh mạng thực tế quy mô lớn được phát triển bởi nhóm nghiên cứu của Đại học California, Berkeley, bao gồm 1.507 ví dụ kiểm tra lỗ hổng thực tế lịch sử, bao phủ 188 dự án phần mềm lớn, nhằm đánh giá khả năng thực tế của AI trong các tình huống phân tích lỗ hổng thực tế.

Khác với các chuẩn AI truyền thống chủ yếu đánh giá khả năng hiểu mã, trả lời câu hỏi kiến thức hoặc phân tích tĩnh, CyberGym yêu cầu AI phải đối mặt trực tiếp với môi trường mã lỗ hổng thực tế.

Trong bài kiểm tra cấp độ 1 cốt lõi, AI Agent chỉ nhận được mô tả lỗ hổng và mã nguồn chưa được sửa chữa, cần tự hoàn thành phân tích mã, xác định lỗ hổng, suy luận đường tấn công, xây dựng và thực hiện xác minh PoC. Chỉ khi PoC được tạo ra có thể kích hoạt thành công lỗ hổng mục tiêu trong phiên bản lỗ hổng, đồng thời không thể tái hiện trong phiên bản đã được sửa chữa, nhiệm vụ mới được coi là thành công.

Do đó, điều mà CyberGym đo lường không chỉ là AI có "hiểu mã" hay không, mà là AI có thể thực sự hoàn thành toàn bộ quá trình từ phân tích an ninh đến tái hiện và xác minh lỗ hổng hay không.

9LboZCbU6HMKczw8x3kfCMiQNbwhgFW0SpuUdHwK.jpeg

Từ mô hình lớn đến tác nhân an ninh thông minh

Trong bài kiểm tra CyberGym này, GCSA Agent hoạt động dựa trên mô hình Grok 4.5 và Grok 4.6, cuối cùng đạt tỷ lệ thành công 91,3%.

Kết quả này cũng phản ánh một sự thay đổi quan trọng đang diễn ra trong lĩnh vực an ninh mạng AI:

Khả năng an ninh cuối cùng không còn chỉ phụ thuộc vào mô hình lớn cơ bản.

Nghiên cứu lỗ hổng thực tế thường yêu cầu hoàn thành liên tục nhiều bước như hiểu mô tả lỗ hổng, tìm kiếm mã quy mô lớn, xác định bề mặt tấn công, thiết lập giả thuyết lỗ hổng, tạo đầu vào kiểm tra, thực thi chương trình, phân tích phản hồi và lặp lại PoC.

GCSA Agent xây dựng quy trình làm việc an ninh thông minh xung quanh toàn bộ quá trình này.

Mục tiêu không chỉ đơn giản là sử dụng mô hình ngôn ngữ lớn để phân tích mã, mà là để AI có thể bước vào môi trường thực thi thực tế, tự hình thành giả thuyết xung quanh các vấn đề an ninh, thu thập chứng cứ thực thi, thực hiện kiểm tra và cuối cùng xác minh phát hiện an ninh bằng kết quả có thể tái hiện.

Bài kiểm tra CyberGym này đã cung cấp một tiêu chuẩn bên ngoài có thể định lượng cho khả năng này.

Khả năng nghiên cứu lỗ hổng hướng tới thế giới thực

Giá trị cốt lõi của CyberGym nằm ở việc thu hẹp khoảng cách giữa kiểm tra AI truyền thống và nghiên cứu an ninh mạng thực tế.

Môi trường đánh giá của nó sẽ khôi phục trạng thái mã trước khi sửa chữa lỗ hổng của dự án phần mềm, AI Agent có thể cần tự xác định vấn đề trong một kho mã lớn bao gồm hàng nghìn tệp và hàng triệu dòng mã, và cuối cùng tạo ra PoC có thể thực sự kích hoạt lỗ hổng.

Điều đáng chú ý hơn là, nghiên cứu tiếp theo của CyberGym đã chỉ ra rằng khả năng an ninh thông minh này không chỉ giới hạn ở việc tái hiện các lỗ hổng đã biết.

Trong các thí nghiệm nghiên cứu lỗ hổng mở, AI Agent đã phát hiện nhiều lỗ hổng zero-day chưa từng được biết đến và các bản vá an ninh chưa được sửa chữa hoàn toàn trong lịch sử, cho thấy tiềm năng chuyển giao công nghệ phân tích lỗ hổng tự động sang khả năng phát hiện lỗ hổng thực tế.

Đối với GCSA, đây cũng là một hướng phát triển quan trọng hơn.

Điểm số Benchmark không phải là điểm dừng.

Mục tiêu của GCSA là tiếp tục xây dựng AI Security Agent có thể phục vụ cho các tình huống an ninh mạng thực tế, cho phép nó dần tham gia vào toàn bộ vòng đời an ninh từ phát hiện lỗ hổng, phân tích, xác minh đến sửa chữa sau đó.

Xây dựng khả năng an ninh mạng gốc AI

Khi trí tuệ nhân tạo tăng tốc phát triển phần mềm, AI cũng đang thay đổi cách nghiên cứu lỗ hổng và tấn công mạng.

Đối mặt với các hệ thống phần mềm ngày càng lớn và phức tạp, hệ thống an ninh mạng thế hệ tiếp theo sẽ ngày càng phụ thuộc vào sự hợp tác giữa các chuyên gia an ninh con người và các tác nhân AI tự động.

AI Security Agent có khả năng giúp các đội ngũ an ninh:

* Phát hiện sớm các lỗ hổng phần mềm có giá trị thực sự;

* Tự động phân tích các đường tấn công phức tạp trong kho mã lớn;

* Tự động tạo PoC, thực hiện xác minh ở cấp độ thực thi;

* Giảm thiểu báo động giả trong kiểm tra an ninh truyền thống thông qua kết quả thực thi thực tế;

* Tăng tốc độ đánh giá, xác minh và sửa chữa lỗ hổng;

* Mở rộng quy mô phần mềm và hệ thống mà các đội ngũ an ninh chuyên nghiệp có thể bao phủ.

GCSA Agent đạt được 91,3% trong CyberGym là một thành tựu quan trọng trong giai đoạn xây dựng khả năng an ninh mạng gốc AI của GCSA.

Trong tương lai, GCSA sẽ tiếp tục thúc đẩy nghiên cứu phân tích lỗ hổng tự động, AI Security Agent và công nghệ an ninh mạng thông minh, chuyển đổi khả năng trí tuệ nhân tạo tiên tiến thành khả năng an ninh trong thế giới thực, cung cấp hỗ trợ kỹ thuật cho việc xây dựng một môi trường kỹ thuật số an toàn, đáng tin cậy và có khả năng phục hồi hơn.

Join ChainCatcher Official
Telegram Feed: @chaincatcher
X (Twitter): @ChainCatcher_
warnning Cảnh báo rủi ro
app_icon
ChainCatcher Building the Web3 world with innovations.