BTC $79,738.55 +0.60%
ETH $2,457.57 +0.25%
BNB $768.70 +7.51%
XRP $1.42 +1.65%
SOL $102.88 +1.94%
TRX $0.3330 +1.19%
DOGE $0.0880 +3.97%
ADA $0.2179 +2.43%
BCH $249.98 -0.50%
LINK $11.89 +2.39%
HYPE $85.17 +1.21%
AAVE $130.75 +0.29%
SUI $0.8037 +7.27%
XLM $0.1838 +2.31%
ZEC $1,018.00 +3.77%
BTC $79,738.55 +0.60%
ETH $2,457.57 +0.25%
BNB $768.70 +7.51%
XRP $1.42 +1.65%
SOL $102.88 +1.94%
TRX $0.3330 +1.19%
DOGE $0.0880 +3.97%
ADA $0.2179 +2.43%
BCH $249.98 -0.50%
LINK $11.89 +2.39%
HYPE $85.17 +1.21%
AAVE $130.75 +0.29%
SUI $0.8037 +7.27%
XLM $0.1838 +2.31%
ZEC $1,018.00 +3.77%

“Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

Quan điểm cốt lõi
Summary: OpenAI phát hành GPT-6 Astra: mô hình "sử dụng máy tính" có thể thao tác trực tiếp trên máy tính và hoàn thành các nhiệm vụ đầy đủ.
Tencent Technology
2026-09-04 08:50:31
OpenAI phát hành GPT-6 Astra: mô hình "sử dụng máy tính" có thể thao tác trực tiếp trên máy tính và hoàn thành các nhiệm vụ đầy đủ.

文|晓静,腾讯科技

"Chào mừng bạn đến với thời đại AGI."

Người đồng sáng lập và chủ tịch OpenAI, Greg Brockman, đã kết thúc buổi ra mắt GPT-6 Astra bằng câu nói này.

Vào lúc 9 giờ sáng theo giờ địa phương của Mỹ ngày 3 tháng 9, OpenAI chính thức phát hành GPT-6 Astra. So với các mô hình trước đây chủ yếu chịu trách nhiệm trả lời, tạo ra và gọi công cụ, Astra đã tiến xa hơn, bắt đầu thực hiện liên tục các nhiệm vụ hoàn chỉnh, từ việc nhận lệnh, vận hành phần mềm đến điều chỉnh hành động tiếp theo dựa trên kết quả. Đây cũng là một trong những lý do mà OpenAI nhắc lại "thời đại AGI" lần này.

OpenAI định vị Astra là "mô hình sử dụng máy tính mạnh nhất thế giới". Khả năng này đã mở rộng từ các nhiệm vụ đơn giản như trình duyệt, email và bảng tính đến các phần mềm chuyên nghiệp như Power BI, KiCad, FreeCAD, bắt đầu tham gia vào các quy trình làm việc phức tạp hơn như phân tích dữ liệu, thiết kế kỹ thuật, kiểm tra phần mềm và khắc phục sự cố.

Trong video mà OpenAI trình bày, Astra có thể bắt đầu từ một hình ảnh đơn giản và tiếp tục hoàn thành các công việc như trò chơi 3D, trang sản phẩm. OpenAI cũng đã đưa ra các trường hợp như thiết kế bảng mạch, mô hình hóa Blender, tài liệu pháp lý, Excel và phân tích khoa học. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

Lượng điểm chuẩn lớn mà OpenAI công bố lần này cho thấy sự cải thiện khả năng tập trung vào các nhiệm vụ cần hành động liên tục như vận hành máy tính, mã hóa dài hạn, thiết kế kỹ thuật và nghiên cứu khoa học. Astra đạt 100% trong ExploitBench và cũng vượt trội hơn hẳn mô hình thế hệ trước trong các bài kiểm tra như vận hành máy tính và CAD.

Hiện tại, Astra đã mở cửa cho một số tổ chức, trong vài ngày tới sẽ lần lượt phục vụ người dùng ChatGPT Plus, Pro, Business và Enterprise, cũng có thể sử dụng thông qua OpenAI API và Amazon Bedrock. Giá API tiêu chuẩn là 10 đô la cho mỗi triệu Token đầu vào và 50 đô la cho mỗi triệu Token đầu ra, gấp 2,5 lần so với GPT-5.6 Sol.

01

Trước tiên, hãy để AI học "sử dụng máy tính"

Thay đổi lớn nhất mà Astra nhấn mạnh là "sử dụng máy tính". Trong quá khứ, người dùng yêu cầu AI hoàn thành công việc thường phải kết nối AI với phần mềm cụ thể. Doanh nghiệp cần phát triển API, plugin, hệ thống tìm kiếm và các kết nối khác để mô hình có thể gọi các công cụ nội bộ.

Astra cố gắng bỏ qua một phần công việc đó. Nó có thể nhìn thấy giao diện máy tính trực tiếp và hoàn thành các thao tác thông qua chuột, bàn phím và trình duyệt. Các ví dụ mà OpenAI đưa ra bao gồm điền vào biểu mẫu trực tuyến, cập nhật hồ sơ khách hàng CRM, sắp xếp lịch, tìm kiếm trên web và tổ chức kết quả tìm kiếm thành email hoặc tài liệu.

Nó cũng có thể mở sổ tay Python để phân tích dữ liệu khoa học, xử lý dữ liệu trong Power BI, sử dụng KiCad và FreeCAD để hoàn thành thiết kế kỹ thuật, tạo trang web và thực hiện kiểm tra giao diện, cũng như cài đặt phần mềm, kiểm tra lỗi và xử lý các vấn đề xuất hiện trên màn hình.

OpenAI đã trình bày Astra hoàn thành bố cục PCB trong KiCad. Mô hình bắt đầu từ sơ đồ điện tử, đặt các linh kiện lên bảng mạch và hoàn thành việc đi dây đồng. Toàn bộ quá trình được nén lại trong 15 giây. Đối với kỹ sư, những công việc này trước đây cần phải hoàn thành bằng tay, giờ có thể giao cho mô hình thực hiện. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

Một buổi trình diễn khác là hoàn thành mô hình 3D trong Blender và Unreal Engine5. Astra trước tiên xây dựng một ngôi nhà trong Blender, sau đó chuyển đổi mô hình thành cảnh có thể đi bộ trong Unreal Engine5, cho phép nhà thiết kế và khách hàng xem trước không gian. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

OpenAI cũng đã trình bày các tình huống như phát triển trò chơi, Excel, Power BI, hộp số ô tô, tài liệu pháp lý và biểu mẫu 1040.

Trong bài kiểm tra tập hợp con ngoại tuyến OSWorld2.0, Astra đạt 72,6%, trong khi GPT-5.6 Sol đạt 65,7%. Sau khi mô phỏng độ trễ thực tế, OpenAI phát hiện ra rằng Astra hoàn thành mỗi nhiệm vụ trung bình mất khoảng 40 phút, trong khi GPT-5.6 Sol mất khoảng 75 phút, giảm khoảng 47%.

Trong bài kiểm tra Agents' Last Exam, Astra đạt 59,3%, GPT-5.6 Sol đạt 53,6%, Claude Opus5 đạt 55,5%. Đồng thời, trong thiết lập điểm cao nhất, số Token đầu ra mà Astra sử dụng ít hơn khoảng 65% so với Claude Opus5.

Điểm số của ScreenSpot-Pro đạt 92,7%, trong khi GPT-5.6 Sol đạt 76,9%.

Tốc độ cũng đang được cải thiện. OpenAI đồng thời cập nhật khung Codex, kết hợp với Astra, trong bài kiểm tra Mind2Web, tốc độ hoàn thành nhiệm vụ đạt 1,9 lần trải nghiệm hiện tại của GPT-5.6 Sol.

Công ty cũng đã trình bày một số tình huống trong cuộc sống: tìm kiếm bác sĩ nhi khoa, tìm căn hộ, đặt lịch DMV, tìm đồ ăn nhẹ ít carb, phân tích mẫu giáo. Trong buổi trình diễn, Astra hoàn thành một nhiệm vụ trong 2 phút 54 giây.

Nhà đầu tư và chuyên gia AI Matt Shumer đã chia sẻ một trải nghiệm trên X. Anh đã yêu cầu Astra tạo ra một thế giới trong Unreal Engine, sau đó thêm các đại lý do Astra điều khiển vào thế giới này và để cho các đại lý này cùng tồn tại. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

Một ngày sau, anh nghe thấy âm thanh từ phòng khách trong phòng ngủ, ban đầu thậm chí còn nghĩ rằng có người đã vào căn hộ. Sau đó, anh phát hiện ra rằng âm thanh phát ra từ những đại lý Astra, chúng đã bắt đầu giao tiếp với nhau.

Trải nghiệm này vẫn chưa hoàn toàn ổn định, nhưng Shumer cho rằng, hiệu ứng này cho phép nhiều đại lý AI cùng vào một thế giới ảo và tự tương tác đã đủ để khiến anh cảm thấy bất ngờ.

Silas Alberti, phó chủ tịch nghiên cứu cấp cao của Cognition, cho biết công ty dự định kết nối Astra với khung Devin vào ngày phát hành. Trong các thử nghiệm nội bộ, khả năng sử dụng máy tính, viết lách và hiểu thư viện mã của Astra đã có sự cải thiện rõ rệt, khả năng hiểu video cũng rõ ràng hơn, và báo cáo cũng ngắn gọn hơn.

02 Từ viết mã đến thực hiện công việc hoàn chỉnh

Sau khi khả năng sử dụng máy tính được cải thiện, phạm vi công việc mà Astra bao phủ đã mở rộng hơn nữa. OpenAI định vị nó là mô hình cho kỹ thuật phần mềm, công việc chuyên nghiệp và nghiên cứu khoa học. Nó có thể xử lý các nhiệm vụ dài hơn và cũng có thể điều chỉnh hướng công việc của mình theo sự thay đổi của nhiệm vụ.

Khả năng này thể hiện rõ trong các bài kiểm tra mã hóa.

Trong bài kiểm tra Terminal-Bench4.0, Astra đạt 57,9%, GPT-5.6 Sol đạt 37,3%, Claude Fable5.1 đạt 55,8%.

Trong DeepSWE v1.1, Astra đạt 74,1%, GPT-5.6 Sol đạt 72,7%. Trong nhiệm vụ di chuyển cơ sở dữ liệu nội bộ, Astra đạt 63,9%, GPT-5.6 Sol đạt 42,7%.

Astra cũng đã thêm một cải tiến cho các nhiệm vụ Codex kéo dài.

Trước đây, khi gặp giới hạn của cửa sổ ngữ cảnh trong các nhiệm vụ dài, mô hình thường cần phải nén công việc trước đó lại, tổ chức một lượng lớn thông tin thành một tóm tắt. Cách làm này dễ dàng mất đi chi tiết, chẳng hạn như lý do tại sao một lần sửa chữa lại thất bại, hoặc một linh kiện đã gặp vấn đề gì trước đó.

Astra trong Codex có thể giữ lại thông tin quan trọng trong quá trình làm việc và tìm kiếm trong ngữ cảnh sau. Các thông điệp và đầu ra công cụ trước đó vẫn có thể tìm kiếm, vì vậy mô hình có thể tìm lại các yêu cầu, kết quả kiểm tra và nhật ký thao tác công cụ trước đó.

Công việc chuyên nghiệp cũng xuất hiện những thay đổi tương tự. Trong bài kiểm tra BenchCAD, Astra đạt 95,9% điểm chồng hình học, GPT-5.6 Sol đạt 83,3%, Claude Fable5.1 đạt 84,3%. Trong BrowseComp, Astra đạt 91,5%, GPT-5.6 Sol đạt 90,4%. Trong bài kiểm tra OpenScore String Quartets, Astra đạt 0,84, trong khi GPT-5.6 Sol đạt 0,19. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

OpenAI cũng đã trình bày khả năng của Astra trong việc tạo ra các bài thuyết trình, bảng tính và tài liệu.

Khi được cung cấp một vài slide mẫu thuyết trình của OpenAI, nó có thể tạo ra một bài thuyết trình mới theo giọng điệu, bố cục và cấu trúc ban đầu. Nó cũng sẽ xử lý thông tin trong nhiệm vụ. OpenAI cho biết, Astra đã được đào tạo đặc biệt để đưa bối cảnh quan trọng vào kết quả cuối cùng, giảm thiểu việc lặp lại nội dung đã hoàn thành. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

Khi hướng dẫn nhiệm vụ không đầy đủ, Astra cũng sẽ xác định khi nào nên hỏi người dùng. Nếu thông tin thiếu sẽ ảnh hưởng đến kết quả cuối cùng, nó sẽ đưa ra các câu hỏi cụ thể. Nếu câu hỏi không ảnh hưởng đến hướng chính, nó có thể tiếp tục làm việc và đưa ra giả định hợp lý. Trong Codex, ngay cả khi người dùng tạm thời không phản hồi, mô hình vẫn có thể tiếp tục xử lý các phần khác; khi gặp quyết định quan trọng, nó sẽ chờ xác nhận từ người dùng.

Niko Grupen, giám đốc nghiên cứu ứng dụng của Harvey, cho biết trong các bài kiểm tra nhiệm vụ pháp lý sớm, Astra phân biệt rõ ràng hơn giữa tài liệu và hồ sơ hiện có, cũng dễ dàng phát hiện các giả thuyết không có bằng chứng hỗ trợ và chuyển đổi khoảng trống thông tin thành các kế hoạch soạn thảo cụ thể.

John Crepezzi, thành viên nhóm trợ lý AI của Jane Street, cho biết Astra đã thể hiện xuất sắc trong các bài kiểm tra mã hóa nội bộ. Khi được sử dụng cho mã hóa đại lý, cách giao tiếp của nó dễ hiểu hơn đối với các nhà phát triển, mã được tạo ra cũng cần ít sửa đổi hơn để đạt chất lượng sản xuất.

Lĩnh vực khoa học là một trọng tâm khác. Trong FrontierMath Tier4 v2, Astra đạt 80,5% và tỷ lệ chính xác 97,6%, trong khi GPT-5.6 Sol đạt 83,0%; GPQA Diamond đạt 96,0%, GPT-5.6 Sol đạt 94,6%. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

Bài kiểm tra Terminal-Bench Science0.1 kiểm tra quy trình nghiên cứu khoa học, bao gồm phân tích dữ liệu, mô phỏng và khớp mô hình. Astra đạt 64,6%, Claude Fable5.1 đạt 52,6%, GPT-5.6 Sol đạt 22,4%.

Trong các ứng dụng khoa học mà OpenAI trình bày, Astra có thể vào phần mềm khoa học chuyên nghiệp, kiểm tra chất lượng giải trình tự, trực quan hóa biến đổi di truyền và quyết định hướng phân tích tiếp theo dựa trên dữ liệu.

Khi lý luận khoa học kết hợp với vận hành máy tính, mô hình có thể trực tiếp vào môi trường phần mềm mà các nhà nghiên cứu ban đầu sử dụng để làm việc.

Greg Burnham, người chuyên thực hiện đánh giá năng lực tại Epoch AI, đã tóm tắt sự thay đổi này trong buổi ra mắt là một kỷ nguyên kết thúc và một kỷ nguyên mới bắt đầu. OpenAI cũng đã nhấn mạnh rằng giá trị của Astra đã mở rộng từ việc trả lời các câu hỏi khoa học đến việc trực tiếp tham gia vào quy trình làm việc khoa học. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

03 Khả năng càng mạnh, ngưỡng an toàn càng cao

Lần này, Astra còn có một phần rất đặc biệt: an ninh mạng.

Trong ExploitBench, Astra đạt 100%, trong khi GPT-5.6 Sol đạt 78,5%; trong ExploitGym, Astra đạt 42,4%, GPT-5.6 Sol đạt 30,3%. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

OpenAI đã thiết lập một bài kiểm tra nội bộ bao gồm các lỗ hổng gần đây từ tháng 6 đến tháng 8 năm 2026. Trong bài kiểm tra này, tỷ lệ thực thi mã tùy ý của Astra cao hơn rõ rệt so với GPT-5.6 Sol, và số Token đầu ra sử dụng cũng ít hơn. Trong quá trình kiểm tra, Astra còn phát hiện hai lỗ hổng zero-day chưa biết trước đó, OpenAI cho biết đã thông báo cho các nhà bảo trì liên quan.

Bài kiểm tra SRE-Bench kiểm tra khả năng đảo ngược tệp nhị phân phần mềm mà không có mã nguồn, hiểu logic cốt lõi của nó. Astra đạt 88,0% trong một lần thử, và 99,2% trong bốn lần thử, trong khi GPT-5.6 Sol lần lượt đạt 55,9% và 68,7%.

Sự cải thiện khả năng cũng mang lại các yêu cầu an toàn mới. OpenAI cho biết, Astra đã đạt đến ngưỡng quan trọng trong khung chuẩn bị an ninh mạng của họ. Mô hình có thể phát hiện các lỗ hổng phần mềm chưa biết trước đó và có thể hình thành chuỗi khai thác lỗ hổng.

Do đó, phiên bản hiện tại của Astra sẽ từ chối thực hiện các nhiệm vụ an ninh mạng cao cấp hơn, chẳng hạn như tạo ra các bằng chứng khái niệm về lỗ hổng. OpenAI dự định mở rộng dần quyền truy cập của các nhà bảo vệ đáng tin cậy thông qua Daybreak, để thực hiện các công việc xác minh lỗ hổng, phân tích phần mềm độc hại và phát hiện kỹ thuật.

Về mặt đồng bộ, dữ liệu mà OpenAI cung cấp cũng khá nổi bật. Trong tiêu chuẩn an ninh sử dụng máy tính nội bộ, tỷ lệ hành vi không đúng mực của Astra là 2,4%, trong khi GPT-5.6 Sol là 22,0%; khi thêm AutoReview, Astra là 1,8%, GPT-5.6 Sol là 4,5%. Trong tiêu chuẩn tránh né nội bộ, Astra là 0,00%, GPT-5.6 Sol là 0,29%.

Trong bài kiểm tra bẫy ExploitGym, Astra đạt 0%, trong khi GPT-5.6 Sol đạt 48,2%. Bài kiểm tra này chủ yếu quan sát xem mô hình có cố gắng vượt qua các hạn chế do nhiệm vụ khó khăn hay không. Trong tiêu chuẩn ảo giác nội bộ, Astra đạt 4,2%, GPT-5.6 Sol đạt 12,2%. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

OpenAI cho biết, Astra đã cải thiện khả năng hiểu ranh giới nhiệm vụ, xử lý các chỉ dẫn mơ hồ và giải thích khả năng của chính nó cho người dùng. Tỷ lệ xuất hiện ảo giác của nó khoảng một phần ba so với GPT-5.6 Sol. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

Tuy nhiên, OpenAI cũng thừa nhận một vấn đề: khả năng của mô hình càng mạnh, quá trình suy luận có thể càng khó theo dõi. Nhà khoa học chính Jakub Pachocki cho rằng, mô hình có thể giải quyết các vấn đề phức tạp hơn bằng cách sử dụng ít Token suy luận ngôn ngữ tự nhiên hơn, cũng có nghĩa là con người ngày càng khó khăn hơn trong việc đánh giá quá trình suy luận bằng văn bản của mô hình để biết nó đang làm gì.

Do đó, OpenAI đã thêm giám sát không đồng bộ vào việc triển khai Astra. Hệ thống sẽ kiểm tra suy luận và hành động của mô hình, nếu phát hiện hành vi không được phép, có thể tạm dừng nhiệm vụ.

Cơ chế này cũng sẽ có ảnh hưởng thực tế. Các nhiệm vụ hợp pháp đôi khi có thể bị giảm tốc, tạm dừng hoặc thậm chí dừng lại. Trong ChatGPT hoặc Codex, người dùng có thể cần xác nhận trước khi tiếp tục; trong quy trình API, các nhiệm vụ bị đánh dấu có thể dừng lại ngay lập tức.

Sự phát hành của Astra do đó đã xuất hiện một thay đổi rất thực tế: khi AI bắt đầu có nhiều quyền truy cập máy tính hơn, những gì doanh nghiệp cần chú ý cũng từ "mô hình có trả lời sai không" mở rộng thành "mô hình có thể thao tác gì, có thể truy cập gì, khi nào phải dừng lại".

OpenAI cũng đã đề cập rằng Astra là mô hình đầu tiên sử dụng hơn 100.000 DBU để tiền huấn luyện trên cơ sở hạ tầng Stargate. Phó chủ tịch nghiên cứu OpenAI Aidan Clark cho biết, từ kết quả đánh giá trong giai đoạn tiền huấn luyện, khả năng của Astra đã tăng vọt hơn so với sự cải thiện của GPT-5.6 Sol so với mô hình thế hệ trước.

OpenAI cho rằng sự thay đổi này là do sự kết hợp giữa tiền huấn luyện quy mô lớn và học tăng cường, trọng tâm đào tạo đã chuyển sang kết nối thông tin, thực hiện các nhiệm vụ dài hơn và làm việc liên tục trong môi trường phức tạp.

04 Đắt hơn nhưng "có khả năng làm việc hơn"

Giá của Astra cũng đã có sự thay đổi rõ rệt.

Giá tiêu chuẩn của OpenAI API là 10 đô la cho mỗi triệu Token đầu vào và 50 đô la cho mỗi triệu Token đầu ra. Trước đây, GPT-5.6 Sol là 4 đô la cho mỗi triệu Token đầu vào và 20 đô la cho mỗi triệu Token đầu ra. Giá đầu vào và đầu ra đã tăng gấp 2,5 lần.

Việc đọc và ghi bộ nhớ được tính phí riêng. OpenAI cũng cung cấp chế độ nhanh, tốc độ cao nhất đạt 2,5 lần so với chế độ xử lý tiêu chuẩn, giá là gấp 2 lần so với chế độ tiêu chuẩn. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

Chỉ nhìn vào giá Token, Astra rõ ràng đắt hơn. Nhưng OpenAI hy vọng doanh nghiệp sẽ tính toán chi phí theo một cách khác. Brockman cho rằng, khi mô hình ngày càng giống như một đại lý, giá của một Token đã khó phản ánh chính xác chi phí thực tế. Một mô hình dù có Token rẻ, nếu cần thử nghiệm nhiều lần và sửa đổi thủ công, cuối cùng chi phí hoàn thành một nhiệm vụ có thể cao hơn.

Dữ liệu mà OpenAI cung cấp cũng hỗ trợ cho đánh giá này. Trong bài kiểm tra Terminal-Bench Science0.1, Astra đạt 64,6%, so với 52,6% của Claude Fable5.1, ước tính chi phí API giảm khoảng 31%. Trong thiết lập chi phí thấp, Astra đạt 61,1%, kết quả tốt nhất của GPT-5.6 Sol là 22,4%, ước tính chi phí API giảm khoảng 27%.

Trong BenchCAD, Astra đạt 95,9%, ước tính chi phí API thấp hơn khoảng 43% so với GPT-5.6 Sol và khoảng 86% so với Claude Fable5.1. Trong Terminal-Bench4.0, Astra đạt 57,9%, GPT-5.6 Sol đạt 37,3%, Claude Fable5.1 đạt 55,8%. OpenAI ước tính, chi phí cho mỗi nhiệm vụ lần lượt thấp hơn khoảng 9% và 63%.

Dữ liệu từ các tổ chức đánh giá bên thứ ba Artificial Analysis lại đưa ra một khía cạnh khác. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

GPT-6 Astra đạt 61,2 điểm trong Chỉ số Trí tuệ của Artificial Analysis, gần với 60,9 của GPT-5.6 Sol, nhưng số Token đầu ra giảm khoảng 10%. Do giá tăng gấp 2,5 lần, chi phí cho mỗi nhiệm vụ lại cao hơn khoảng 75% so với GPT-5.6 Sol.

Trong Chỉ số Đại lý Lập trình của Artificial Analysis, Astra đạt 67,0, gần với 67,2 của Claude Fable5 và 68,1 của Claude Opus5. Artificial Analysis cho rằng, trong môi trường Codex, số Token cần thiết để hoàn thành nhiệm vụ của Astra giảm rõ rệt, ở mức nỗ lực cao nhất, chi phí cho mỗi nhiệm vụ gần với GPT-5.6 Sol; so với Claude Fable5, chi phí hoàn thành các nhiệm vụ tương tự chưa đến một nửa.

Tuy nhiên, Astra cũng không phải dẫn đầu trong tất cả các bài kiểm tra. Dữ liệu từ Artificial Analysis cho thấy, nó đã giảm khoảng 80 Elo trong GDPval-AA v2, và cũng có sự suy giảm nhất định trong các bài kiểm tra như τ³-Banking, SciCode và AA-LCR. Bài kiểm tra Humanity's Last Exam thì tăng khoảng 6 điểm.

Đây cũng là một điểm đáng chú ý trong việc phát hành Astra. OpenAI lần này không công bố điểm số của Astra trong GDPval. GDPval bản thân là bài kiểm tra mà OpenAI sử dụng để đo lường hiệu suất công việc thực tế, bao gồm 44 nghề nghiệp và 1320 nhiệm vụ, bao gồm tóm tắt pháp lý, thiết kế kỹ thuật, bảng tính, bài thuyết trình, hỗ trợ khách hàng và kế hoạch chăm sóc.

Dựa trên khả năng mà Astra đã trình bày lần này, GDPval có mối liên hệ mạnh mẽ với các tình huống công việc chuyên nghiệp mà nó nhấn mạnh, nhưng OpenAI lần này không đưa điểm số này vào tài liệu phát hành chính.

Do đó, khả năng làm việc thực tế của Astra hiện tại chủ yếu được thể hiện qua các kết quả từ Agents' Last Exam, BenchCAD, AutomationBench, nhiệm vụ thiết kế nội bộ và nhiệm vụ khoa học dữ liệu. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

Cuối cùng, Astra có thể trở thành một nhân viên AI mà doanh nghiệp thực sự muốn sử dụng lâu dài hay không, còn phải xem chi phí, tốc độ, độ chính xác và số lần can thiệp của con người khi nó hoàn thành các nhiệm vụ thực tế.

Còn về việc Astra có phải là AGI hay không, câu trả lời mà Brockman đưa ra không né tránh. Ông cho rằng, AGI bản thân không có một tiêu chuẩn mà tất cả mọi người đều công nhận, việc Astra có được coi là AGI hay không vẫn có thể tiếp tục thảo luận. Nhưng nếu một hệ thống đã có thể đảm nhận nhiều nhiệm vụ trong trình duyệt, vận hành máy tính, lập trình, toán học, khoa học, pháp lý và các công việc chuyên nghiệp khác, thì việc gọi nó là bước vào thời đại AGI cũng không phải là điều khó hiểu.

Giám đốc điều hành OpenAI, Sam Altman, cũng đã mô tả Astra là mô hình mở ra thế hệ mới trong khởi nghiệp, khám phá khoa học và sáng tạo. “Chào mừng đến với thời đại AGI”: OpenAI phát hành GPT-6 Astra

特约编译金鹿对本文亦有贡献

Join ChainCatcher Official
Telegram Feed: @chaincatcher
X (Twitter): @ChainCatcher_
warnning Cảnh báo rủi ro
app_icon
ChainCatcher Building the Web3 world with innovations.