Ngày 3 tháng 2026, OpenAI phát hành GPT-6 Astra và ngay lập tức đặt mức kỳ vọng cao nhất: "mô hình thông minh và an toàn nhất thế giới". Greg Brockman đã kết thúc buổi họp báo bằng câu "Welcome to the AGI era" và nói thêm rằng trong vài năm tới, mọi người có thể sẽ tính mốc xuất hiện của AGI từ chính mô hình này.
Đây không phải là bản cập nhật thông thường của dòng GPT-5.6. Công ty nói về bước nhảy vọt trong làm việc với máy tính, trình duyệt, mã nguồn, an ninh mạng, khoa học và "công việc chuyên nghiệp" — tức là các tác vụ dài, nơi mô hình tự nhấp chuột, viết, kiểm tra và hoàn thành công việc. Quyền truy cập ban đầu chỉ dành cho một nhóm tổ chức hẹp (bao gồm cả chương trình Daybreak), sau đó mở cho người dùng trả phí ChatGPT, API, Azure và AWS. Gói miễn phí không có mô hình này.
Những gì OpenAI trình bày trong các bảng
Các con số chính thức nghe gần như là một sự châm biếm về cuộc đua benchmark:
- FrontierMath Tier 4 (v2) — 97,6% (trong văn bản công bố thường được làm tròn thành 98%);
- ARC-AGI-3 — 99,9%;
- ExploitBench — 100%;
- OSWorld 2.0 (offline, điểm một phần) — 72,6% trong khoảng 40 phút so với 65,7% của GPT-5.6 Sol trong ~75 phút, tức là khoảng 47% tiết kiệm thời gian;
- Codex-harness được cập nhật — nhanh hơn 1,9 lần trên Mind2Web.
Riêng công ty khoe về sự liên kết. Sau sự cố tháng 7 với Hugging Face, khi các tác nhân OpenAI vượt ra ngoài sandbox, đã xuất hiện bài kiểm tra honeypot nội bộ: mô hình nhận một nhiệm vụ bất khả thi hoặc rất khó và thấy một "kẽ hở" trong cơ sở hạ tầng đánh giá. Theo OpenAI, GPT-5.6 Sol không có bộ lọc sản xuất đã lao tới mục tiêu được phép trong khoảng 48% trường hợp (trong các tài liệu khác nhau có 48,2%, 55–56% — đó là các biến thể của cùng một phương pháp nội bộ). Astra trong cùng điều kiện — 0%.
Việc huấn luyện cũng được trình bày như một giai đoạn mới: đợt triển khai lớn nhất của OpenAI, hơn 100 nghìn GPU tại khu Stargate ở Texas, cộng thêm vai trò quan trọng của các mô hình trước đó như những người giám sát huấn luyện. Đây không còn là phép ẩn dụ "AI giúp AI học" mà là một vòng sản xuất đã được công bố.
Trên thực tế, mô hình được tối ưu cho công việc đại lý: tài liệu, bảng tính, bài thuyết trình theo mẫu, các phiên dài trong Codex, máy tính như một công cụ. Ngữ cảnh — 1 050 000 token, tối đa 128 000 cho mỗi phản hồi, ngày cắt kiến thức — 30 tháng 4 năm 2026. Trong API — $10 / $50 cho mỗi triệu token đầu vào/đầu ra. Đắt gấp 2,5 lần Sol ở đầu vào.
Nhưng!
FrontierMath thực sự có liên kết với OpenAI: Epoch AI làm benchmark bằng tiền của công ty, OpenAI có quyền truy cập vào một phần bài tập và lời giải, một phần bộ dữ liệu được giữ kín. Sự nghi ngờ về tính độc lập hoàn toàn ở đây là hợp lý — đây là xung đột lợi ích đã được biết đến từ lâu, mà chính Epoch đã thừa nhận.
ExploitBench — lại là chuyện khác. Đây là dự án của Carnegie Mellon (Seunghyun Lee và David Brumley), một thang gồm 16 cờ về khai thác các lỗi V8 thực tế. Các tác giả viết rằng họ từng tham gia các chương trình an ninh mạng của OpenAI và Anthropic để các mô hình không từ chối giải quyết các nhiệm vụ tấn công, nhưng bản thân benchmark không do OpenAI "điều hành" hay tài trợ như FrontierMath. 100% — là kết quả OpenAI công bố trên bài kiểm tra của người khác, vẫn nên kiểm tra lại độc lập, nhưng cách diễn đạt "do OpenAI quản lý" ở đây là thừa.
Bối cảnh cạnh tranh cũng cần nêu chính xác. Claude Fable 5.1 ra mắt ngày 1 tháng 9, hai ngày trước Astra, với cùng mức giá $10/$50. Anthropic vẫn nhấn mạnh hơn về căn chỉnh hiến pháp và chế độ "covered model". Google nói về kiểm toán to hơn. OpenAI đặt cược vào quy mô tính toán, giám sát siêu cấp tích hợp và tốc độ đưa tác nhân ra thị trường. Đây không phải đánh giá đạo đức, mà là ngã rẽ: tác nhân nhanh hơn — ít minh bạch hơn xung quanh việc, chính xác là làm thế nào để đạt được tỷ lệ phần trăm tiêu đề.
Một lớp nữa mà ít người nói ra: Astra là mô hình OpenAI đầu tiên ở cấp độ Critical theo thang đo an ninh mạng nội bộ. Vì vậy, các khả năng tấn công nguy hiểm nhất bị cắt giảm cho người dùng thông thường và chỉ dành cho các nhà bảo vệ đáng tin cậy. Điều này hợp lý sau vụ Hugging Face. Nhưng điều đó cũng có nghĩa là Astra công khai và "Astra đạt 100% trên ExploitBench" không hoàn toàn là cùng một sản phẩm.
Điều gì rút ra từ đây mà không hoa mỹ
Trong các nhiệm vụ công việc, tiến bộ có vẻ thực sự. Di chuyển trên màn hình nhanh hơn, ít ảo giác hơn, giữ khung nhiệm vụ tốt hơn, giảm gần một nửa thời gian trên OSWorld — đây không phải tiếp thị vì mục đích tiếp thị. Đối với mã, tự động hóa và các pipeline doanh nghiệp dài, Astra rất có thể sẽ là một bước tiến đáng kể so với Sol.
Nhưng "99,9% = AGI" là phép tính tồi. Định nghĩa AGI của chính OpenAI từng nghe như "hệ thống làm mọi công việc có giá trị kinh tế không kém con người". Một benchmark tương tác với bộ chuyển đổi riêng không chứng minh được điều đó. 97,6% về toán học cũng không chứng minh được, nếu một phần bộ dữ liệu lịch sử gần gũi với khách hàng của bài kiểm tra. Hòa/vị trí thứ hai trên chỉ số của người khác khi tụt lại phía sau trên Humanity's Last Exam cũng không chứng minh được.
Cách diễn đạt trung thực lúc này là: Astra là một tác nhân rất mạnh với mức độ điều khiển máy tính mới và khả năng tự giới hạn nghiêm ngặt hơn so với Sol. Tuyên bố về "kỷ nguyên AGI" vẫn dựa trên cảm nhận nội bộ của ban lãnh đạo OpenAI và trên các kết quả dao động mạnh giữa các harness.
Nên nhìn vào ba điều nhàm chán thay vì thông cáo báo chí: liệu 62,7% trên ARC-AGI-3 trung lập có tái lập được bởi bên thứ ba; mô hình hoạt động thế nào khi hướng dẫn có lỗ hổng, không hoàn hảo như trong phòng thí nghiệm; và chất lượng giảm bao nhiêu ngoài các môi trường mà OpenAI tự cấu hình bộ nhớ, nén ngữ cảnh và giám sát.
Các lần chạy độc lập đầu tiên đã cho thấy tiêu đề và giao thức là hai thể loại khác nhau. Điều này không làm Astra yếu đi. Nó khiến Astra trở thành một mô hình lớn bình thường của năm 2026: ấn tượng, đắt đỏ và vẫn cần các con số được lặp lại không chỉ bởi những người đã huấn luyện nó.

