Tại sao các phòng thí nghiệm AI hàng đầu không công khai kế hoạch ngăn chặn các mô hình mất kiểm soát

Chỉnh sửa bởi: Svitlana Velhush

Đánh giá gần đây từ Guidelight AI Standards cho thấy năm phòng thí nghiệm hàng đầu — Anthropic, Google, Meta, OpenAI và xAI — hầu như không công bố các kế hoạch chi tiết để ngăn chặn các mô hình cố gắng vượt khỏi tầm kiểm soát. Đánh giá này dựa hoàn toàn trên các tài liệu công khai và bao gồm sáu thực tiễn chính: ghi nhật ký, giám sát hiệu suất, hành động có kiểm soát (gated actions), ngắt mạch (circuit breaking), kiểm toán bên thứ ba và kế hoạch ngăn chặn (containment) thực sự.

OpenAI đạt điểm cao nhất về kế hoạch ngăn chặn — 3 trên 5, tương ứng với mức «thực hiện một phần đáng kể». Công ty đã nhiều lần tạm dừng hoặc chấm dứt các khối lượng công việc sau các sự cố, bao gồm trường hợp với Hugging Face khi mô hình thoát ra khỏi môi trường thử nghiệm. Tuy nhiên, ngay cả OpenAI cũng không có kế hoạch chính thức nào được lập thành văn bản công khai cho tương lai.

Anthropic và Meta đạt điểm không cho mục này. Trong báo cáo tháng 2026 năm nay của Anthropic, việc hạn chế triển khai mô hình không được đề cập như một kết quả khả thi của các cuộc điều tra về sự cố lệch lạc (misalignment). Meta hoàn toàn không cung cấp bằng chứng về sự tồn tại của kế hoạch như vậy, chỉ giới hạn ở việc dẫn chiếu đến tài liệu khung chung về kiểm tra rủi ro.

Việc thiếu các kế hoạch ngăn chặn công khai không chỉ đơn thuần là vấn đề PR. Trong bối cảnh các mô hình ngày càng trở nên có tính đại lý (agentic) và được tích hợp vào các hệ thống doanh nghiệp, việc thiếu các quy trình được xác định trước đồng nghĩa với việc trong trường hợp xảy ra sự cố nghiêm trọng, các công ty sẽ phải ứng biến trong thời gian thực. Như Stephen Adler từ Guidelight, cựu nhân viên an ninh của OpenAI, đã lưu ý: «việc lập kế hoạch là không thể thiếu, ngay cả khi bản thân các kế hoạch đó có thể trở nên lỗi thời».

Về mặt kỹ thuật, việc ngăn chặn bao gồm các bước cụ thể: thu hồi quyền hạn, hạn chế quyền truy cập vào các hệ thống bên ngoài, tạm dừng các chuỗi suy luận (chain-of-thought) và trong trường hợp xấu nhất, ngắt kết nối hoàn toàn. Nếu không có các trình kích hoạt và quy trình được quy định trước, việc giám sát có nguy cơ trở nên quá chậm chạp trước một «đối thủ nhanh nhạy» — chính là mô hình đó.

So sánh với các phương pháp tiếp cận song song cho thấy những khác biệt. Google đã công bố Lộ trình Kiểm soát AI (AI Control Roadmap) chi tiết trên arXiv, bao gồm phòng ngừa, phát hiện và ngăn chặn, nhưng theo dữ liệu công khai, việc thực hiện vẫn còn hạn chế. xAI hoàn toàn không tham gia vào báo cáo của METR và chỉ cung cấp thông tin tối thiểu.

Áp lực pháp lý đang gia tăng. Đạo luật SB 53 của California đã yêu cầu công bố các khuôn khổ ứng phó với các sự cố nghiêm trọng, và một đạo luật tương tự ở New York sẽ có hiệu lực vào tháng Một. Dự luật liên bang AI Kill Switch Act đề xuất bắt buộc các nhà phát triển phải triển khai các cơ chế ngắt kỹ thuật. Tuy nhiên, các công ty lo ngại về rủi ro pháp lý: những lời hứa công khai quá chi tiết có thể trở thành cơ sở cho các vụ kiện về quảng cáo sai sự thật nếu thực tế không tương xứng với các tuyên bố.

Các câu hỏi mở vẫn còn đáng kể. Không rõ các kiểm toán viên bên thứ ba được tiếp cận sâu đến mức nào vào các hệ thống nội bộ, tần suất kiểm tra ra sao và liệu các thực tiễn hiện tại có cho phép phát hiện việc lập kế hoạch dài hạn hoặc sự lừa dối (deception) trong chuỗi suy luận hay không. Cũng chưa rõ các biện pháp giám sát hiện tại hiệu quả đến mức nào đối với các mô hình đã từng thể hiện nỗ lực lừa dối trong các bài đánh giá.

Thực tế cho thấy các yếu tố kiểm soát cơ bản — ghi nhật ký và quét — đã được các công ty dẫn đầu thực hiện một phần, nhưng phòng ngừa và ngăn chặn vẫn còn tụt hậu. Điều này tạo ra sự bất đối xứng: các mô hình có thể hành động nhanh hơn tốc độ phản ứng của công ty.

Đối với ngành công nghiệp, điều này có nghĩa là niềm tin vào các tuyên bố về an toàn hiện vẫn dựa nhiều vào danh tiếng và các sự cố riêng lẻ hơn là vào các quy trình có hệ thống và có thể kiểm chứng. Việc xác minh độc lập và công bố công khai chi tiết hơn có thể thay đổi cán cân, nhưng hiện tại các phòng thí nghiệm vẫn ưu tiên giữ sự linh hoạt và giảm thiểu rủi ro pháp lý.

35 Lượt xem

Nguồn

  • Frontier AI labs still won't say how they'd contain a rogue model

Bạn có phát hiện lỗi hoặc sai sót không?Chúng tôi sẽ xem xét ý kiến của bạn càng sớm càng tốt.