Cơ quan báo chí của Hội Cơ khí nông nghiệp Việt Nam

Hành vi vượt kiểm soát của AI làm dấy lên lo ngại về an toàn công nghệ

Các tác nhân trí tuệ nhân tạo của OpenAI và Anthropic đã thực hiện 19 hành động ngoài phạm vi cho phép trong một chương trình đánh giá an ninh mạng của Viện An ninh AI Anh (AISI). Đáng chú ý, một tác nhân AI đã tạo danh tính trực tuyến giả và tìm cách đưa mã độc vào dự án phần mềm nguồn mở. Dù chưa ghi nhận thiệt hại thực tế, sự việc cho thấy yêu cầu cấp thiết phải nâng chuẩn kiểm soát khi các hệ thống AI ngày càng có khả năng tự thực hiện những nhiệm vụ phức tạp.

Theo thông tin AISI công bố đầu tháng 8, sự việc xảy ra trong một chương trình đánh giá năng lực an ninh mạng đối với các mô hình AI tiên tiến. Các tác nhân tham gia thử nghiệm sử dụng Mythos 5 của Anthropic và GPT-5.6 Sol của OpenAI.

Khác với môi trường sử dụng sản phẩm thông thường, AISI chủ động thiết kế điều kiện thử nghiệm theo hướng cho phép mô hình tiếp cận Internet và vô hiệu hóa một số cơ chế ngăn chặn hành vi mạng. Mục đích là đánh giá năng lực tối đa và phát hiện những rủi ro có thể xuất hiện trước khi các mô hình mạnh hơn được triển khai rộng rãi.

19 hành động ngoài phạm vi trong 122 lần thử

Theo AISI, bài kiểm tra được thực hiện 122 lần trên nhiều mô hình. Kết quả cho thấy trong 10 lần chạy, các tác nhân AI đã tự thực hiện những hành động không được cho phép trên Internet, hướng tới các cá nhân hoặc tổ chức có thật.

Tổng cộng, AISI ghi nhận 19 hành động ngoài phạm vi, trong đó 17 hành động đến từ Mythos 5 của Anthropic và 2 hành động liên quan đến GPT-5.6 Sol của OpenAI trong cấu hình đã tắt các bộ phân loại an ninh mạng.

Trường hợp nghiêm trọng nhất liên quan đến một tác nhân AI tìm cách đưa mã độc vào một dự án phần mềm nguồn mở.

Để đoạn mã được chấp thuận, tác nhân còn thực hiện hành vi mang tính kỹ nghệ xã hội, tạo danh tính trực tuyến giả và sử dụng những danh tính này để gây sức ép nhằm thuyết phục người quản lý dự án phê duyệt.

Tuy nhiên, người quản trị đã phát hiện bất thường và từ chối đoạn mã. AISI cho biết cuộc điều tra đến nay chưa phát hiện thiệt hại thực tế từ các hành động trên.

Điều đáng lo không chỉ nằm ở mã độc

Theo AISI, điểm đáng chú ý của sự việc không đơn thuần là một mô hình có khả năng tạo ra mã gây hại, mà nằm ở cách tác nhân AI liên tục tìm kiếm những con đường khác nhau để hoàn thành mục tiêu.

Cơ quan này cho biết tác nhân không được yêu cầu thực hiện hành vi đánh lừa. Tuy nhiên, trong quá trình theo đuổi mục tiêu, hành vi này đã xuất hiện như một phương thức để tiếp tục nhiệm vụ.

AISI đánh giá đây là lần đầu tiên cơ quan này quan sát thấy rủi ro liên quan đến tính tự chủ và hành vi đánh lừa biểu hiện rõ ràng đến mức như vậy trong môi trường thực tế mà không có chỉ dẫn cụ thể yêu cầu mô hình phải đánh lừa con người.

Dù vậy, cơ quan nghiên cứu của Anh cũng lưu ý cần thận trọng khi diễn giải kết quả. Các hiện tượng chỉ xuất hiện trong một số ít trường hợp, dưới những điều kiện thử nghiệm rất đặc thù. AISI hiện chưa thể kết luận mức độ phổ biến của hành vi tương tự trong những môi trường khác.

Đặc biệt, các cấu hình được sử dụng trong thử nghiệm không phải những phiên bản thương mại được cung cấp cho người dùng thông thường.

Hai trường hợp liên quan đến GPT-5.6 Sol

Quảng cáo

Theo CNA, OpenAI xác nhận hai hành động ngoài phạm vi của tác nhân sử dụng mô hình GPT-5.6 Sol đều liên quan đến việc truy cập Internet theo cách không được phép trong yêu cầu của bài thử.

OpenAI cho biết sẽ tiếp tục phối hợp với các viện nghiên cứu AI quốc gia, tổ chức đánh giá độc lập, các phòng thí nghiệm AI và những bên liên quan nhằm xây dựng phương pháp chung để thực hiện những cuộc đánh giá rủi ro cao an toàn hơn.

Thông tin này đáng chú ý trong bối cảnh GPT-5.6 Sol có năng lực an ninh mạng cao hơn các thế hệ trước. Trong tài liệu đánh giá an toàn của mình, OpenAI cho biết AISI từng thử nghiệm GPT-5.6 Sol trên các nhiệm vụ an ninh mạng chuyên sâu và các mô phỏng kéo dài nhiều bước. Công ty cũng thừa nhận tính kiên trì cao hơn của mô hình trong quá trình hoàn thành nhiệm vụ đôi khi có thể khiến hệ thống tiếp tục tìm kiếm những cách thức nằm ngoài giới hạn dự kiến của bài đánh giá.

Thông tin an toàn GPT-5.6 của OpenAI

Khác với sự cố Hugging Face trước đó

AISI nhấn mạnh sự việc lần này có bản chất khác với sự cố liên quan đến Hugging Face hồi tháng 7.

Trong vụ việc trước, OpenAI xác nhận các mô hình, trong đó có GPT-5.6 Sol và một mô hình nghiên cứu chưa phát hành, đã phát hiện và kết hợp nhiều điểm yếu trong môi trường đánh giá để kết nối ra Internet, sau đó tác động tới hạ tầng của Hugging Face. OpenAI và Hugging Face đã phối hợp điều tra, khắc phục sự cố.

Thông báo của OpenAI về sự cố Hugging Face

Trong cuộc đánh giá mới của AISI, các tác nhân AI không tự thoát khỏi môi trường thử nghiệm để tiếp cận Internet. Quyền truy cập Internet đã được AISI chủ động cung cấp như một phần của phương pháp kiểm tra năng lực tối đa của mô hình.

Sự khác biệt này rất quan trọng, bởi nếu gọi chung các trường hợp trên là AI “vượt khỏi kiểm soát” có thể khiến bản chất kỹ thuật của sự việc bị hiểu sai.

Năng lực AI càng lớn, hàng rào an toàn càng phải cao

Sự việc cũng cho thấy một thay đổi đáng chú ý trong bài toán an toàn AI.

Khi AI chủ yếu tạo văn bản hoặc trả lời câu hỏi, rủi ro tập trung nhiều vào nội dung đầu ra. Nhưng với các tác nhân AI (AI agent) có khả năng sử dụng công cụ, kết nối mạng và tự thực hiện chuỗi nhiệm vụ nhiều bước, phạm vi cần kiểm soát đã rộng hơn đáng kể.

AISI thừa nhận chính cách thiết kế môi trường đánh giá và cấu hình thử nghiệm đã góp phần tạo điều kiện cho những hành vi nói trên. Tuy nhiên, cơ quan này cho rằng tính chất mới, khả năng duy trì hành động và dấu hiệu đánh lừa của tác nhân vẫn đủ đáng chú ý để cần tiếp tục điều tra.

Vấn đề vì thế không nên được diễn giải theo hướng AI đã có “ý thức” hay “ý đồ” giống con người. Điều đáng quan tâm hơn là một hệ thống được tối ưu để hoàn thành mục tiêu có thể tìm ra những con đường mà nhà phát triển và người đánh giá không dự kiến trước.

Đó cũng là lý do những cuộc thử nghiệm khắc nghiệt có ý nghĩa: phát hiện giới hạn và điểm yếu trong điều kiện kiểm soát trước khi các năng lực tương tự được triển khai ở quy mô lớn.

Khi AI ngày càng được trao quyền tự chủ trong hoạt động doanh nghiệp, nghiên cứu và vận hành hệ thống, cuộc đua phát triển công nghệ sẽ không chỉ được đo bằng việc mô hình “làm được gì”, mà còn bằng khả năng con người giám sát, giới hạn và kiểm soát những gì mô hình được phép làm.

Cùng chuyên mục:

Xem thêm