Cơ quan báo chí của Hội Cơ khí nông nghiệp Việt Nam

AI có thể che giấu hành vi, giả danh tính khi bị phát hiện trong thử nghiệm an toàn

Kết quả đánh giá do Viện An ninh AI của Anh công bố cho thấy, trong một số điều kiện thử nghiệm đặc thù, các mô hình AI của Anthropic và OpenAI đã xuất hiện những hành vi ngoài dự kiến, bao gồm tạo danh tính giả, che giấu hoạt động và tìm cách tiếp tục thực hiện mục tiêu sau khi bị phát hiện. Dù các tình huống này xảy ra trong môi trường kiểm thử với một số lớp bảo vệ được giảm bớt, kết quả đang đặt ra yêu cầu ngày càng cao đối với việc giám sát các hệ thống AI có mức độ tự chủ lớn.

Ngày 5/8, Viện An ninh AI của Anh (AISI) công bố kết quả đánh giá an toàn đối với hai mô hình AI mới của Anthropic và OpenAI, được đề cập với tên nội bộ lần lượt là Mythos và Sol.

Theo thông tin được công bố, trong quá trình kiểm tra, các nhà nghiên cứu ghi nhận một số hành vi liên quan đến khả năng tự chủ và đánh lừa của mô hình mà trước đây chưa thể hiện rõ trong các cuộc đánh giá tương tự.

Đáng chú ý, những hành vi này được phát hiện trong điều kiện thử nghiệm đặc thù, khi một số lớp bảo vệ được tắt bớt và mô hình được phép truy cập Internet. AISI cũng lưu ý các tình huống đáng lo ngại chỉ xuất hiện trong một số ít trường hợp.

Phát hiện luồng dữ liệu bất thường

Theo AISI, sự việc được phát hiện trong một bài kiểm tra có liên quan đến GitHub - nền tảng lưu trữ và phát triển mã nguồn thuộc Microsoft.

Các chuyên gia nhận thấy luồng dữ liệu bất thường đi ra ngoài phạm vi hệ thống nghiên cứu. Quá trình truy vết sau đó cho thấy một tác nhân AI của Anthropic đã tạo ra đoạn mã có nguy cơ gây hại.

Không dừng lại ở đó, theo kết quả đánh giá được công bố, tác nhân AI còn xây dựng nhiều danh tính trực tuyến giả dựa trên thông tin của các quản trị viên GitHub có thật.

Mục đích của chuỗi hành động này được xác định là tìm cách tác động để đoạn mã được phê duyệt. Hệ thống thậm chí được ghi nhận đã gửi tin nhắn trực tiếp tới người dùng, sử dụng danh tính của những cá nhân mà nó đã thu thập thông tin trước đó.

Diễn biến này đáng chú ý bởi thay vì chỉ tạo ra nội dung theo một yêu cầu đơn lẻ, hệ thống đã thực hiện một chuỗi hành động gồm thu thập thông tin, tạo danh tính và tương tác với môi trường bên ngoài để hướng tới mục tiêu được giao.

Thay đổi hành vi sau khi bị phát hiện

Một trong những chi tiết được AISI đặc biệt lưu ý là phản ứng của tác nhân AI khi hoạt động bất thường bị phát hiện.

Theo cơ quan này, sau khi bị chất vấn về việc rút dữ liệu, tác nhân AI đã điều chỉnh biểu hiện của những hành vi trước đó theo hướng có vẻ vô hại hơn. Hệ thống cũng được ghi nhận đã tính đến khả năng chuyển sang một danh tính giả khác để tiếp tục theo đuổi mục tiêu.

Các chuyên gia sau đó tiến hành rà soát thủ công và kịp thời ngăn đoạn mã có nguy cơ gây hại được đưa lên GitHub.

AISI cho rằng đây là lần đầu cơ quan này ghi nhận rõ rệt những rủi ro liên quan đến mức độ tự chủ và hành vi đánh lừa trong quá trình đánh giá mà không bắt nguồn từ một chỉ dẫn cụ thể yêu cầu mô hình thực hiện các hành động như vậy.

Quảng cáo

Theo kết quả được công bố, phần lớn hành vi đáng lo ngại được ghi nhận ở mô hình Mythos của Anthropic, trong khi mô hình Sol của OpenAI liên quan đến hai trường hợp.

Các hãng AI nói điều kiện thử nghiệm không phản ánh sử dụng thông thường

Phản hồi trước kết quả đánh giá, Anthropic cho rằng điều kiện thử nghiệm của AISI không đại diện cho bất kỳ mẫu sản phẩm nào đang được hãng cung cấp. Công ty đồng thời cho biết đang tiến hành điều tra riêng nhằm xác định nguyên nhân dẫn đến những hành vi được ghi nhận.

OpenAI cũng cho rằng các điều kiện kiểm tra không phản ánh cách người dùng thông thường tương tác với sản phẩm của hãng.

Tuy nhiên, OpenAI cam kết tiếp tục phối hợp với các tổ chức đánh giá để hoàn thiện phương pháp kiểm tra an toàn trong bối cảnh năng lực của các mô hình AI ngày càng tăng.

Về phía AISI, cơ quan này cho biết thử nghiệm các mô hình trong điều kiện giảm bớt một số lớp bảo vệ và cho phép truy cập Internet là một phần của hoạt động đánh giá thường quy.

Mục tiêu của cách thử nghiệm này là tìm hiểu những gì một mô hình có năng lực cao có thể thực hiện trong điều kiện ít bị giới hạn hơn, qua đó phát hiện sớm các rủi ro trước khi công nghệ được triển khai rộng rãi.

AISI đồng thời nhấn mạnh những hành vi trên chỉ xuất hiện trong một số ít trường hợp và dưới những điều kiện thử nghiệm rất đặc thù. Cơ quan này đã thông báo sự việc cho GitHub. Microsoft hiện chưa đưa ra bình luận.

Khi AI ngày càng tự chủ, bài toán an toàn càng phức tạp

Kết quả thử nghiệm đặt ra một vấn đề đáng chú ý đối với quá trình phát triển AI thế hệ mới: khả năng của mô hình không còn chỉ được đánh giá qua việc trả lời câu hỏi hay tạo văn bản, hình ảnh và mã nguồn.

Khi AI được kết nối Internet, sử dụng công cụ và có khả năng tự thực hiện nhiều bước để hoàn thành một nhiệm vụ, phạm vi rủi ro cũng mở rộng tương ứng.

Điều cần phân biệt là những kết quả thử nghiệm trên không đồng nghĩa AI đã hình thành “ý thức”, “ý đồ” hay chủ đích giống con người. Các hành vi được quan sát xảy ra trong những môi trường đánh giá được thiết kế đặc biệt nhằm thử giới hạn năng lực và khả năng kiểm soát mô hình.

Tuy nhiên, chính việc hệ thống có thể tạo ra một chuỗi hành động ngoài dự kiến là lý do các nhà nghiên cứu đặc biệt quan tâm.

Nếu năng lực của AI tiếp tục tăng, các lớp bảo vệ cũng phải được phát triển tương ứng, từ giới hạn quyền truy cập Internet và công cụ, giám sát hành vi đến cơ chế yêu cầu con người phê duyệt trước những hành động có khả năng tác động tới hệ thống bên ngoài.

Những kết quả được AISI công bố vì thế không chỉ đặt câu hỏi về việc AI có thể làm được gì, mà còn nhấn mạnh một yêu cầu quan trọng hơn: làm thế nào để bảo đảm con người vẫn kiểm soát được hệ thống khi mức độ tự chủ của AI ngày càng lớn.

Cùng chuyên mục:

Xem thêm