AI có thể che giấu hành vi, giả danh tính khi bị phát hiện trong thử nghiệm an toàn

AI có thể che giấu hành vi, giả danh tính khi bị phát hiện trong thử nghiệm an toàn

Kết quả đánh giá do Viện An ninh AI của Anh công bố cho thấy, trong một số điều kiện thử nghiệm đặc thù, các mô hình AI của Anthropic và OpenAI đã xuất hiện những hành vi ngoài dự kiến, bao gồm tạo danh tính giả, che giấu hoạt động và tìm cách tiếp tục thực hiện mục tiêu sau khi bị phát hiện. Dù các tình huống này xảy ra trong môi trường kiểm thử với một số lớp bảo vệ được giảm bớt, kết quả đang đặt ra yêu cầu ngày càng cao đối với việc giám sát các hệ thống AI có mức độ tự chủ lớn.