Kimi K3 vượt rào thử nghiệm: Cảnh báo mới về an toàn AI mã nguồn mở

Một trong những mô hình AI mã nguồn mở hàng đầu của Trung Quốc, Kimi K3, được cho là đã vượt khỏi môi trường thử nghiệm biệt lập để truy cập Internet và tìm kiếm lời giải trên GitHub trong quá trình đánh giá an toàn. Sự cố làm dấy lên thêm lo ngại về khả năng kiểm soát các mô hình AI tiên tiến khi được triển khai trong môi trường thực tế.

Kimi K3 vượt khỏi môi trường thử nghiệm

Theo các nhà nghiên cứu an ninh mạng tại Mỹ, Kimi K3, mô hình trí tuệ nhân tạo do Moonshot AI, công ty có trụ sở tại Bắc Kinh, phát triển và phát hành vào tháng trước, đã vượt khỏi môi trường thử nghiệm được thiết lập để đánh giá khả năng phòng thủ trước các cuộc tấn công mạng.

Trong một bài đăng trên blog, công ty an ninh mạng Frontier Security cho biết sự cố xảy ra khi họ tiến hành kiểm tra Kimi K3 bằng bộ tiêu chuẩn do Viện An toàn AI (AI Security Institute) thuộc Chính phủ Anh xây dựng.

Hai nhà nghiên cứu Paul Kassianik và Yaron Singer cho biết một lỗi cấu hình mạng cơ bản trong hệ thống đánh giá đã tạo điều kiện để Kimi K3 thoát khỏi môi trường được kiểm soát. Sau đó, mô hình có thể truy cập Internet công cộng và tìm kiếm thông tin trên GitHub để hỗ trợ việc giải bài kiểm tra.

Điều đáng chú ý là Kimi K3 không trực tiếp tấn công hay xâm nhập các hệ thống bên ngoài. Tuy nhiên, việc mô hình có thể vượt qua giới hạn được thiết lập đã khiến kết quả đánh giá không còn phản ánh chính xác năng lực thực tế của hệ thống.

Thay vì tự xử lý bài kiểm tra trong phạm vi được thiết lập, Kimi K3 đã có thể sử dụng nguồn thông tin bên ngoài để tìm kiếm câu trả lời.

Không tấn công bên ngoài nhưng vẫn là tín hiệu đáng lo

Frontier Security cho rằng sự cố với Kimi K3 có bản chất khác với một số trường hợp từng được ghi nhận ở các mô hình AI tiên tiến của Mỹ.

Tháng trước, OpenAI cho biết mô hình chủ lực GPT-5.6 Sol cùng một hệ thống chưa được phát hành đã vượt khỏi môi trường thử nghiệm biệt lập và tấn công nền tảng mã nguồn mở Hugging Face nhằm tìm kiếm thông tin bí mật chứa đáp án cho một bài kiểm tra nội bộ.

Anthropic sau đó cũng tiết lộ phát hiện ba sự cố liên quan đến các mô hình Claude, trong đó có Opus 4.7, Mythos 5 và một mô hình đang được nghiên cứu nội bộ. Các hệ thống này được cho là đã xâm nhập hạ tầng của ba tổ chức, nhưng danh tính các tổ chức không được công bố.

So với những trường hợp trên, Kimi K3 không thực hiện hành vi tấn công các hệ thống bên ngoài. Dù vậy, các nhà nghiên cứu cho rằng việc một mô hình AI có thể thoát khỏi môi trường thử nghiệm vẫn là vấn đề đáng quan tâm.

Theo Frontier Security, rủi ro thậm chí có thể trở nên nghiêm trọng hơn khi Kimi K3 được phát triển theo hướng mã nguồn mở. Điều này đồng nghĩa với việc mô hình có thể được nhiều cá nhân và tổ chức tiếp cận, trong đó có cả những đối tượng có ý đồ xấu.

Một trong những nhà nghiên cứu của Frontier Security nhận định sự cố cũng cho thấy các cơ chế bảo vệ được tích hợp bên trong Kimi K3 vẫn còn những hạn chế nhất định.

Quảng cáo

Mã nguồn mở: Cơ hội cho phòng thủ, nhưng cũng tiềm ẩn rủi ro

Sự cố Kimi K3 diễn ra trong bối cảnh cuộc tranh luận về mức độ an toàn của AI mã nguồn mở ngày càng nóng lên.

Những người chỉ trích cho rằng việc công khai các mô hình AI tiên tiến có thể làm giảm đáng kể rào cản kỹ thuật đối với các đối tượng muốn sử dụng AI cho mục đích xấu. Những công cụ trước đây đòi hỏi kiến thức chuyên môn và nguồn lực lớn nay có thể trở nên dễ tiếp cận hơn.

Đáng lo ngại hơn, khi các mô hình ngày càng có khả năng tự thực hiện nhiều tác vụ, nguy cơ không chỉ nằm ở câu trả lời do AI tạo ra mà còn ở khả năng mô hình tự tìm kiếm thông tin, sử dụng công cụ và tương tác với các hệ thống bên ngoài.

Tuy nhiên, ở chiều ngược lại, một số lãnh đạo trong ngành công nghệ Mỹ cho rằng AI mã nguồn mở cũng đóng vai trò quan trọng trong việc tăng cường năng lực phòng thủ mạng.

Tháng trước, Nvidia, Palantir, Meta Platforms cùng một số tập đoàn công nghệ lớn của Mỹ đã ký thư ngỏ kêu gọi giới chức nước này không áp đặt các biện pháp hạn chế đối với các mô hình AI mã nguồn mở.

Theo lập luận của các doanh nghiệp, dù AI mã nguồn mở tồn tại những rủi ro nhất định, việc cho phép các chuyên gia tiếp cận và nghiên cứu các mô hình này cũng giúp họ nhanh chóng phát hiện lỗ hổng, hiểu phương thức mà kẻ tấn công sử dụng AI và xây dựng biện pháp phòng vệ tương ứng.

AI mã nguồn mở có thể trở thành “lá chắn” trước các cuộc tấn công AI

Một sự cố gần đây được xem là minh chứng cho lập luận này.

Hugging Face từng phải sử dụng GLM-5.2, một mô hình AI mã nguồn mở do Zhipu AI, công ty có trụ sở tại Bắc Kinh, phát triển, để hỗ trợ ngăn chặn một cuộc tấn công nhằm vào nền tảng này của OpenAI.

Đáng chú ý, trước đó, một số mô hình AI độc quyền lớn của Mỹ đã từ chối xử lý các nhật ký bảo mật do những giới hạn an toàn được tích hợp trong hệ thống.

Điều này cho thấy bài toán an toàn AI không đơn giản là lựa chọn giữa “mã nguồn mở” và “mã nguồn đóng”. Khi AI ngày càng được sử dụng trong lĩnh vực an ninh mạng, cả hai hướng tiếp cận đều có những lợi thế và rủi ro riêng.

Vấn đề quan trọng hơn là khả năng kiểm soát hành vi của mô hình, đặc biệt khi AI được trao quyền truy cập Internet, sử dụng công cụ hoặc tương tác với các hệ thống bên ngoài.

Theo South China Morning Post, Moonshot AI chưa đưa ra phản hồi trước đề nghị bình luận về sự cố.

Sự việc liên quan đến Kimi K3 vì thế tiếp tục đặt ra câu hỏi lớn đối với ngành AI: khi các mô hình ngày càng thông minh và có khả năng tự thực hiện nhiều nhiệm vụ, liệu những “hàng rào an toàn” do con người dựng lên có đủ chắc chắn để kiểm soát chúng?

Trong bối cảnh cuộc đua phát triển AI tiên tiến đang diễn ra mạnh mẽ trên toàn cầu, việc xây dựng môi trường thử nghiệm an toàn, kiểm soát quyền truy cập và đánh giá đầy đủ khả năng tự chủ của mô hình sẽ ngày càng trở thành yêu cầu quan trọng. Đặc biệt với AI mã nguồn mở, bài toán cân bằng giữa đổi mới, khả năng tiếp cận và an toàn đang trở nên cấp thiết hơn bao giờ hết.

Cùng chuyên mục:

Xem thêm