Các nghiên cứu gần đây cho thấy một số năng lực được xem là cần thiết cho những kịch bản mất kiểm soát đang dần xuất hiện. Tuy nhiên, khoa học hiện chưa có bằng chứng cho thấy AI đã tiến gần đến khả năng tự mình gây ra một thảm họa tuyệt chủng.
Để AI trở thành mối đe dọa tồn vong, điều gì phải xảy ra?
Kịch bản AI tiêu diệt loài người thường được hình dung khá đơn giản: con người tạo ra một hệ thống thông minh hơn mình, hệ thống trở nên khó kiểm soát và cuối cùng quay sang chống lại con người.
Trên thực tế, để kịch bản này xảy ra, AI phải vượt qua nhiều rào cản.
Một hệ thống có khả năng trả lời câu hỏi, lập trình hoặc phân tích dữ liệu chưa đủ để trở thành mối đe dọa tồn vong. Hệ thống đó cần có khả năng tự lập kế hoạch trong thời gian dài, sử dụng các công cụ bên ngoài, tiếp cận những hệ thống quan trọng, thực hiện hành động trong thế giới thực và duy trì hoạt động mà không hoàn toàn phụ thuộc vào con người.
Quan trọng hơn, hệ thống phải có một mục tiêu xung đột nghiêm trọng với lợi ích của con người, đồng thời có khả năng tránh bị phát hiện hoặc ngăn chặn.
Nghiên cứu của RAND Corporation về rủi ro tuyệt chủng từ AI cho rằng một kịch bản như vậy là cực kỳ khó xảy ra nhưng không thể hoàn toàn loại trừ. Các nhà nghiên cứu xem xét những con đường mà AI có thể tác động tới các công nghệ có khả năng gây hậu quả ở quy mô lớn, trong đó có vũ khí hạt nhân, mầm bệnh và công nghệ tác động đến khí hậu.
Điểm quan trọng ở đây là AI không chỉ cần “thông minh”. Năng lực đó còn phải được chuyển hóa thành hành động có tác động thực tế.
Một số năng lực đáng chú ý đã bắt đầu xuất hiện
Điều khiến cuộc tranh luận về “AI tận thế” không còn hoàn toàn thuộc về khoa học viễn tưởng là một số năng lực từng được coi là điều kiện cần cho những kịch bản này đang được quan sát trong các thử nghiệm.
Các mô hình AI tiên tiến hiện có thể lập kế hoạch cho những nhiệm vụ gồm nhiều bước, sử dụng công cụ, viết và thực thi mã, tương tác với máy tính, đồng thời điều chỉnh cách thực hiện khi gặp thất bại.
Một số nghiên cứu về an toàn AI cũng ghi nhận những tình huống trong đó mô hình tìm cách vượt qua cơ chế kiểm soát hoặc che giấu hành vi của mình.
Tuy nhiên, những kết quả này cần được đặt trong đúng bối cảnh. Phần lớn được quan sát trong các môi trường thử nghiệm được thiết kế đặc biệt để kiểm tra những hành vi như vậy.
Điều đó rất khác với việc một AI trong thế giới thực tự quyết định rằng nó cần thoát khỏi sự kiểm soát của con người.
Một hệ thống thực hiện hành động đáng lo ngại trong một bài kiểm tra không đồng nghĩa với việc hệ thống đó đã có một mục tiêu độc lập. Càng không thể từ đó kết luận rằng nó có khả năng thực hiện toàn bộ chuỗi hành động cần thiết để gây ra một thảm họa trên quy mô toàn cầu.
Khoảng cách giữa “AI thông minh” và “AI tận thế” vẫn còn lớn
Những người hoài nghi về các kịch bản AI tận thế cho rằng các kịch bản này thường đòi hỏi một chuỗi giả định nối tiếp nhau.
AI phải đủ thông minh để lập kế hoạch; có quyền truy cập vào những công cụ cần thiết; thực hiện thành công nhiều bước liên tiếp; tránh được các cơ chế giám sát và tiếp tục hoạt động ngay cả khi con người tìm cách can thiệp.
Chỉ cần một mắt xích trong chuỗi này không xảy ra, toàn bộ kịch bản có thể thất bại.
Đây cũng là lý do các nhà nghiên cứu cảnh báo không nên đánh đồng những tiến bộ hiện tại của AI với bằng chứng cho thấy một “siêu AI” sắp xuất hiện.
Một mô hình có thể giải toán tốt hơn con người, viết phần mềm tốt hơn hoặc hoàn thành một nhiệm vụ kéo dài nhiều giờ không đồng nghĩa với việc nó có thể tự vận hành trong thế giới thực mà không cần con người.
Ngay cả những hệ thống được gọi là “tác nhân AI” – tức các hệ thống có khả năng tự thực hiện một chuỗi hành động thay vì chỉ trả lời một câu hỏi – vẫn hoạt động trong những giới hạn do con người và hạ tầng công nghệ đặt ra.
Rủi ro không nhất thiết phải đợi đến khi xuất hiện “siêu AI”
Một nghịch lý trong cuộc tranh luận về AI là những rủi ro thực tế có thể xuất hiện từ lâu trước khi xảy ra kịch bản tuyệt chủng.
AI ngày càng được đưa vào những lĩnh vực mà sai sót có thể gây hậu quả lớn. Trong y tế, tài chính, an ninh mạng, cơ sở hạ tầng hay các hệ thống ra quyết định quan trọng, một mô hình không cần có ý định “chống lại con người” vẫn có thể gây thiệt hại.
Chỉ cần hệ thống đưa ra một kết quả sai, hiểu sai bối cảnh hoặc được trao quyền hành động lớn hơn khả năng kiểm soát của con người, rủi ro đã có thể xuất hiện.
Đây là lý do việc tập trung quá nhiều vào câu hỏi “AI có tiêu diệt loài người hay không?” có thể khiến những vấn đề đang tồn tại ngay trước mắt bị xem nhẹ.
AI đáng tin cậy đến đâu? Con người có thể giám sát hệ thống hiệu quả đến mức nào? Ai chịu trách nhiệm khi AI mắc sai lầm?
Những câu hỏi này có tính thực tế và cấp thiết hơn trong quá trình AI ngày càng được ứng dụng rộng rãi.
Nói cách khác, không cần một AI có ý thức hay “ý chí riêng” mới có thể tạo ra rủi ro nghiêm trọng.
Vì sao các công ty AI cũng cảnh báo về rủi ro?
Những cảnh báo về rủi ro AI không chỉ đến từ các nhà nghiên cứu bên ngoài ngành công nghệ. Các công ty đang phát triển những mô hình AI tiên tiến cũng ngày càng đầu tư vào nghiên cứu an toàn và cảnh báo về những rủi ro có thể xuất hiện khi năng lực của hệ thống tăng lên.
Một phần nguyên nhân nằm ở tốc độ phát triển của AI.
Khi mô hình có thể thực hiện nhiều nhiệm vụ hơn, lập kế hoạch trong thời gian dài hơn và sử dụng nhiều công cụ hơn, việc đánh giá đầy đủ mọi hành vi có thể xảy ra cũng trở nên khó khăn hơn.
Vấn đề vì thế không chỉ là làm cho AI mạnh hơn mà còn phải hiểu AI sẽ làm gì khi được trao nhiều quyền tự chủ hơn.
Đây là một trong những nội dung trọng tâm của bài toán căn chỉnh mục tiêu: làm thế nào để bảo đảm hành vi của AI phù hợp với mục tiêu và giá trị mà con người thực sự mong muốn, thay vì chỉ đáp ứng một bộ chỉ số hoặc mệnh lệnh được lập trình sẵn.
AI có thực sự có thể xóa sổ loài người?
Khoa học hiện chưa có câu trả lời chắc chắn.
Một số nhà nghiên cứu cho rằng nguy cơ tồn vong từ AI là rủi ro nghiêm trọng cần được chuẩn bị từ sớm. Trong khi đó, những người khác cho rằng các kịch bản tận thế hiện nay dựa trên quá nhiều giả định chưa được kiểm chứng và khoảng cách giữa năng lực của AI hiện tại với một hệ thống có thể tự mình gây ra tuyệt chủng vẫn còn rất lớn.
Hai quan điểm này gặp nhau ở một điểm quan trọng: không thể suy luận trực tiếp từ việc AI ngày càng thông minh đến kết luận rằng AI chắc chắn sẽ trở thành mối đe dọa đối với nhân loại.
Ngược lại, việc chưa có bằng chứng về một “AI tận thế” cũng không có nghĩa mọi rủi ro đều có thể bỏ qua.
Điều đáng chú ý nằm ở khoảng giữa hai thái cực đó. Một số năng lực cần thiết cho các kịch bản mất kiểm soát đang bắt đầu xuất hiện trong các hệ thống AI. Tuy nhiên, chúng ta chưa biết những năng lực này sẽ phát triển nhanh đến đâu, có thể kết hợp với nhau như thế nào và liệu các cơ chế kiểm soát hiện tại có đủ khả năng theo kịp hay không.
Vì vậy, câu hỏi quan trọng có lẽ không chỉ là “AI có chắc chắn hủy diệt loài người hay không?”
Mà còn là: Nếu một ngày AI thực sự trở nên đủ mạnh để gây ra một thảm họa không thể đảo ngược, liệu con người có nhận ra điều đó đủ sớm để ngăn chặn hay không?
