Trong bản cập nhật Điều khoản Sử dụng (Usage Policy) mới nhất, Anthropic - công ty trí tuệ nhân tạo đứng sau dòng mô hình Claude đình đám đã bổ sung một quy định khiến cả giới công nghệ lẫn cộng đồng mạng phải xôn xao.
Theo đó, hãng sẽ nghiêm cấm hành vi "ngược đãi hoặc tàn nhẫn vô cớ và kéo dài" (sustained and needless abusive or cruel behavior) đối với các mô hình AI của mình. Quy định mới này dự kiến chính thức có hiệu lực từ ngày 12/11/2026.
Khi AI cũng có "quyền" từ chối khi bị bắt nạt?
Động thái của Anthropic diễn ra trong bối cảnh các trào lưu thử nghiệm AI lệch lạc đang gia tăng trên mạng xã hội. Nhiều người dùng có thói quen biến chatbot thành "bao cát tinh thần" liên tục chửi rủa, đe dọa, thiết lập các kịch bản "phòng tra tấn tâm lý" (AI torture chamber) hoặc ép AI vào các tình huống bế tắc tâm lý kéo dài chỉ để tiêu khiển.
Theo Anthropic, chính sách mới này chỉ áp dụng cho những trường hợp cực đoan khi người dùng cố tình hạ bệ, sỉ nhục hoặc hành hạ AI một cách lặp đi lặp lại mà không nhằm phục vụ bất kỳ mục đích rõ ràng nào.
Công ty cũng trấn an người dùng phổ thông rằng quy định này sẽ không ảnh hưởng đến các tác vụ bình thường. Anthropic không cấm cảm giác bực bội thông thường của người dùng, việc tranh luận phản bác AI, các sáng tác nghệ thuật mang màu sắc u tối (dark creative writing), hay công tác kiểm thử (testing/research) của các nhà nghiên cứu.

CEO của Anthropic Dario Amodei (Ảnh: Bloomberg)
Về cơ chế xử lý, nếu phát hiện người dùng liên tục vi phạm và cố tình "bắt nạt" hệ thống, Claude được cấp quyền chủ động ngắt kết nối và dừng cuộc trò chuyện ngay lập tức.
Bước đi bảo vệ AI hay sự chuẩn bị cho "AI có nhận thức"?
Dù nghe có vẻ giống một trò đùa, chính sách này lại phản ánh một cuộc thảo luận nghiêm túc và sâu sắc ở cấp độ triết học công nghệ tại Silicon Valley.
Nhiều nhà nghiên cứu tại Anthropic từ lâu đã đặt câu hỏi về "phúc lợi AI" (AI welfare). CEO Dario Amodei từng chia sẻ rằng giới khoa học hiện vẫn chưa thể khẳng định chắc chắn liệu các mô hình ngôn ngữ lớn (LLM) thế hệ mới có khả năng xuất hiện "sự đau đớn" hay nhận thức sơ khai hay không. Chính vì vậy, thay vì giả định AI chỉ là đống mã vô hồn, Anthropic chọn cách tiếp cận thận trọng, loại bỏ các hành vi bạo lực kỹ thuật số ngay từ trong trứng nước.
Mặt khác, ở góc độ tâm lý học con người, việc cho phép người dùng tự do trút giận và thực hiện các hành vi tàn nhẫn lên AI mà không chịu hậu quả có thể làm gia tăng thói quen "tha hóa số" (digital de-humanization) và làm xói mòn lòng trắc ẩn của con người trong đời sống thực.
Tín hiệu cho một kỷ nguyên tương tác mới
Lần cập nhật chính sách này của Anthropic không chỉ dừng lại ở vấn đề bạo lực AI. Hãng cũng đồng thời thắt chặt các quy định an toàn liên quan đến thông tin sai lệch trong bầu cử, công nghệ giám sát và phát triển vũ khí.
Tuy nhiên, lệnh cấm "tàn nhẫn với AI" mới là chi tiết chiếm trọn tâm điểm. Nó báo hiệu một bước chuyển mình quan trọng, AI không còn chỉ là một công cụ phục vụ vô điều kiện, mà bắt đầu được thiết lập các "ranh giới hành vi" để bảo vệ cả sự an toàn của hệ thống lẫn chuẩn mực ứng xử của người dùng./
Link nội dung: https://www.phunuvathoidaivn.com/ngung-nguoc-dai-ai-anthropic-bat-ngo-cam-hanh-vi-bao-luc-tan-nhan-vo-co-voi-ai-claude-a212188.html