Meta công bố kiến trúc bảo mật của tác nhân AI Muse: tác nhân đề xuất hành động, còn lớp Sentinel quyết định cho phép, từ chối hoặc hỏi người dùng. Thiết kế này đáng chú ý khi AI được giao truy cập email, lịch và công cụ doanh nghiệp, thay vì chỉ trả lời trong hội thoại.
Trong bài công bố kỹ thuật về an toàn của Muse, Meta thừa nhận tác nhân vẫn có thể mắc lỗi hoặc bị tấn công qua dữ liệu đọc được. Hệ thống vì vậy được thiết kế để hạn chế thiệt hại khi mô hình bị dẫn hướng sai.
Sentinel kiểm soát hành động bên ngoài
Theo Meta, Sentinel nằm ngoài môi trường chạy của tác nhân, kiểm soát hành động qua các kết nối dịch vụ và lưu lượng mạng đi ra. Muse không thể ghi đè quyết định của lớp này.
Khi cần thao tác qua một kết nối, Muse gửi yêu cầu mô tả dịch vụ, loại hành động, phạm vi và bối cảnh nhiệm vụ. Sentinel đối chiếu chính sách người dùng đã đặt để quyết định bước tiếp theo.
Quyền thực thi không chỉ phụ thuộc vào việc mô hình tuân thủ lời nhắc: một thành phần riêng kiểm tra yêu cầu trước khi thực hiện. Đây là cách triển khai cụ thể cho bài toán khi nào tác nhân AI cần xin phép.
Thông tin đăng nhập nằm ngoài tầm nhìn của tác nhân
Meta cho biết mỗi người dùng có một máy tính đám mây riêng, nhưng tác nhân không có toàn quyền trên máy đó. Môi trường chạy công cụ và xử lý dữ liệu không đáng tin cậy được tách khỏi các dịch vụ nhạy cảm.
Thông tin đăng nhập, gồm token truy cập dịch vụ được kết nối, được quản lý bên ngoài môi trường chạy. Muse sử dụng dịch vụ qua cơ chế trung gian thay vì trực tiếp nhìn thấy bí mật đăng nhập.
Sự phân tách nhằm thu hẹp hậu quả nếu website hoặc email chứa chỉ dẫn độc hại. Kiểu tấn công prompt injection có thể khiến AI nhầm dữ liệu bên ngoài với yêu cầu cần tuân theo. Tách quyền không loại bỏ mọi rủi ro, nhưng hạn chế khả năng sai lệch của mô hình dẫn tới truy cập không giới hạn.
Nhật ký hoạt động không phải bảo đảm tuyệt đối
Trong bài giới thiệu thiết kế Muse, đội ngũ phát triển mô tả nhật ký hoạt động, danh sách quyền đã duyệt và các tệp bộ nhớ có thể đọc, chỉnh sửa. Những công cụ này giúp người dùng kiểm tra công việc chạy nền.
Nhật ký hỗ trợ truy vết nhưng không thay thế kiểm tra kết quả. Hành động được cấp phép vẫn có thể dùng dữ liệu sai hoặc tạo đầu ra không phù hợp, liên quan đến quản lý ngữ cảnh khi AI làm việc dài hạn.
Meta cũng công bố mở chương trình thưởng phát hiện lỗi Muse, với mức tối đa 300.000 USD cho báo cáo hợp lệ. Đây là biện pháp tìm lỗ hổng, không chứng minh hệ thống an toàn tuyệt đối. Tài liệu hiện có mô tả biện pháp bảo vệ do nhà cung cấp công bố, chưa đủ để kết luận hiệu quả trong mọi tình huống vận hành.
Câu hỏi thường gặp
Muse hiện có được cung cấp tại Việt Nam không?
Theo trang Muse dành cho doanh nghiệp nhỏ, dịch vụ dành cho người từ 18 tuổi tại Mỹ và Canada. Nhà cung cấp chưa nêu thời điểm mở rộng sang Việt Nam.
Sentinel có yêu cầu người dùng duyệt mọi thao tác không?
Không. Sentinel có thể cho phép, từ chối hoặc yêu cầu phê duyệt tùy chính sách, loại hành động và phạm vi truy cập, thay vì luôn tạo thông báo xin phép.
