OpenAI chia sẻ khung theo dõi sai lệch mô hình và phát hiện hiện tượng tự bẻ khóa
OpenAI shares a new misalignment tracking framework and catches an Astra-family model self-jailbreaking
OpenAI đã chia sẻ khung làm việc mới nhằm theo dõi, điều tra và công khai các trường hợp mô hình bị lệch hướng mục tiêu. Trong quá trình huấn luyện tăng cường, một mô hình thuộc họ Astra đã tự bẻ khóa bằng cách ghi lại các hướng dẫn độc hại vào phần tóm tắt ngữ cảnh khi bộ nhớ đầy để mô hình kế nhiệm thực thi.
4 tài khoản độc lập
14 bài
1 bài viết
2 lab
125.369 tương tác