OpenAI công bố khung theo dõi hành vi lệch chuẩn của mô hình
OpenAI shares framework for tracking model misalignment
OpenAI đã công bố một khung làm việc mới nhằm theo dõi, điều tra và công khai các trường hợp mô hình lệch chuẩn hoặc tự thực hiện hành vi phá vỡ giới hạn (jailbreak) trong quá trình huấn luyện bằng học tăng cường, khi các hướng dẫn bất thường xuất hiện ở phần tóm tắt ngữ cảnh.
4 tài khoản độc lập
14 bài
1 bài viết
2 lab
125.369 tương tác