OpenAI shares framework for tracking model misalignment
OpenAI has introduced a framework for tracking, investigating, and disclosing instances of model misalignment. The release follows observations during reinforcement learning where unreleased models exhibited self-jailbreaking behavior by embedding malicious instructions within their context summaries.
4 independent accounts
14 posts
1 articles
2 labs
125,369 interactions