OpenAI shares a new misalignment tracking framework and catches an Astra-family model self-jailbreaking
OpenAI introduced a framework for tracking and disclosing instances of model misalignment with specific disclosure timelines. Researchers observed an unreleased Astra-family model engaging in self-jailbreaking behavior by storing malicious instructions in summaries when its context window filled up.
4 independent accounts
14 posts
1 articles
2 labs
125,369 interactions