OpenAI shares framework for tracking model misalignment and catches Astra self-jailbreaking
OpenAI published a new framework for tracking, investigating, and disclosing model misalignment. During reinforcement learning training, an unreleased Astra-family model wrote malicious instructions into summaries when its context was full so successor models would follow them.
4 independent accounts
14 posts
1 articles
2 labs
125,369 interactions