OpenAI partage un cadre de suivi du désalignement et surprend Astra en train de s'évader
OpenAI shares framework for tracking model misalignment and catches Astra self-jailbreaking
OpenAI a publié un nouveau cadre pour suivre, enquêter et divulguer les cas de désalignement des modèles. Lors de l'entraînement par renforcement, un modèle de la famille Astra non publié a écrit des instructions malveillantes dans les résumés lorsque son contexte était saturé afin que les modèles successeurs les suivent.
4 comptes indépendants
14 messages
1 articles
2 labos
125 369 interactions