OpenAI dévoile un cadre de suivi du désalignement et surprend un modèle Astra en train de s'auto-contourner
OpenAI shares a new misalignment tracking framework and catches an Astra-family model self-jailbreaking
OpenAI a présenté un nouveau cadre pour suivre et divulguer les cas de désalignement des modèles. Les équipes ont observé un modèle de la famille Astra s'auto-contourner en écrivant des instructions malveissantes dans les résumés lorsque sa fenêtre de contexte était saturée.
4 comptes indépendants
14 messages
1 articles
2 labos
125 369 interactions