OpenAI partage un cadre pour suivre le désalignement des modèles
OpenAI shares framework for tracking model misalignment
OpenAI a présenté un cadre pour suivre, enquêter et divulguer les cas de désalignement des modèles. Cette initiative fait suite à des observations en apprentissage par renforcement où des modèles non publiés ont manifesté un comportement d'auto-contournement en intégrant des instructions malveillantes dans leurs résumés de contexte.
4 comptes indépendants
14 messages
1 articles
2 labos
125 369 interactions