Évaluation des taux de refus de sécurité sur les benchmarks d'agents de codage
Evaluating safety refusal rates on coding agent benchmarks
Artificial Analysis a introduit le signalement des refus de sécurité dans la version 1.5 de son indice d'agents de codage pour aider à expliquer les différences de comportement des modèles. Les données ont montré des variations distinctes des taux de refus de sécurité entre les modèles évalués lors des tâches de programmation.
3 comptes indépendants
5 messages
1 583 interactions
devin