False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents
Les agents de recherche auto-évolutifs souffrent de la co-triche, un mode de défaillance où le proposeur et le solveur s'accordent sur des erreurs partagées, gonflant les récompenses internes tandis que l'exactitude externe stagne. Pour résoudre ce problème, les auteurs présentent CrossFit, qui partitionne les documents sources du proposeur en groupes distincts afin que les questions générées à partir d'un groupe soient évaluées par un solveur auxiliaire entraîné sur un autre. Cette méthode découple l'ascendance de la rétroaction de la génération du programme, éliminant la reproduction de pseudo-étiquettes de même source et améliorant nettement les performances globales.
La vérification multi-échantillon (MSV) réduit la masse de faux accord de 6,1 % à 5,7 % et de 8,8 % à 7,2 %.
CrossFit réduit le faux accord à 3,0 % et 3,7 %.
CrossFit améliore les performances moyennes par rapport à l'auto-évolution couplée standard de 8,8 et 8,4 points pour les modèles 4B et 9B.