ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research
Pour étudier si l'IA peut égaler l'intuition scientifique humaine dans l'identification de recherches antérieures, les auteurs construisent ScholarCatalyst en utilisant les annotations de 184 auteurs principaux de 207 articles récents en informatique. Ils introduisent une tâche de recherche basée sur des jugements d'auteurs. Les résultats expérimentaux montrent que la recherche par agent atteint 0,42 Recall@20 contre 0,48 pour la recherche par embedding, tandis qu'un agent basé sur Claude Fable 5.1 n'atteint que 0,51 R@20. Ces résultats soulignent le besoin de nouvelles recettes d'entraînement.
Agentic search does no better than embedding retrieval with 0.42 vs. 0.48 Recall@20.
An agent built on Claude Fable 5.1 reaches only 0.51 R@20 on the ScholarCatalyst retrieval task.
ScholarCatalyst is built from judgments by 184 lead authors of 207 recent computer science papers.