CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — agents 11 votes

ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research

QUESTION — Dans quelle mesure les méthodes de recherche et les agents IA actuels égalent-ils les experts humains pour trouver la recherche antérieure inspirant de nouveaux projets ?

Pour étudier si l'IA peut égaler l'intuition scientifique humaine dans l'identification de recherches antérieures, les auteurs construisent ScholarCatalyst en utilisant les annotations de 184 auteurs principaux de 207 articles récents en informatique. Ils introduisent une tâche de recherche basée sur des jugements d'auteurs. Les résultats expérimentaux montrent que la recherche par agent atteint 0,42 Recall@20 contre 0,48 pour la recherche par embedding, tandis qu'un agent basé sur Claude Fable 5.1 n'atteint que 0,51 R@20. Ces résultats soulignent le besoin de nouvelles recettes d'entraînement.

Agentic search does no better than embedding retrieval with 0.42 vs. 0.48 Recall@20.

An agent built on Claude Fable 5.1 reaches only 0.51 R@20 on the ScholarCatalyst retrieval task.

ScholarCatalyst is built from judgments by 184 lead authors of 207 recent computer science papers.

yoonholee · 01 oct. 2026 lire l'original ↗
↑