CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 11 upvote

ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research

CÂU HỎI — Các hệ thống AI và agent hiện tại có khả năng truy xuất các tài liệu nghiên cứu truyền cảm hứng cho dự án mới tốt bằng chuyên gia con người không?

Để tìm hiểu xem AI có thể bắt chước trực giác của nhà khoa học trong việc chọn tài liệu nghiên cứu trước đó cho các dự án mới hay không, các tác giả đã xây dựng benchmark ScholarCatalyst thông qua việc thu thập nhãn và lý do chi tiết từ 184 tác giả chính của 207 bài báo khoa học máy tính gần đây. Họ thiết lập một tác vụ truy xuất dựa trên phán đoán thực tế của tác giả từ văn bản có sẵn tại thời điểm dự án bắt đầu. Kết quả thực nghiệm cho thấy agentic search không vượt trội hơn embedding retrieval với điểm số 0,42 so với 0,48 Recall@20, trong khi mô hình agent dựa trên Claude Fable 5.1 chỉ đạt 0,51 R@20. Điều này làm nổi bật sự cần thiết của các phương pháp huấn luyện mới để trang bị trực giác chuyên gia cho mô hình.

Agentic search does no better than embedding retrieval with 0.42 vs. 0.48 Recall@20.

An agent built on Claude Fable 5.1 reaches only 0.51 R@20 on the ScholarCatalyst retrieval task.

ScholarCatalyst is built from judgments by 184 lead authors of 207 recent computer science papers.

yoonholee · 01 thg 10, 2026 đọc bản gốc ↗
↑