CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — evaluation 71 upvote

A Missing Piece for Trustworthy AI Reviewers: From Benchmarking Rhetorical Robustness to SciCore Review

CÂU HỎI — Làm thế nào để đánh giá và cải thiện tính robust về mặt tu từ học (rhetorical robustness) của các hệ thống AI review bài báo khoa học?

Nghiên cứu này định nghĩa khái niệm Rhetorical Robustness để đo lường độ ổn định của AI reviewer trước các bản viết lại giữ nguyên nội dung nhưng thay đổi cách diễn đạt. Tác giả xây dựng benchmark RobustReview chứa 1.260 phiên bản bản thảo và đánh giá 30 cấu hình reviewer, qua đó phát hiện hiện tượng giả robust và độ nhạy cao với văn phong. Để giải quyết vấn đề này, nhóm đề xuất SciCore, một reviewer hai nhánh (dual-branch) kết hợp đánh giá toàn văn bản với phần cốt lõi khoa học đã được chuẩn hóa. Kết quả cho thấy SciCore đạt được độ ổn định và phân biệt tốt nhất trong số các mô hình được benchmark.

RobustReview bao gồm 1.260 phiên bản bản thảo để đánh giá 30 cấu hình reviewer khác nhau.

SciCore đạt được cấu hình ổn định và phân biệt hàng đầu trong thử nghiệm so sánh với GPT-5.5.

MingLiiii · 30 thg 9, 2026 đọc bản gốc ↗
↑