CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — evaluation 14 upvote

OpenTumorBoard: A Real-World Benchmark of Multidisciplinary Tumor Board Discussion Trajectories

CÂU HỎI — Các mô hình ngôn ngữ lớn hoạt động như thế nào khi đối mặt với các quỹ đạo thảo luận hội đồng u bướu đa chuyên khoa thực tế?

Nghiên cứu giới thiệu OpenTumorBoard, một benchmark thực tế gồm 611 trường hợp bệnh nhân và 19.157 lượt thảo luận từ các bản ghi âm hội đồng u bướu. Benchmark này đánh giá các mô hình trong hai thiết lập: trả lời câu hỏi lâm sàng đơn lẻ và mô phỏng toàn bộ cuộc họp để đạt được sự đồng thuận về điều trị. Kết quả đánh giá trên 14 LLM đa năng và y tế cho thấy hạn chế lớn, với điểm số tương đương lâm sàng tối đa là 3.43 trên 5 và độ bám sát kết luận hội đồng là 2.78 trên 5. Công trình chứng minh rằng các phương pháp như fine-tuning có thể cải thiện hiệu suất trên tập dữ liệu này.

OpenTumorBoard bao gồm 611 trường hợp bệnh nhân và 19.157 lượt thảo luận qua 10 vai trò chuyên gia từ 12.534 phút ghi âm.

Mô hình tốt nhất đạt 3.43 trên 5 điểm tương đương lâm sàng với câu trả lời của chuyên gia và 2.78 trên 5 điểm bám sát kết luận hội đồng.

al1219 · 26 thg 9, 2026 đọc bản gốc ↗
↑