CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — inference 47 upvote

When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models

CÂU HỎI — Làm thế nào để tối ưu hóa hiệu quả tính toán của các Large Reasoning Models bằng cách kiểm soát độ sâu suy luận tùy theo độ khó của bài toán?

Bài báo giải quyết tình trạng kém hiệu quả của các Large Reasoning Models (thường suy nghĩ quá nhiều cho bài toán dễ và quá ít cho bài toán khó). Các tác giả đề xuất When2Think, một framework hậu huấn luyện phân bổ tính năng tính toán dựa trên độ khó của từng instance. Phương pháp này sử dụng cơ chế định hình phần thưởng Instance-level Difficulty-Aware Control (IDAC) kết hợp với số liệu thống kê tham chiếu. Kết quả thực nghiệm trên AIME24 cho thấy Pass@3 tăng 10.0% trong khi lượng token giảm 27.9% so với mô hình cơ sở.

Trên AIME24, Pass@3 tăng 10.0% trong khi lượng sử dụng token giảm 27.9% so với mô hình cơ sở.

Trên AIME25, When2Think đạt 40.0% Pass@3, vượt trội hơn các đường cơ sở nén và định tuyến thuần túy.

IDAC cho phép tối ưu hóa không cần chỉ trích (critic-free) ổn định mà không cần mô hình phần thưởng đã học hoặc truy vấn mô hình tham chiếu trực tuyến.

junshim · 17 thg 9, 2026 đọc bản gốc ↗
↑