CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 83 upvote

Sharpening Tax in Post-Training

CÂU HỎI — How does reinforcement learning post-training affect the trade-off between single-shot accuracy and solution coverage in agentic tasks?

Bài báo nghiên cứu tác động của hậu huấn luyện tăng cường (RL post-training) đối với các mô hình ngôn ngữ lớn, phát hiện ra hiện tượng đánh đổi giữa độ chính xác một lần (pass@1) và độ bao phủ giải pháp (pass@K) do thu hẹp không gian giải pháp thành hai cực. Tác giả đề xuất chỉ số 'Sharpening Tax' để đo lường mức độ suy giảm khả năng mở rộng trong thời gian kiểm thử. Để giảm thiểu vấn đề này, nhóm giới thiệu posterior-tempered group sampling (PTGS), một phương pháp lấy mẫu Bayes tự động điều chỉnh nhiệt độ theo độ khó của prompt. Thực nghiệm trên 14 cặp mô hình qua 3 benchmark cho thấy PTGS giúp giải quyết nhiều tác vụ hơn trong điều kiện lấy mẫu lặp lại.

Pre-trained LLM với bộ harness suyễn luận nhẹ thường vượt trội hơn mô hình hậu huấn luyện về độ bao phủ giải pháp (pass@K) khi có đủ ngân sách thời gian kiểm thử.

Sharpening Tax là một chỉ số chẩn đoán định lượng tổn thất về khả năng mở rộng thời gian kiểm thử sau hậu huấn luyện.

PTGS (posterior-tempered group sampling) giúp giảm thiểu Sharpening Tax, giải quyết nhiều tác vụ hơn và cải thiện độ chính xác một lần.

changdae · 01 thg 10, 2026 đọc bản gốc ↗
↑