Sample Count Is Not Enough: Candidate-Generation Strategy Shapes the Energy and Performance of LLM Test-Time Scaling
Bài báo nghiên cứu tác động của lịch trình tạo sinh ứng viên (candidate-generation schedules) đối với test-time scaling của LLM, chỉ ra rằng số lượng ứng viên N không đủ để mô tả chi phí hệ thống. Các tác giả so sánh bốn lịch trình (1x8, 2x4, 4x2, 8x1) trong khi giữ nguyên tổng số ứng viên N = 8. Kết quả trên GPU A100 cho thấy việc thực hiện 8 lời gọi tuần tự tiêu tốn năng lượng phần cứng nhiều hơn 4.64-4.86x và có độ trễ P95 cao hơn 5.77-6.12x so với một lời gọi theo lô đơn duy nhất. Do đó, khi các ứng viên độc lập và bộ nhớ cho phép, việc gộp nhiều ứng viên vào ít lời gọi hơn sẽ hiệu quả hơn.
Trên GPU A100, tám lời gọi nối tiếp tiêu tốn năng lượng phần cứng thiết bị nhiều hơn 4.64-4.86x so với một lời gọi theo lô đơn.
Tám lời gọi nối tiếp có độ trễ P95 cao hơn 5.77-6.12x so với một lời gọi gộp duy nhất có tám ứng viên.
Tăng N từ 1 lên 8 giúp cải thiện độ chính xác thêm 8.4 điểm phần trăm cho Phi-3-mini và 18.4 điểm cho Qwen2.5-1.5B trên 500 prompt GSM8K.