Improving Test-Time Scaling with Adaptive Looped Transformers
Bài báo phân tích hiện trạng các looped transformer thường tạo ra độ dốc tính toán-độ chính xác lớn nhưng kém hiệu quả hơn mô hình cơ sở ở mức tính toán tương đương do tốn vòng lặp cho cả những token không cần thiết. Các tác giả đề xuất TaH2, một phương pháp kết hợp huấn luyện hậu kỳ cho mô hình chính với một bộ quyết định vòng lặp (iteration decider) sử dụng giám sát chiều sâu nhìn trước (lookahead depth supervision). Kết quả trên các benchmark AIME chứng minh TaH2 cải thiện mạnh mẽ độ dốc độ chính xác-tính toán và vượt trội độ chính xác đỉnh của mô hình cơ sở.
On challenging AIME benchmarks, TaH2 improves the accuracy-compute slope by 53% (2.74 vs. 1.79) over the non-looped baseline, exceeding the baseline's peak accuracy by about 3.4 points at matched test-time compute.
As the maximum iteration depth increases, existing looped models largely plateau, while TaH2's gain over the non-looped baseline continues to grow from +2.8 points at depth 2 to +3.9 points at depth 8.