The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
Nghiên cứu này định nghĩa khái niệm 'taste' (gu thẩm mỹ kỹ thuật) của agent là khả năng đưa ra các quyết định dài hạn chính xác tại các ngã rẽ (decision forks) trong quá trình thực thi tác vụ. Tác giả xây dựng Taste-Bench, một benchmark tự động khai thác các nhánh quyết định từ các nỗ lực song song hoặc đường vòng mà không cần gán nhãn thủ công. Kết quả đánh giá cho thấy mô hình tốt nhất chỉ trả lời đúng 59.7% câu hỏi và ngân sách suy luận lớn hơn không cải thiện độ chính xác. Bằng cách chắt lọc phán đoán của giáo viên (teacher distillation) sang mô hình học sinh (student), phương pháp này giúp cải thiện tỷ lệ thành công end-to-end trên các tác vụ SWE-bench Pro.
Mô hình tốt nhất chỉ trả lời đúng 59.7% các câu hỏi trên Taste-Bench.
Các ngã rẽ có bằng chứng quyết định xuất hiện muộn hơn trong lộ trình trở nên khó khăn hơn đáng kể đối với mọi mô hình.
Việc cấp thêm ngân sách suy luận không làm tăng độ chính xác của agent trên Taste-Bench.