CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 158 upvote

The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks

CÂU HỎI — Làm thế nào để đo lường và cải thiện khả năng ra quyết định chiến lược dài hạn (taste) của LLM agent trên các tác vụ kỹ thuật và nghiên cứu?

Nghiên cứu này định nghĩa khái niệm 'taste' (gu thẩm mỹ kỹ thuật) của agent là khả năng đưa ra các quyết định dài hạn chính xác tại các ngã rẽ (decision forks) trong quá trình thực thi tác vụ. Tác giả xây dựng Taste-Bench, một benchmark tự động khai thác các nhánh quyết định từ các nỗ lực song song hoặc đường vòng mà không cần gán nhãn thủ công. Kết quả đánh giá cho thấy mô hình tốt nhất chỉ trả lời đúng 59.7% câu hỏi và ngân sách suy luận lớn hơn không cải thiện độ chính xác. Bằng cách chắt lọc phán đoán của giáo viên (teacher distillation) sang mô hình học sinh (student), phương pháp này giúp cải thiện tỷ lệ thành công end-to-end trên các tác vụ SWE-bench Pro.

Mô hình tốt nhất chỉ trả lời đúng 59.7% các câu hỏi trên Taste-Bench.

Các ngã rẽ có bằng chứng quyết định xuất hiện muộn hơn trong lộ trình trở nên khó khăn hơn đáng kể đối với mọi mô hình.

Việc cấp thêm ngân sách suy luận không làm tăng độ chính xác của agent trên Taste-Bench.

wenbopan · 22 thg 9, 2026 đọc bản gốc ↗
↑