CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 106 upvote

Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents

CÂU HỎI — Liệu việc phân bổ khối lượng tính toán ở ranh giới giữa model và harness có giúp cải thiện độ tin cậy hành động của terminal agent không?

Terminal agent hoạt động thông qua các lệnh sinh ra từ mô hình, nhưng một câu lệnh kém chất lượng có thể làm hỏng môi trường thực thi dù mô hình đủ khả năng tạo ra phương án tốt hơn. Nghiên cứu này đề xuất Mid-Harness nhằm lấy mẫu và xác thực các hành động ứng viên ngay tại ranh giới trước khi chuyển tiếp cho môi trường thực thi. Kết quả cho thấy việc sử dụng verifier mạnh giúp khai thác các lựa chọn thay thế tối ưu, nâng cao đáng kể tỷ lệ thành công trên TerminalBench-Lite mà không cần thay đổi kiến trúc mô hình gốc.

Trên TerminalBench-Lite, GPT-5.6 Sol verifier làm tăng Pass@1 từ 50,00% lên 68,03% với 8 hành động được lấy mẫu.

Kết hợp action và trajectory scaling đạt tỷ lệ thành công cao hơn với chi phí token ước tính thấp hơn so với việc chỉ tạo thêm trajectory.

Nardien · 30 thg 9, 2026 đọc bản gốc ↗
↑