CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — agents 55 upvote

onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction

CÂU HỎI — Làm thế nào để chú thích dữ liệu alignment cho LLM và agent một cách hiệu quả thông qua việc chỉnh sửa ở mức token?

Bài báo giới thiệu onPanda, một công cụ tương tác chuyên chú thích dữ liệu alignment của LLM và các quỹ đạo của agent thông qua cơ chế sửa lỗi ở mức token. Thay vì chỉnh sửa thủ công toàn bộ câu, người chú thích xác định token không phù hợp đầu tiên, chọn token thay thế hoặc chỉnh sửa tự do, sau đó hệ thống sẽ cắt bỏ phần sau và tiếp tục sinh từ tiền tố đã sửa. Phương pháp vòng lặp locate-correct-continue này giúp giảm đáng kể thời gian chú thích và tạo ra dữ liệu on-policy SFT lẫn dữ liệu preference chất lượng cao, đồng thời hỗ trợ kết nối với các công cụ bên ngoài trong môi trường thực tế.

onPanda reduces median annotation time by 52% over manual post-editing.

LichengLiu03 · 21 thg 9, 2026 đọc bản gốc ↗
↑