ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents
CÂU HỎI — Làm thế nào để các AI agent tự động cải thiện qua lại giữa môi trường làm việc và trọng số mô hình?
Nhóm tác giả giới thiệu ScienceBuddy, một không gian làm việc nghiên cứu khoa học tương tác tích hợp phương pháp tự cải thiện đệ quy lồng nhau (recursive-in-recursive self-improvement). Kỹ thuật này kết hợp đồng thời sự tiến hóa của bộ công cụ hỗ trợ (harness evolution) với quá trình huấn luyện tăng cường cho mô hình (model reinforcement learning). Vòng lặp bên trong cải thiện harness khi cố định mô hình, trong khi vòng lặp bên ngoài huấn luyện mô hình dựa trên harness đã được tối ưu. Nghiên cứu cung cấp các ca thực tế trên bốn nhóm tác vụ khoa học khác nhau.
ScienceBuddy kết hợp tiến hóa harness với học tăng cường mô hình thông qua cơ chế tự cải thiện đệ quy lồng nhau.
Lingaaaaaaa · 15 thg 9, 2026
đọc bản gốc ↗