CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — training 14 upvote

The Low-Rank Structure of VLA Reinforcement Learning

CÂU HỎI — Cấu trúc tham số nào trong các mô hình vision-language-action chịu trách nhiệm cho các cải thiện hiệu suất khi hậu huấn luyện bằng reinforcement learning?

Nghiên cứu này khảo sát cách reinforcement learning (RL) định hình lại các chính sách trong mô hình vision-language-action (VLA). Các tác giả phát hiện ra rằng RL tạo ra các cập nhật tham số có hạng thấp (low-rank) tập trung cao độ vào các Timestep Module của action expert trên các mô hình như $\pi_{0.5}$ và GR00T N1.5/N1.6. Thông qua các thí nghiệm thay thế module hệ thống, họ chứng minh các module này chiếm phần lớn mức tăng hiệu suất từ RL. Hơn nữa, hướng cập nhật dịch chuyển (shift update directions) trong các module này dự đoán mạnh mẽ tỷ lệ thành công của tác vụ, với ROC-AUC đạt tới 99.6%, qua đó cho phép cải thiện chính sách đã huấn luyện RL mà không cần chạy thêm RL.

RL tạo ra các cập nhật tham số hạng thấp tập trung vào Timestep Modules của action expert.

Hướng cập nhật dịch chuyển dự đoán mạnh mẽ thành công của tác vụ với ROC-AUC lên tới 99.6%.

Jongwondd · 28 thg 9, 2026 đọc bản gốc ↗
↑