EVOKE: Eliciting World Knowledge in Agents for Transferable Decision-Making
Nghiên cứu này chỉ ra rằng post-training thông thường không thúc đẩy việc khơi gợi kiến thức thế giới đã có sẵn trong LLM, khiến agent kém thích ứng khi chuyển sang môi trường mới. Tác giả giới thiệu EVOKE, một phương pháp post-training ép buộc thay đổi sở thích hành động thông qua sự đa dạng mục tiêu ở các trạng thái cố định. Điều này buộc mô hình phải kích hoạt kiến thức thế giới bên trong để sắp xếp lại các hành động chính xác. Đánh giá trên nhiều tác vụ và backbone khác nhau cho thấy EVOKE cải thiện hiệu năng nhiệm vụ, khả năng tổng quát hóa sang môi trường chưa từng thấy và hiệu quả dữ liệu.
EVOKE cải thiện hiệu năng tác vụ và khả năng tổng quát hóa vào các môi trường chưa từng thấy.
Phương pháp này cung cấp độ hiệu quả dữ liệu cao thông qua giám sát quyết định trực tiếp dựa trên đa dạng mục tiêu.