Các tiến bộ trong học tăng cường và bảng xếp hạng mô hình thị giác
Advances in reinforcement learning and updates to video generation benchmarks
Cộng đồng kỹ thuật đang chia sẻ các phương pháp tiếp cận học tăng cường với phần thưởng có thể kiểm chứng (RLVR) và tối ưu hóa chính sách nhóm tương đối (GRPO). Đồng thời, các bảng xếp hạng mô hình chuyển đổi hình ảnh thành video ghi nhận sự xuất hiện của nhiều hệ thống mới.
3 tài khoản độc lập
7 bài
3.216 tương tác
deepseek r1reinforcement learning with verifiable rewards