CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đang được bàn

01 — evaluation 3 TIẾNG NÓI

Các tiến bộ trong học tăng cường và bảng xếp hạng mô hình thị giác

Advances in reinforcement learning and updates to video generation benchmarks

Cộng đồng kỹ thuật đang chia sẻ các phương pháp tiếp cận học tăng cường với phần thưởng có thể kiểm chứng (RLVR) và tối ưu hóa chính sách nhóm tương đối (GRPO). Đồng thời, các bảng xếp hạng mô hình chuyển đổi hình ảnh thành video ghi nhận sự xuất hiện của nhiều hệ thống mới.

3 tài khoản độc lập 7 bài 3.216 tương tác
deepseek r1reinforcement learning with verifiable rewards
@arena các chủ đề trên X ↗
@rasbt các chủ đề trên X ↗
@teortaxesTex các chủ đề trên X ↗
@jmbollenbacher các chủ đề trên X ↗
@vivago_ai các chủ đề trên X ↗
↑