Xiaomi thử nghiệm quy mô lớn với thuật toán tăng cường học tập MiMo-V2.6
Xiaomi scales reinforcement learning runs for MiMo-V2.6
Nhóm phát triển MiMo của Xiaomi đang tiến hành quá trình huấn luyện tăng cường học tập quy mô lớn cho mô hình MiMo-V2.6 với khối lượng khoảng 2 tỷ token mỗi bước. Quá trình này bao gồm việc mở rộng quy mô tính toán cho môi trường, công cụ đánh giá và tự động hóa thử nghiệm trực tiếp.
4 tài khoản độc lập
11 bài
1 bài viết
47.811 tương tác
@AndrewCurran_
@Hesamation
@giffmana
@op7418
@srush_nlp
@teortaxesTex
@_LuoFuli
https://mimo.xiaomi.com/rl mimo.xiaomi.com