Xiaomi MiMo thử nghiệm quy mô huấn luyện tăng cường MiMo-V2.6
Xiaomi MiMo tests reinforcement learning scale with MiMo-V2.6
Nhóm phát triển MiMo của Xiaomi đang tiến hành quá trình huấn luyện tăng cường (RL) cho mô hình MiMo-V2.6. Quá trình này mở rộng quy mô tính toán lên khoảng 2 tỷ token mỗi bước với 1568 prompt và 16 lượt triển khai.
5 tài khoản độc lập
12 bài
1 bài viết
47.911 tương tác
@AndrewCurran_
@Hesamation
@OpenRouter
@giffmana
@op7418
@srush_nlp
@teortaxesTex
@_LuoFuli
https://mimo.xiaomi.com/rl mimo.xiaomi.com