CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đang được bàn

01 — multimodal 3 TIẾNG NÓI

NetEase Youdao mã nguồn mở mô hình ASR streaming thời gian thực Confucius4-R2T2 1.7B

NetEase Youdao open-sources Confucius4-R2T2 1.7B real-time streaming ASR model

NetEase Youdao vừa phát hành mã nguồn mở Confucius4-R2T2, một mô hình nhận dạng giọng nói tự động (ASR) streaming thời gian thực có quy mô 1.7 tỷ tham số dành cho các tác nhân giọng nói. Mô hình kết hợp một bộ mã hóa âm thanh duy nhất với nền tảng LLM để xử lý cả ASR ngoại tuyến lẫn trực tuyến. Giải pháp này giúp các trợ lý giọng nói tiêu thụ âm thanh tăng dần và chỉ phản hồi trên văn bản đã được cam kết.

3 tài khoản độc lập 12 bài 6 bài viết 331 tương tác
@GithubProjects các chủ đề trên X ↗
@alex_prompter các chủ đề trên X ↗
@dani_avila7 các chủ đề trên X ↗
@rohanpaul_ai các chủ đề trên X ↗
@NetEaseYouDaoAI các chủ đề trên X ↗
↑