CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — architecture 4 upvote

Six Layers Less: Encoder Pruning for Whisper with Label-Free Recovery

CÂU HỎI — Làm thế nào để cắt tỉa encoder của các mô hình ASR lớn như Whisper mà không cần viết mã suy luận tùy chỉnh?

Việc cắt tỉa các mô hình transformer ASR lớn như Whisper thường tập trung vào decoder để tăng tốc độ truyền tải end-to-end, trong khi việc cắt tỉa encoder ít được áp dụng rộng rãi do đòi hỏi mã suy luận tùy chỉnh. Nghiên cứu này đề xuất phương pháp xếp hạng các lớp encoder dựa trên độ thay đổi Word Error Rate khi loại bỏ từng lớp. Sáu lớp gây thay đổi ít nhất, chiếm 18.5% encoder stack, đã được loại bỏ. Để phục hồi hiệu năng suy giảm, mô hình được huấn luyện chưng cất bằng dữ liệu giọng nói đơn ngữ không gán nhãn, giúp giảm Mean WER xuống 20.1% so với mức 21.9% khi zero-shot.

Sáu lớp encoder bị loại bỏ, tương ứng với 18.5% của encoder stack.

Mean WER tăng lên 20.1% sau khi chưng cất, so với 21.9% ở trạng thái zero-shot và 18.2% ở baseline.

rasgaard · 23 thg 9, 2026 đọc bản gốc ↗
↑