What Makes Recurrence Effective in Looped Language Models?
Bài báo nghiên cứu mô hình ngôn ngữ lặp lại (LoopLMs), trong đó sử dụng chia sẻ tham số để tăng chiều sâu tính toán mà không thêm tham số. Thông qua các thí nghiệm kiểm soát, nhóm tác giả phân tích thời điểm récurrence hỗ trợ hiệu quả, vị trí phân bổ và cơ chế điều kiện hóa. Kết quả chỉ ra rằng récurrence có thể cải thiện khả năng suy luận vượt quá giới hạn huấn luyện nhưng làm giảm hiệu suất kiến thức. Để cải thiện độ ổn định, nhóm đề xuất history-state injection kết hợp điều kiện hóa theo bước thời gian (timestep conditioning) nhằm bảo toàn kiến thức tốt hơn khi unrolling mở rộng.
Récurrence có thể cải thiện khả năng suy luận vượt quá giới hạn huấn luyện trong khi làm giảm hiệu suất kiến thức.
Các lớp đầu ra không có tính lặp lại giúp cải thiện độ ổn định đối với việc thiếu unrolling.
Sự kết hợp giữa channel-wise history-state injection và timestep conditioning giúp bảo toàn kiến thức tốt hơn khi unrolling mở rộng.