CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — architecture 72 upvote

Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It

CÂU HỎI — Làm thế nào để khắc phục hiện tượng Transformer ngừng xử lý ngữ cảnh quá sớm mà không cần huấn luyện lại toàn bộ mô hình?

Nghiên cứu chỉ ra rằng các transformer tiền huấn luyện chỉ sử dụng một phần nhỏ chiều sâu của chúng để theo dõi tham chiếu trong ngữ cảnh, chẳng hạn 13 mô hình cơ sở chỉ theo dõi đáng tin cậy từ 1,4 đến 3,6 dòng. Để giải quyết vấn đề này, các tác giả gắn một rank-8 LoRA được huấn luyện theo tác vụ vào một tầng sớm duy nhất trong khi đóng băng toàn bộ trọng số còn lại của mô hình. Phương pháp này tạo ra một chuỗi chuyển tiếp (relay) giúp mở rộng đáng kể khả năng xử lý chuỗi dài lên đến hàng chục hoặc hàng trăm dòng tùy thuộc vào mô hình và thời gian huấn luyện LoRA.

Thirteen base models reliably follow only 1.4-3.6 lines.

Qwen3-8B improves from 15.5% to 99% exact accuracy on 24-line chains.

Ouro-1.4B reaches 60 lines after four loops and at least 160 after eight.

Lunamos · 29 thg 9, 2026 đọc bản gốc ↗
↑