FLEET: From Logits Entropy to Enhanced Trajectories in Text Generation
Các hệ thống LLM thường dùng temperature sampling để lấy nhiều mẫu hoàn thành, nhưng cách tiếp cận không có bộ nhớ này dễ tạo ra các câu trả lời trùng lặp ngữ nghĩa. Để khắc phục, nghiên cứu đề xuất phương pháp FLEET tích hợp cơ chế bộ nhớ vào quá trình sinh. FLEET biểu diễn mỗi lần sinh như một quỹ đạo thưa qua các trạng thái có entropy vượt ngưỡng để tính điểm tiện ích cho từng token và điều chỉnh logits. Kết quả thử nghiệm cho thấy FLEET đạt độ chính xác tương đương baseline với tốc độ nhanh hơn 3x, đồng thời nâng tỷ lệ LiveCodeBench Pass@32 từ 59.9% lên 66.2% trên các tác vụ lập trình phức tạp.
FLEET đạt độ chính xác tương đương baseline với tốc độ nhanh hơn 3x.
Điểm LiveCodeBench Pass@32 tăng từ 59.9% lên 66.2% dưới cùng một ngân sách.
Phương pháp này là deterministic trong cấu hình greedy-decoding được đánh giá.