FLEET: From Logits Entropy to Enhanced Trajectories in Text Generation
Les LLM utilisent souvent l'échantillonnage par température pour agréger des échantillons, mais cette approche sans mémoire génère des doublons sémantiques. Pour y remédier, les auteurs présentent FLEET, qui intègre un mécanisme de mémoire dans la génération. FLEET suit des trajectoires éparses à travers des états dont l'entropie dépasse un seuil pour calculer des scores d'utilité par token ajustant les logits. Les expériences montrent que FLEET atteint la précision de la référence avec une accélération de 3x, tout en augmentant le score LiveCodeBench Pass@32 de 59,9% à 66,2% sur des tâches de code complexes.
FLEET atteint la même précision que la référence d'échantillonnage répété, avec une accélération de 3x.
Le score LiveCodeBench Pass@32 passe de 59,9% à 66,2% sous le même budget.
L'approche est déterministe et utilise une seule passe de calibration dans la configuration de décodage glouton.