CONSONANCE.for your information
lundi 5 octobre 2026frenvi

À lire de près

01 — evaluation 126 votes

VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models

QUESTION — Comment évaluer rigoureusement la mémoire multimodale dans les grands modèles de langage audio à travers divers types de preuves acoustiques et historiques de conversation multi-sessions ?

Les auteurs soutiennent que les benchmarks actuels de conversation vocale ignorent les preuves acoustiques non lexicales et l'historique multi-sessions. Ils proposent une taxonomie combinant types de preuves acoustiques et opérations de mémoire, et introduisent VoxMem : 3 196 instances d'évaluation sur 34 743 sessions parlées (177 heures) avec des budgets de contexte de 8K à 64K tokens. En évaluant 15 grands modèles de langage audio (LALMs), ils constatent qu'aucun modèle ne dépasse 40 % à 32K, et que les modèles peinent à retenir l'identité des locuteurs et les indices paralinguistiques.

VoxMem comprend 3 196 instances d'évaluation sur 34 743 sessions vocales totalisant 177 heures.

Le benchmark croise quatre types de preuves acoustiques avec quatre opérations de mémoire pour des contextes de 8K à 64K tokens.

En évaluant 15 LALMs, aucun modèle ne dépasse 40 % de précision à 32K tokens.

AustinXiao · 26 sept. 2026 lire l'original ↗
↑