VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models
Les auteurs soutiennent que les benchmarks actuels de conversation vocale ignorent les preuves acoustiques non lexicales et l'historique multi-sessions. Ils proposent une taxonomie combinant types de preuves acoustiques et opérations de mémoire, et introduisent VoxMem : 3 196 instances d'évaluation sur 34 743 sessions parlées (177 heures) avec des budgets de contexte de 8K à 64K tokens. En évaluant 15 grands modèles de langage audio (LALMs), ils constatent qu'aucun modèle ne dépasse 40 % à 32K, et que les modèles peinent à retenir l'identité des locuteurs et les indices paralinguistiques.
VoxMem comprend 3 196 instances d'évaluation sur 34 743 sessions vocales totalisant 177 heures.
Le benchmark croise quatre types de preuves acoustiques avec quatre opérations de mémoire pour des contextes de 8K à 64K tokens.
En évaluant 15 LALMs, aucun modèle ne dépasse 40 % de précision à 32K tokens.