CONSONANCE.for your information
Thứ Hai, 5 tháng 10, 2026frenvi

Đáng đọc kỹ

01 — evaluation 126 upvote

VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models

CÂU HỎI — How to rigorously benchmark multimodal memory in large audio language models across diverse acoustic evidence types and multi-session conversational histories?

Các tác giả chỉ ra rằng các benchmark hiện tại về hội thoại nói thường bỏ qua thông tin âm thanh chuyên sâu như danh tính người nói hay tín hiệu phi ngôn ngữ, đồng thời giới hạn trong một phiên duy nhất. Họ đề xuất taxonomy gồm các loại bằng chứng âm thanh kết hợp với các thao tác bộ nhớ, từ đó xây dựng benchmark VoxMem với 3,196 trường hợp đánh giá qua 34,743 phiên hội thoại (177 giờ). Khi đánh giá 15 Large Audio Language Models (LALMs) trong các khoảng context từ 8K đến 64K token, kết quả cho thấy không có mô hình nào vượt quá 40% ở mức 32K, đồng thời thể hiện các kiểu lỗi đặc trưng khi xử lý thông tin phi ngữ nghĩa.

VoxMem cung cấp 3,196 evaluation instances trên 34,743 spoken sessions với tổng thời lượng 177 giờ.

Benchmark kiểm tra 4 loại bằng chứng âm thanh kết hợp 4 thao tác bộ nhớ trong context từ 8K đến 64K tokens.

Khi đánh giá 15 LALMs, không có mô hình nào vượt quá 40% ở giới hạn 32K token.

AustinXiao · 26 thg 9, 2026 đọc bản gốc ↗
↑