VoxMem benchmark: audio LLMs all fall below 40% accuracy at 32K context
A joint team from the University of Melbourne and UNSW released VoxMem, an audio-LLM memory benchmark built on an "acoustic evidence × memory operation" taxonomy covering 15 combinations, 3,196 evaluation instances, 34,743 speech sessions and roughly 177 hours of audio. Questions are held constant across 8K–64K history lengths so only conversation length varies. Across 15 mainstream audio models, overall accuracy stayed below 40% at 32K context; memory for speaker identity, paralinguistic cues such as tone and emotion, and environmental sound lagged clearly behind semantic recall of what was said, and all categories degraded as history grew.
Why it matters: It shifts speech-model evaluation from transcription accuracy toward whether a model remembers who said what, in what tone and setting — a finer gauge for long-conversation voice assistants.
音频大模型记不住谁在说话?墨大新基准VoxMem揭穿:32K上下文下全员不及格
![]()
AIbase基地
发布于AI新闻资讯 · 1 分钟阅读 · Oct 9, 2026
2
当语音AI被拉进一场长达数小时、横跨几十轮的真实对话,它到底能不能记住"这句话是谁说的、用什么样的语气、背景里有什么声音"?墨尔本大学与新南威尔士大学的联合团队觉得,现有的评测根本答不了这个问题,于是端出了专门戳这块软肋的基准VoxMem。
他们先点破了旧评测的两道硬伤:一是只盯着转写出来的文字内容,把声音里藏着的身份信息、情绪线索、环境声一股脑丢掉;二是没法把"历史有多长"这个变量单独剥离出来看,于是模型表现差,到底是记性差还是被长度拖垮的,谁也说不清。VoxMem的打法是建一套"声学证据 × 记忆操作"的二维分类法,把考察维度正交拆开,覆盖15种组合,而且所有题目在8K到64K的不同历史长度下保持原样不动——等于只拧"对话长度"这一颗旋钮,其余全锁死,让记忆效果的变化能干净地归因到长度上。
这套基准的体量不轻:共3196个评测实例、34743个语音会话,合计约177小时音频,足以模拟一场漫长的多轮交谈。而对15个主流音频大模型的实测结果,相当打脸。在32K上下文长度下,所有模型的整体准确率都没能越过40%这条线。更值得玩味的是偏科方向:模型对"说了什么"的语义记忆,明显强过对说话人身份、副语言线索(语气、情绪)和环境声这三类声音原生信息的记忆;尤其追踪语气起伏、背景声变化的准确率极低,基本处于抓瞎状态。而且随着历史长度往上加,各类信息的记忆准确率全在往下掉。
团队据此下了个判断:当前音频大模型的语音记忆瓶颈,主要卡在"识别、定位、把信息关联绑定"这几个环节,而不是推理操作本身——换句话说,模型不是不会想,而是连"谁在什么时候、以什么方式说了什么"这种底层事实都没接稳,上层推理自然无从谈起。VoxMem这套基准,等于给语音AI量体温时换了一支更细的体温计,逼着业界正视一个长期被文字转写掩盖的事实:听得懂词,不等于记得住人、语气和整个世界。
本文来自AIbase日报
扫码查看
欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。
—— 由AIbase 日报组创作
© 版权所有 AIbase基地 2024, 点击查看来源出处 - http://www.aibase.com/zh/news/31510
相关AI新闻推荐
## OpenAI 预计年底年化收入超 700 亿,企业业务成核心增长引擎 OpenAI最新预测显示,在企业级业务强劲拉动下,到2026年底年化收入将达或超700亿美元。此前市场传其9月底年化收入仅500亿美元,引发投资人对AI回报率担忧,拖累美股科技板块下跌;最新数据回升市场信心。不过,公司仍面临资本与盈利双重挑战,营收高速扩张伴随巨大现金消耗压力,预计到2030年累计…… 2026年10月9号 16:56 100
## AI日报:谷歌云发布通用Gemini智能体;豆包App上线生活缴费功能;快手发布“AI魔改”视频治理公告 欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。新鲜AI产品点击了解:https://app.aibase.com/zh1、谷歌云重磅发布通用Gemini智能体,可自主拆解并执行复杂多步骤任务谷歌云在“GeminiatWork2026”大会上正式推出全新的Gemini智能体,该产品作为通用工作智能体,能够通过一站式界面彻底改变企业的日常协作与生产力模式。8、一张无限画布装下所有创作:豆包工作上新,图片、视频、HTML自动汇入同一画布豆包工作推出双线更新,新增画布功能并接入Seedream5.0Flash图片模型,同时发布豆包2.1Lite模型,提升办公效率和多模态生成能力。 2026年10月9号 16:37 10
## 谷歌云重磅发布Gemini Agent,全面杀入企业级AI办公赛道 近日,谷歌云在2026 Gemini at Work大会上正式发布企业级通用智能体Gemini Agent,全面进军AI办公赛道。该产品定位“数字同事”,支持用户以自然语言输入目标,系统可在云端自主拆解任务、调用企业分散数据,并编写运行代码,具备高度自主执行能力,旨在提升企业办公自动化与效率。 2026年10月9号 16:05 120
## Anthropic 携手天文学家,Claude AI 填补空白打造首张全天紫外地图 天体物理学家Brice Ménard与Anthropic合作,借助AI科研工具Claude Science,绘制出人类首张完整全天紫外地图。该成果填补长期紫外天文观测数据空白,标志AI在科研应用上的突破。此前受大气吸收和探测设备限制,约三分之一天空未被紫外望远镜完整观测,研究团队利用大模型处理海量数据,预测并补全观测缺口。 2026年10月9号 15:50 30
## 快手发布“AI魔改”视频治理公告:9月处置违规内容2544条,重点整治四大名著乱改 快手安全中心10月8日发布“AI魔改”视频专项治理公告,称9月处置违规内容2544条。治理重点为将《西游记》《红楼梦》等经典影视人物不当婚恋关联,或与热门游戏角色跨时空互动。此举标志生成式AI二创平台合规审查加码。近期“圣黛CP”等AI视频走红,但其过度娱乐化倾向引发关注。 2026年10月9号 15:37 70
## Anthropic重磅推出OSS Scanner,用最强AI模型为全球开源软件免费扫漏洞 Anthropic 10月8日宣布推出可选接入型漏洞检测服务 OSS Scanner,将利用旗下最强 AI 模型(包括 Claude Mythos),为全球开源软件提供定期、免费的安全扫描。符合条件的基础开源项目核心维护者,按标准项目模板向 OSS Scanner 的 GitHub 仓库提交拉取请求即可申请接入。该服务聚焦开源生态漏洞检测,整体审核标准类…… 2026年10月9号 14:43 200
## JetBrains 发布编程 AI 模型 Mellum2.1,高负载吞吐量超越竞品两倍 JetBrains发布全新Mellum2.1编程AI模型,重点增强智能体编程能力。该模型延续12B混合专家架构与开源协议,降低企业与个人开发者私有化部署门槛。训练上,强化学习从短期收尾扩展为核心训练主体,并在数百万沙盒环境中针对软件工程与算法完成专项强化。 2026年10月9号 14:28 250
## 一网打尽全家AI需求?微软或允许Microsoft365家庭成员共用Copilot额度 微软据称正酝酿调整Copilot权益分发,拟取消仅限主订阅者独用限制,允许Microsoft 365 Family和Premium主订阅者将Copilot及AI功能分享给最多五名家庭成员。据Neowin报道,调整后主订阅者还可管理未成年家庭成员的AI访问权限。目前微软官方支持页面仍规定该功能归主订阅者。 2026年10月9号 14:04 170
## 美民调称 64% 民众指 AI 发展过快,近八成要求政府确保安全可控 最新民调显示,美国民众对AI快速发展的担忧已跨越党派。绝大多数人认为政府应优先确保AI处于人类控制之下,并加强劳动者保护。64%受访者认为AI发展过快,仅少数认为节奏合适或过慢。对AI可能脱离人类控制的风险担忧正推动监管诉求,成为公共政策核心议题,多名前沿科技企业高管也呼吁加强治理。 2026年10月9号 14:00 170
## 谷歌 Gemini 4 Argon 突袭开放,AI 或将直接代替程序员提交代码 谷歌下一代AI模型Gemini 4 Argon密集现身多平台,已向部分Pro用户开放,并接入Google Cloud等生态。它在编程工具Antigravity中设为默认模型,还能直接向真实代码库提交代码。该模型具备高级智能体特征,与传统代码补全工具不同,可像独立员工一样参与开发,或推动开发范式变革。 2026年10月9号 13:46 160
How we got here