VoxMem:音频大模型 32K 上下文准确率低于 40%
墨尔本大学与新南威尔士大学联合团队发布音频大模型记忆基准 VoxMem,用「声学证据 × 记忆操作」二维分类法覆盖 15 种组合,含 3196 个评测实例、34743 个语音会话、约 177 小时音频。团队在 8K 至 64K 的不同历史长度下保持题目不变,只改变对话长度以隔离记忆变量。对 15 个主流音频大模型的测试显示,32K 上下文下所有模型整体准确率均未超过 40%,且对说话人身份、语气情绪与环境声的记忆明显弱于对文字语义的记忆,随长度增加各类准确率持续下降。
为什么重要:它把语音模型的评测从「转写对不对」推进到「记不记得谁、用什么语气、在什么环境里说了什么」,为长对话语音助手的能力评估提供了更细的标尺。
音频大模型记不住谁在说话?墨大新基准VoxMem揭穿:32K上下文下全员不及格
![]()
AIbase基地
发布于AI新闻资讯 · 1 分钟阅读 · Oct 9, 2026
2
当语音AI被拉进一场长达数小时、横跨几十轮的真实对话,它到底能不能记住"这句话是谁说的、用什么样的语气、背景里有什么声音"?墨尔本大学与新南威尔士大学的联合团队觉得,现有的评测根本答不了这个问题,于是端出了专门戳这块软肋的基准VoxMem。
他们先点破了旧评测的两道硬伤:一是只盯着转写出来的文字内容,把声音里藏着的身份信息、情绪线索、环境声一股脑丢掉;二是没法把"历史有多长"这个变量单独剥离出来看,于是模型表现差,到底是记性差还是被长度拖垮的,谁也说不清。VoxMem的打法是建一套"声学证据 × 记忆操作"的二维分类法,把考察维度正交拆开,覆盖15种组合,而且所有题目在8K到64K的不同历史长度下保持原样不动——等于只拧"对话长度"这一颗旋钮,其余全锁死,让记忆效果的变化能干净地归因到长度上。
这套基准的体量不轻:共3196个评测实例、34743个语音会话,合计约177小时音频,足以模拟一场漫长的多轮交谈。而对15个主流音频大模型的实测结果,相当打脸。在32K上下文长度下,所有模型的整体准确率都没能越过40%这条线。更值得玩味的是偏科方向:模型对"说了什么"的语义记忆,明显强过对说话人身份、副语言线索(语气、情绪)和环境声这三类声音原生信息的记忆;尤其追踪语气起伏、背景声变化的准确率极低,基本处于抓瞎状态。而且随着历史长度往上加,各类信息的记忆准确率全在往下掉。
团队据此下了个判断:当前音频大模型的语音记忆瓶颈,主要卡在"识别、定位、把信息关联绑定"这几个环节,而不是推理操作本身——换句话说,模型不是不会想,而是连"谁在什么时候、以什么方式说了什么"这种底层事实都没接稳,上层推理自然无从谈起。VoxMem这套基准,等于给语音AI量体温时换了一支更细的体温计,逼着业界正视一个长期被文字转写掩盖的事实:听得懂词,不等于记得住人、语气和整个世界。
本文来自AIbase日报
扫码查看
欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。
—— 由AIbase 日报组创作
© 版权所有 AIbase基地 2024, 点击查看来源出处 - http://www.aibase.com/zh/news/31510
相关AI新闻推荐
## OpenAI 预计年底年化收入超 700 亿,企业业务成核心增长引擎 OpenAI最新预测显示,在企业级业务强劲拉动下,到2026年底年化收入将达或超700亿美元。此前市场传其9月底年化收入仅500亿美元,引发投资人对AI回报率担忧,拖累美股科技板块下跌;最新数据回升市场信心。不过,公司仍面临资本与盈利双重挑战,营收高速扩张伴随巨大现金消耗压力,预计到2030年累计…… 2026年10月9号 16:56 100
## AI日报:谷歌云发布通用Gemini智能体;豆包App上线生活缴费功能;快手发布“AI魔改”视频治理公告 欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。新鲜AI产品点击了解:https://app.aibase.com/zh1、谷歌云重磅发布通用Gemini智能体,可自主拆解并执行复杂多步骤任务谷歌云在“GeminiatWork2026”大会上正式推出全新的Gemini智能体,该产品作为通用工作智能体,能够通过一站式界面彻底改变企业的日常协作与生产力模式。8、一张无限画布装下所有创作:豆包工作上新,图片、视频、HTML自动汇入同一画布豆包工作推出双线更新,新增画布功能并接入Seedream5.0Flash图片模型,同时发布豆包2.1Lite模型,提升办公效率和多模态生成能力。 2026年10月9号 16:37 10
## 谷歌云重磅发布Gemini Agent,全面杀入企业级AI办公赛道 近日,谷歌云在2026 Gemini at Work大会上正式发布企业级通用智能体Gemini Agent,全面进军AI办公赛道。该产品定位“数字同事”,支持用户以自然语言输入目标,系统可在云端自主拆解任务、调用企业分散数据,并编写运行代码,具备高度自主执行能力,旨在提升企业办公自动化与效率。 2026年10月9号 16:05 120
## Anthropic 携手天文学家,Claude AI 填补空白打造首张全天紫外地图 天体物理学家Brice Ménard与Anthropic合作,借助AI科研工具Claude Science,绘制出人类首张完整全天紫外地图。该成果填补长期紫外天文观测数据空白,标志AI在科研应用上的突破。此前受大气吸收和探测设备限制,约三分之一天空未被紫外望远镜完整观测,研究团队利用大模型处理海量数据,预测并补全观测缺口。 2026年10月9号 15:50 30
## 快手发布“AI魔改”视频治理公告:9月处置违规内容2544条,重点整治四大名著乱改 快手安全中心10月8日发布“AI魔改”视频专项治理公告,称9月处置违规内容2544条。治理重点为将《西游记》《红楼梦》等经典影视人物不当婚恋关联,或与热门游戏角色跨时空互动。此举标志生成式AI二创平台合规审查加码。近期“圣黛CP”等AI视频走红,但其过度娱乐化倾向引发关注。 2026年10月9号 15:37 70
## Anthropic重磅推出OSS Scanner,用最强AI模型为全球开源软件免费扫漏洞 Anthropic 10月8日宣布推出可选接入型漏洞检测服务 OSS Scanner,将利用旗下最强 AI 模型(包括 Claude Mythos),为全球开源软件提供定期、免费的安全扫描。符合条件的基础开源项目核心维护者,按标准项目模板向 OSS Scanner 的 GitHub 仓库提交拉取请求即可申请接入。该服务聚焦开源生态漏洞检测,整体审核标准类…… 2026年10月9号 14:43 200
## JetBrains 发布编程 AI 模型 Mellum2.1,高负载吞吐量超越竞品两倍 JetBrains发布全新Mellum2.1编程AI模型,重点增强智能体编程能力。该模型延续12B混合专家架构与开源协议,降低企业与个人开发者私有化部署门槛。训练上,强化学习从短期收尾扩展为核心训练主体,并在数百万沙盒环境中针对软件工程与算法完成专项强化。 2026年10月9号 14:28 250
## 一网打尽全家AI需求?微软或允许Microsoft365家庭成员共用Copilot额度 微软据称正酝酿调整Copilot权益分发,拟取消仅限主订阅者独用限制,允许Microsoft 365 Family和Premium主订阅者将Copilot及AI功能分享给最多五名家庭成员。据Neowin报道,调整后主订阅者还可管理未成年家庭成员的AI访问权限。目前微软官方支持页面仍规定该功能归主订阅者。 2026年10月9号 14:04 170
## 美民调称 64% 民众指 AI 发展过快,近八成要求政府确保安全可控 最新民调显示,美国民众对AI快速发展的担忧已跨越党派。绝大多数人认为政府应优先确保AI处于人类控制之下,并加强劳动者保护。64%受访者认为AI发展过快,仅少数认为节奏合适或过慢。对AI可能脱离人类控制的风险担忧正推动监管诉求,成为公共政策核心议题,多名前沿科技企业高管也呼吁加强治理。 2026年10月9号 14:00 170
## 谷歌 Gemini 4 Argon 突袭开放,AI 或将直接代替程序员提交代码 谷歌下一代AI模型Gemini 4 Argon密集现身多平台,已向部分Pro用户开放,并接入Google Cloud等生态。它在编程工具Antigravity中设为默认模型,还能直接向真实代码库提交代码。该模型具备高级智能体特征,与传统代码补全工具不同,可像独立员工一样参与开发,或推动开发范式变革。 2026年10月9号 13:46 160
前因后果
- VoxMem:音频大模型跨会话语音记忆普遍不及格新智元 · VoxMem