Create

Sign in to ReadmeX

or

How we handle your data: Privacy Policy

ReadmeX
ReadmeX

A clearer picture, in a conversation.

Catch up on what matters, then ask a little deeper.

Your community and people briefings stay personal to you.

Story

VoxMem benchmark: audio LLMs score under 40% on multi-session speech memory

AI summary

A team from the University of Melbourne and UNSW proposes VoxMem, a multi-session speech memory benchmark built on an "acoustic evidence × memory operation" framework covering 15 combinations, with 799 questions, 3,196 evaluation instances and 34,743 spoken sessions (about 177 hours). Each question is held constant across 8K–64K token history lengths. Evaluating 15 audio LLMs, the study reports no model topping 40% overall accuracy at 32K (best: Qwen3.8-Omni-Flash at 38.5%), while average accuracy for tracking tone changes and background-sound changes was just 3.4% and 1.2%. Error analysis attributes most failures to locating and retaining acoustic evidence rather than to reasoning.

Why it matters: By separating "what was said" from "who said it, how, and what was audible," it suggests longer context windows alone do not deliver real long-term speech memory.

VoxMemUniversity of MelbourneUNSW

7
Source text新智元 · 12 min read

新智元 2026-10-09 11:55 北京

新智元报道  

在语音助手、多用户共享的家庭助理等长期对话场景中,模型需要跨越多次会话记住用户的信息,但现有评测常遭遇两大难题:

一是语音中的关键信息不止于文字,说话人身份、语气和背景声只存在于音频信号里,转写后即丢失,而现有基准大多只考词汇内容;

二是真实交互分布在相隔一段时间的多个会话中,现有基准却局限于单段录音或单段连续对话,且在不同长度下使用不同题目,无法分离历史长度本身的影响。

为突破这两道关卡,墨尔本大学与新南威尔士大学联合团队提出多会话语音记忆基准VoxMem,以「声学证据×记忆操作」的二维分类法覆盖15种考察组合,并让每道题在8K到64K token的历史长度下保持不变。VoxMem包含3,196个评测实例、34,743个语音会话(约177小时)。对15个音频大模型的评测显示,32K下无一整体准确率超过40%,追踪语气变化和背景声变化的平均准确率仅为3.4%与1.2%。

论文链接:https://arxiv.org/abs/2609.32607

代码链接:https://github.com/swagshaw/voxmem

一句话里

藏着三种文字记不下的信息

设想家里有一台语音助手,同时为一家人服务。某天你随口问它:「我之前说灯具更换那件事,后来怎么样了?」

要答对这个问题,助手得先做一件文字处理不了的事:听出提问的人是你。因为就在几天前,家里另一个人也跟它聊过灯具更换,说的是「已经批准了」;而你当时说的是「先暂停」。

这正是语音和文字最大的不同。会议纪要能记下每个人说了什么,却记不下说话时的犹豫、惊讶,也记不下窗外的施工声。语音转写也是如此:一句话转成文字后,说话人是谁、用什么语气说的、背景里能听到什么,都随之消失。

而这些信息,恰恰可能是之后某个问题的答案。「上次聊入住的时候,我听起来是不是有点不情愿?」「那两次聊喂猫计划的对话,背景里是不是同一台洗衣机的声音?」这类问题,在文字记录里找不到答案。

上下文越来越长

记忆未必跟得上

如今的音频大模型(Large Audio Language Model,LALM)上下文窗口越拉越长,一次能装下几十分钟的音频。直觉上,把所有历史对话都塞进去,模型就能「记住」一切。

但书架变大,不等于能找到那本书。能装下历史,和能在需要时准确取回、正确使用其中的信息,是两回事。

要回答「模型到底记住了多少」,首先需要一把合适的尺子。研究团队梳理了现有的长音频理解基准和语音对话基准,发现它们在三方面都不够用。

第一,考的大多是「说了什么」,只零星涉及少数声学线索,很少系统地考察谁在说、怎么说、周围能听到什么。

第二,记忆操作是临时挑选的。有的基准只考检索,有的考整合,没有统一的框架。于是当模型答错时,很难判断问题出在某类信息、某种操作,还是两者的组合。

第三,它们都建立在一段长录音或一段连续对话之上。真实的语音交互却分布在相隔数天的多次会话中:同一个人反复出现,话题来回切换,早先的计划会被更新。

此外,分析历史长度影响的基准,往往在不同长度档里放的是不同的题。这就像用两套不同的试卷比较成绩,分数下降究竟是因为「内容变多」还是「题变难」,说不清楚。

把「记住什么」和「怎么用」拆开

VoxMem的第一步,是给语音记忆画一张完整的地图。它用两个维度刻画每一道题。

第一个维度是声学证据,即要从过去的语音里记住什么:

  • 语音语义:说了什么,比如计划、数量、偏好;

  • 说话人身份:谁说的,需要把内容和声音对应起来;

  • 副语言线索:怎么说的,比如犹豫、惊讶、强调、语速、笑声;

  • 环境声:说话时周围能听到什么,比如交通声、警报声、家电声。

其中语音语义从文字就能恢复,作为参照;后三类是「音频原生」的,答案不在转写里。

第二个维度是记忆操作,即要怎么使用这些记忆:

  • 信息抽取(IE):从某一次过去的会话中取回信息;

  • 多会话推理(MSR):把几次会话的证据结合起来,比如计数、匹配、比较;

  • 时序演变追踪(TET):追踪某个状态如何随会话变化,比如最近一次是什么语气;

  • 拒答(AR):当历史不足以给出唯一答案时,要能说「无法确定」。

两个维度交叉,得到一张4×4的表。其中「语义×信息抽取」被刻意去掉:如果检索线索和答案都是文字,题目就退化成了纯文本检索,测不出声音与内容之间的关联。剩下的15个格子,就是VoxMem的全部考点。

同一道题

只让历史变长

有了地图,下一步是出题。研究团队在设计上花了很多心思,确保题目「必须用耳朵答」,而且分数的变化能被准确归因。

在海里放假针。每段对话历史由三类会话组成:含有答案的证据会话;话题相近、但不给答案或给出不同取值的干扰会话;以及与问题无关的日常填充会话。

这有点像「大海捞针」的升级版:针不再是一句话,而是一个声音、一种语气或一段背景声,海里还放了长得很像的假针。研究团队专门检验过干扰会话的难度:一个只看文本的分类器区分证据会话和干扰会话,准确率只有51%–56%,与打乱标签时的47%–49%相差无几。

同一句话,录两个版本。用户语音由TTS合成:每位用户在所有会话中固定使用同一个音色,语气通过风格控制注入,环境声按固定信噪比混入。每个带有声学线索的轮次,都会同时保留一个「配对版本」:文字相同、音色相同,只去掉那条线索。这相当于为每条线索准备了一组对照实验,质检时用来确认答案确实由线索决定,而不是由文字决定。

卷子不变,只加页数。每道题都被放进8K、16K、32K、64K四种长度的历史中,大约相当于2.5到20分钟的音频。长历史严格包含短历史的全部会话,只往里增加干扰和填充会话。问题、答案和证据在四个长度下完全相同,分数下降只能归因于历史变长。证据会话和干扰会话在历史中均匀分布,位置和时间戳都不会透露答案在哪里。

为了确认「音频原生题」名副其实,研究团队还做了一个直接的检验:把每个用户轮次换成它的精确文字,其余不变,再让模型作答。结果,音频原生题的准确率从46.2%骤降到4.4%,而语音语义题只从75.9%降到71.0%。也就是说,即使给出完美的转写,这些题也基本答不出来。

此外,每道题还要经过两级质量控制:会话级检查转写是否准确、说话人是否一致、线索能否被听出;题目级检查答案是否唯一、是否真的需要相应的记忆操作和声音信息、整段历史中有没有泄露答案。最终,VoxMem包含799道题、3,196个评测实例、34,743个语音会话,约177小时音频,覆盖20类日常话题。

15个模型

没有一个超过40%

研究团队评测了15个音频大模型,其中5个闭源(3个Gemini、2个Qwen),10个开源,覆盖音频专用和全模态两类架构。所有模型使用相同的输入和指令,回答由LLM裁判按答案类型判分,换用另一个模型复判的一致性κ达到0.95。

第一个结论很直接:在32K长度下,没有一个模型的整体准确率超过40%。排名第一的Qwen3.8-Omni-Flash为38.5%,闭源模型平均33.0%,开源模型平均21.9%。低分并不集中在少数模型上,而是普遍现象。

按证据类型拆开看,差距更加明显。32K下,闭源模型在语音语义上平均55.6%,在说话人身份、副语言、环境声上则分别只有32.7%、20.0%和21.9%。开源模型对应为31.6%、26.7%、14.5%和15.5%。

换句话说,模型在「说了什么」上的成绩,掩盖了它们在声音本身上的大量失败。

说出口的变化记得住

没说出口的几乎全忘

把四种操作和四类证据交叉起来,能看到更细的结构。

一个反直觉的发现是:跨多次会话做推理,并不一定比从单次会话中找信息更难。多会话推理在语义和说话人身份上分别达到41.8%和43.1%,在副语言和环境声上也有26.7%和25.2%,明显高于对应的信息抽取(8.8%和13.5%)。

反差最大的是时序追踪。如果状态的变化是说出口的,比如「入住改到周二了」,15个模型平均能追到44.5%;在说话人身份上降至20.0%;而当变化只体现在声音里,比如这次语气变了、背景声换了,准确率几乎归零:语气变化3.4%,背景声变化1.2%。

论文认为,问题不在于模型不会做时间推理,而在于它们很难维护和更新由语气或环境声承载的「状态」,这可能反映了当前音频大模型在状态建模上的不足。

拒答率更高

不等于更「谨慎」

VoxMem还专门设计了「证据不足、应该拒答」的题。这些题由可答题派生而来,比如删掉关键的证据会话,或者保留文字、只去掉能锁定答案的那条声学线索。

有意思的是,模型在副语言和环境声题上的拒答准确率(34.3%和34.2%),反而高于语义和说话人题(19.9%和16.2%),与可答题的规律正好相反。

这并不说明模型在声学问题上更「谨慎」。论文的解读是:模型拒答往往不是因为判断出证据缺失,而是因为即使证据就在那里,它也难以识别和使用声学信息。

越聊越忘

但忘的方式不一样

由于题目和证据固定不变,VoxMem可以干净地观察「历史变长」这一个因素的影响。

从8K到32K,闭源模型平均准确率从40.1%降到33.0%,开源模型从26.6%降到21.9%。在能处理完整64K历史的10个模型上,四类证据都在持续下降。到64K时,模型在语义上保留了8K时70.3%的准确率,副语言为69.8%,说话人为66.5%,环境声只有63.2%。

值得注意的是,副语言的绝对准确率最低,衰减速度却和语义差不多;说话人和环境声则衰减得最快。这说明「基线低」和「对长度敏感」是两种不同的失败:模型在任何长度下都很难处理语气信息,而说话人和环境声的记忆,则是随着历史增长被逐渐侵蚀。

错在哪一步?

多数在「听进去」之前

准确率告诉我们模型错了,错误分析则试图回答错在哪里。研究团队按一次记忆查询可能失败的先后顺序,把64K下的错误回答分成几类:没找到证据(识别或定位失败);找到了,但挂错了人或会话(绑定错误);找到也挂对了,但操作做错了(操作执行错误);以及答出了历史里根本没有的内容(无依据答案)。

结果显示,三类声学信息的「病因」各不相同。说话人题的错误有48%是绑定错误:内容记对了,却记到了别人头上,或挂错了会话。副语言题的错误有63%是定位失败:答案所需的语气线索根本没被找回来。环境声题的错误则分布在定位失败(41%)和无依据答案(39%)之间。

论文附录记录了几个典型案例。一道说话人计数题的正确答案是2,某开源模型却回答10:历史里有10次会话聊过这个话题,但只有2次满足题目要求的说话人条件,模型数的是话题,不是说话人。另一道环境声题中,证据会话的背景声是引擎声和母鸡叫,某闭源模型却编出了「厨房清洁声」的分组和计数。

从操作看,时序追踪的错误有55%是定位失败,操作执行错误只占5%。在全部被归因的错误中,「证据找到了、也绑定对了、只是操作出错」的情况仅占8.4%。这意味着,当前音频大模型在语音记忆上的瓶颈,大多不在「想」,而在「听进去并记住」。

结语

过去几年,音频大模型的进步有目共睹:能听懂指令、能流畅对话、能处理越来越长的音频。但当语音助手从一问一答走向长期陪伴,它面对的不再是一段孤立的录音,而是跨越数天乃至数周的交互历史。

VoxMem的结果表明,只把上下文窗口拉长,并不足以带来真正的长期记忆。模型对「说了什么」的记忆远好于对「谁说的、怎么说的、听到了什么」的记忆;只有当变化被说出口时,它们才能较可靠地追踪;历史越长,已有的证据越难取回。

论文指出,未来的系统需要保留文字之外的声学信息,并在时间上维护它与说话人、事件和会话之间的关联。VoxMem希望为衡量和推动这一方向的进展,提供一个系统化的基础。

参考资料:

https://arxiv.org/abs/2609.32607

编辑:LRST

秒追ASI

⭐点赞、转发、在看一键三连⭐

点亮星标,锁定新智元极速推送!

跳转微信打开

Read the original →

How we got here

  1. GMI Cloud opens free week for Qwen3.8-Max, Qwen3.8-Flash and Wan3.0Qwen (X) · Qwen
  2. Google's Gemini agent can route work between Gemini and Claude虎嗅 AI · Gemini
  3. China's tech giants raise ~$56B in debt and equity to pre-buy AI capacity36氪 人工智能 · Qwen
  4. Goodfire launches inside-out monitors for AI agentsTechCrunch AI · Gemini
  5. Google Maps' Ask Maps may soon let you share conversation links, and could be renamed AskAndroid Authority · Gemini
  6. Comfy Desktop simplifies running local AI modelsTechSpot · Qwen

Comments

I've used this: share my experience What I think: share my view
How important is this story?No ratings yet

No comments yet. Start the conversation.