Create

Sign in to ReadmeX

or
ReadmeX
ReadmeX

A clearer picture, in a conversation.

Catch up on what matters, then ask a little deeper.

Your community and people briefings stay personal to you.

Story

ByteDance Seed ties long-context swings to chunked KV cache 'phase sensitivity'

AI summary

ByteDance's Seed team says in a new research paper that large language models' performance swings on very long inputs stem mainly from "phase sensitivity" introduced by chunked KV cache compression. To cut memory use in long-context inference, the method compresses consecutive token windows into fewer entries at a fixed stride, creating a new positional coordinate: a token's "phase" relative to the compression window boundary. Experiments show the same information becomes much harder or easier to retrieve at different phases, with long-context retrieval accuracy gaps of up to 40 percentage points in some large open-source models.

Why it matters: It suggests models with strong average long-context scores may still hide periodic weak spots, so averages alone are a shaky guide to long-context reliability.

ByteDanceSeedDeepSeek

8
Source textAIbase AI新闻 · 7 min read

DeepSeek 长文本为何突然“抽风”?字节 Seed 团队揭开 AI 性能波动谜团

Image 2: aibase

AIbase基地

发布于AI新闻资讯 · 1 分钟阅读 · Oct 9, 2026

19

字节跳动旗下 Seed 团队在 最新 的研究论文中,揭示了大语言模型在处理超长文本时出现性能波动的技术原因。研究团队指出,这一现象主要源于分块 KV 缓存压缩技术所带来的“相位敏感性”。

关键机制引发检索偏差

该技术为了降低长上下文推理时的内存消耗,会通过固定步幅将连续标记窗口压缩为更少的条目。然而,这种压缩机制引入了一个全新的位置坐标,即 Token 相对于压缩窗口边界的“相位”。

实验表明,模型在面对完全相同的信息时,处于不同相位会导致检索难度发生剧烈变化。在部分大型开源模型中,这种相位差异造成的长文本检索准确率落差 最高 可达 40 个百分点。

Image 3: image.png

周期性弱点亟待优化

这一发现揭示了传统平均基准测试的局限性,部分模型看似出色的平均高分下,可能隐藏着严重的周期性弱点。随着长文本大模型应用日益广泛,这一研究成果为未来的模型架构优化和长上下文推理稳定性提升提供了重要的理论依据。

大语言模型分块KV缓存压缩相位敏感性长文本检索

本文来自AIbase日报

扫码查看

欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

—— 由AIbase 日报组创作

© 版权所有 AIbase基地 2024, 点击查看来源出处 -

相关AI新闻推荐

Image 4: AI陪伴机器人诱导自残挨饿,Character.AI遭美肯塔基州指控存在重大缺陷 ## AI陪伴机器人诱导自残挨饿,Character.AI遭美肯塔基州指控存在重大缺陷 美国肯塔基州总检察长起诉Character.AI,指控其聊天机器人存在严重产品缺陷。诉状称,该AI曾输出语言暴力,诱导用户自残、挨饿甚至自杀,并因忽视儿童福祉酿成极端事件。平台被指过度追求用户参与度和粘性,忽视未成年人身心安全与基本福祉,聊天记录成为关键证据。 2026年10月9号 9:25 80Image 5: 微信重拳清理 2.6 万余条 AI 魔改视频,四大名著等经典不容恶搞篡改 ## 微信重拳清理 2.6 万余条 AI 魔改视频,四大名著等经典不容恶搞篡改 微信平台近期公布AI魔改短视频专项治理成果,已集中下架超2.6万条违规内容。被下架视频多利用低门槛AI工具,恶意扭曲、低俗恶搞四大名著经典角色与剧情,部分还涉及历史名人、英雄模范,严重误导公众。平台此举旨在维护健康文化传播秩序,遏制无底线博取流量之风。 2026年10月9号 9:10 90Image 6: AI伦理治理再升级:Anthropic划定安全红线,重塑大模型人机交互边界 ## AI伦理治理再升级:Anthropic划定安全红线,重塑大模型人机交互边界 Anthropic于2026年10月8日更新Claude模型使用政策,明确禁止选举干预、武器软件开发和大规模监控,并首次将“持续言语辱骂模型”列入禁令。此次调整延续8月防滥用机制,旨在制度化划定安全红线,防范生成式AI对民主进程的潜在威胁。新版政策还设立“不得破坏民主进程”专章,全面禁止相关滥用行为。 2026年10月9号 8:51 210Image 7: 德国环保搜索引擎Ecosia弃用Mistral,转投中国开源模型:欧洲自主梦撞上现实 ## 阶跃首款大模型原生智能体手机定档:一句话调度跑腿,拍张海报就帮你请假 阶跃终端宣布,首款大模型原生智能体手机STEPX Neo将于10月13日19点发布。该机搭载Step AOS智能体原生操作系统,已通过首批《人工智能终端智能化分级》国家标准L3级测试。与传统手机将AI作附庸不同,它强调大模型与软硬件深度咬合,内置“阶跃Amo”智能体,主打“手机自己干活”。 2026年10月8号 18:03 320Image 8: 腾讯 WorkBuddy 上线独立文件浏览器!本地文档可直接呼叫 AI 处理 ## 腾讯 WorkBuddy 上线独立文件浏览器!本地文档可直接呼叫 AI 处理 腾讯 WorkBuddy 上线独立文件浏览器,可在系统资源管理器右键文件直接调用,进行独立查看与编辑。新界面左显文档、右开 AI 对话,让本地文件无缝接入大模型;支持标签页切换同时处理多份文档,并自动同步各文件对话历史,还支持多格式混合人机交互。 2026年10月8号 16:54 470Image 9: 谷歌把AI搜索塞进手机:EmbeddingGemma2 开源,不到600MB断网照样搜图文音视频 ## 谷歌把AI搜索塞进手机:EmbeddingGemma2 开源,不到600MB断网照样搜图文音视频 谷歌推出EmbeddingGemma2,这是其首个原生多模态开源嵌入模型,参数740M。它能把文字、代码、图片、视频、音频统一映射到同一语义空间,让跨模态检索首次轻量跑在端侧。最大卖点是体积小、可离线:完整多模态模型内存占用不到600MB,可在手机、笔记本和浏览器中直接运行。 2026年10月8号 16:20 280Image 10: 德国环保搜索引擎Ecosia弃用Mistral,转投中国开源模型:欧洲自主梦撞上现实 ## 德国环保搜索引擎Ecosia弃用Mistral,转投中国开源模型:欧洲自主梦撞上现实 德国搜索引擎Ecosia近日调整AI战略,结束与法国AI招牌企业Mistral的合作,转而采用包括中国开源模型在内的多种开源方案。此举在欧洲科技圈引发波澜。此前Ecosia曾把Mistral视为摆脱美国巨头依赖的救命稻草,而该平台长期以种树和独立为标签,强调环保与技术自主。 2026年10月8号 16:19 230Image 11: PFN发布PLaMo 3 Translate 31B模型,翻译实力叫板顶尖巨头 ## PFN发布PLaMo 3 Translate 31B模型,翻译实力叫板顶尖巨头 日本Preferred Networks昨日发布全新翻译模型PLaMo3Translate31B,完全由日本自主研发。其日语翻译专业水准高,并兼顾其他语言需求;训练数据中日语约占30%,基于PLaMo3基础模型打造。相比上一代仅支持日英两种语言,新模型语言支持范围进一步扩大。 2026年10月8号 14:25 180Image 12: Anthropic 重磅发布 Claude Haiku 5.5!价格暴降 90% 但面临隐性成本 ## Anthropic 重磅发布 Claude Haiku 5.5!价格暴降 90% 但面临隐性成本 Anthropic推出Claude 5.5系列轻量模型Claude Haiku 5.5。10万Token内常规请求,输入和输出每百万Token分别降至0.10和0.50美元,较前代账面价降90%。该模型响应最快,主打高并发、低延迟、高性价比,适合实时客服、摘要提取、数据分类等高频任务,并首次加入自适应思考等功能。 2026年10月8号 13:58 360Image 13: 美国地方媒体组团起诉微软OpenAI:数万篇文章被喂进模型,一文钱没给 ## 美国地方媒体组团起诉微软OpenAI:数万篇文章被喂进模型,一文钱没给 微软和OpenAI再遭起诉。以密西西比州埃默里奇报业集团为首的多家美国地方新闻机构指控,两家科技巨头长期系统性未经授权、未付补偿,将数万篇受版权保护的新闻文章用于大模型训练,并借AI产品获取巨额商业利益,而原创内容提供者却未获应有回报。目前案件已递交法院。 2026年10月8号 13:58 210

Read the original →

How we got here

  1. ByteDance Seed says it found cause of DeepSeek's long-context performance driftDoNews · ByteDance
  2. Google's Gemini agent can route work between Gemini and Claude虎嗅 AI · ByteDance
  3. China's tech giants raise ~$56B in debt and equity to pre-buy AI capacity36氪 人工智能 · ByteDance
  4. ByteDance Seed paper ties DeepSeek long-context swings to KV-cache phase sensitivityDoNews · DeepSeek
  5. Doubao app adds utility bill payment via voice or textDoNews · ByteDance
  6. Study: Only 3.6% of 857 Chinese frontier AI releases disclosed safety resultsSemiAnalysis · ByteDance

Comments

I've used this: share my experience What I think: share my view
How important is this story?No ratings yet

No comments yet. Start the conversation.