创建

登录 ReadmeX

或
ReadmeX
ReadmeX

用一次对话,看清重要的事。

快速了解动态,再聊深一点。

社区和关注动态总结只属于你自己。

资讯

字节Seed揭示DeepSeek长上下文相位敏感问题

AI 总结

据DoNews报道,字节跳动Seed团队于2026年9月底在arXiv发布论文,指出分块KV缓存压缩引入的“相位敏感性”,是DeepSeek-V4系列模型长上下文检索性能波动的主因。研究覆盖DeepSeek-V4-Flash、V4-Pro与V4.1-Flash等开放权重模型:压缩窗口带来Token相位坐标,使相同信息在不同相位的检索准确率相差最高40个百分点,形成周期性性能衰减,且容易被平均基准分数掩盖。团队呼吁优化缓存压缩设计,以提升长上下文稳定性。

为什么重要:若该结论成立,评估长上下文模型时不能只看平均分,还需要关注随相位波动的稳定性。

ByteDance SeedDeepSeekDeepSeek-V4-Flash

9
来源原文DoNews · 约 4 分钟读完

首页快讯商业Image 3 消费游戏3C家电汽车文娱Image 4 体育专栏直播专题

APP Image 5

Image 7: user

Image 8: user

首页快讯商业Image 9 消费游戏3C家电汽车文娱Image 10 体育专栏直播专题APP

DoNews>快讯>字节Seed团队揭示DeepSeek模型相位敏感性问题

字节Seed团队揭示DeepSeek模型相位敏感性问题

2026-10-09 09:03:03

5621

分享到

2026年9月底,字节跳动Seed团队在arXiv发布论文,指出分块KV缓存压缩技术引发的‘相位敏感性’是DeepSeek-V4系列模型长上下文检索性能波动的主因。研究覆盖DeepSeek-V4-Flash、V4-Pro及V4.1-Flash等开源模型,发现因压缩窗口引入Token相位坐标,导致相同信息在不同相位下检索准确率差异高达40个百分点。该现象造成周期性性能衰减,易被平均基准分数掩盖。团队呼吁优化缓存压缩设计以提升长上下文稳定性。

免责声明:本文内容由开放的智能模型自动生成,仅供参考。

最新文章

Image 16: 谷歌云发布 Gemini Agent,定位“通用工作智能体” 商业 谷歌云发布 Gemini Agent,定位“通用工作智能体” 谷歌云发布Gemini智能体,定位通用工作AI,支持问答、知识处理、内容生成、编程等,可作个人助理或团队成员,兼容多模型并提供API,现处私有预览。 杨亮 11小时前

Image 17: 尊界回应制动踏板支架底座相关问题:提供免费升级选择 商业 尊界回应制动踏板支架底座相关问题:提供免费升级选择 尊界汽车称制动踏板支架底座无实际断裂故障,但将免费升级该部件并复核设计验证与质量管理,以提升安全冗余。 杨亮 11小时前

Image 18: Biohub牵头打造AI制药数据基建,规模增至18亿美元 商业 Nous Research完成B轮融资,估值15亿美元 Nous Research完成9000万美元B轮融资,估值15亿美元;开源智能体Hermes克隆超2400万次,占全球AI token用量2.5%。 杨亮 13小时前

Image 19: Biohub牵头打造AI制药数据基建,规模增至18亿美元 商业 AI算力初创公司Lambda拟在IPO前最后一轮融资中筹集40亿美元 Lambda拟IPO前融资最多40亿美元,估值145亿美元;黑石与Coatue领投;目标2027年上市;积压订单从6月150亿增至9月500亿美元。 杨亮 13小时前

Image 20: Biohub牵头打造AI制药数据基建,规模增至18亿美元 商业 Mistral AI 发布 Mistral Large 4 模型公开预览版 Mistral AI发布万亿参数多模态模型ML4(le Chonk),支持160+语言,欧盟合规训练,性能达开源SOTA,部分领域超闭源模型。 杨亮 13小时前

Image 21: Biohub牵头打造AI制药数据基建,规模增至18亿美元 商业 OpenAI一次性公开377项AI数学成果 OpenAI发布377项AI生成数学成果,涵盖多领域;响应AGMAI建议,承诺规范发布流程、提升质量与透明度。 杨亮 13小时前

Image 22: Biohub牵头打造AI制药数据基建,规模增至18亿美元 商业 Biohub牵头打造AI制药数据基建,规模增至18亿美元 Biohub扩大18亿美元“虚拟生物学倡议”,联合美能源部、NIH、DeepMind、Isomorphic Labs、Meta及NVIDIA。 杨亮 14小时前

Image 23: Liquid AI 发布 Open d1 系列:3B 模型实现零输出 token 商业 Liquid AI 发布 Open d1 系列:3B 模型实现零输出 token Liquid AI发布零输出token实时决策模型Open d1:d1-3B(多模态)与d1-omni-600M(文本+图像/音频)。 杨亮 14小时前

Image 24

关于我们| 电子协议| 合作联系| 京ICP备2025120072号

网站信息Image 29

Copyright © DoNews 2000-2026 All Rights Reserved
京ICP备2025120072号
联系地址:北京市海淀区宝盛东路兴华绿色产业楼3层307室(东升地区)
邮箱:[email protected]
网上有害信息举报专区: www.12377.cn

Copyright © DoNews 2000-2026 All Rights Reserved
京ICP备2025120072号

Image 30京公网安备11010802023059号

Image 31

Image 32

获取验证码 获取验证码

登录

密码登录 >

验证码登录 >

登录即代表您已阅读同意用户协议和隐私协议

#热门搜索

热门文章

最新文章

推荐文章

阅读原始来源 →

前因后果

  1. 字节Seed揭示长文本性能波动:分块KV缓存相位敏感AIbase AI新闻 · DeepSeek
  2. 大厂举债押注AI:四笔融资近4000亿元36氪 人工智能 · DeepSeek
  3. 报告:中国前沿实验室857次发布仅3.6%附安全结果SemiAnalysis · DeepSeek
  4. 英国ICO获10家AI开发商数据保护承诺The Next Web · DeepSeek
  5. 国产大模型成“产品周期股”,智谱估值随模型发布剧烈波动36氪 人工智能 · DeepSeek
  6. 游戏大厂豪掷872亿投AI,网易腾讯入股DeepSeek钛媒体 · DeepSeek

评论

我用过:分享经验 我怎么看:发表观点
你觉得这条新闻有多重要?还没有评分

还没有评论,来说说你的看法。