创建

登录 ReadmeX

或

了解我们如何处理你的信息: 隐私政策

ReadmeX
ReadmeX

用一次对话,看清重要的事。

快速了解动态,再聊深一点。

社区和关注动态总结只属于你自己。

资讯

联想TianxiCode登顶SWE-bench-Live

AI 总结

联想天禧AI自研的代码智能体框架TianxiCode在SWE-bench-Live(Lite分榜)上以71%的问题解决率位列第一,并通过官方Verified核验。据联想提供的稿件,该成绩由TianxiCode搭配DeepSeek-v4.1-Flash取得,框架具备跨文件多跳检索、自主规划与多轮工具调用、闭环补丁生成与测试驱动自愈等能力。联想表示未来会把TianxiCode应用到其AI硬件产品中。

为什么重要:若成绩可复现,说明在真实代码修复任务中,智能体框架的工程设计可能与底层模型能力同样关键。

LenovoTianxi AITianxiCode

7
来源原文量子位(原生 RSS) · 约 4 分钟读完

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-10-09 16:53:08 来源:量子位

联想天禧AI自主研发的专业代码智能体框架TianxiCode 以71%的问题解决率登顶全球第一名

近日,在国际公认难度最高、最贴近真实开发环境的软件工程评测SWE-bench-Live(Lite分榜)中,由联想天禧AI自主研发的专业代码智能体框架TianxiCode配合DeepSeek-v4.1-Flash取得突破性成绩:以**71%**的问题解决率登顶全球第一名,并正式通过官方审核。

Image 1

这一成绩不仅标志着联想自研代码智能体框架迈入国际第一梯队,更展现出天禧AI生态以自研工程架构驱动模型潜能、在复杂软件工程竞技场抗衡全球顶尖方案的硬核实力。Tianxi Code 是联想天禧AI聚焦代码生成、工程开发的代码智能子能力,未来将应用到联想 AI 硬件产品中。

服务真实场景,SWE-bench-Live的含金量有多少?

不同于考查简单语法或单函数生成的传统代码测试,SWE-bench-Live是当前全球软件工程领域的权威性动态评测基准。

SWE-bench-Live以真实GitHub项目中的问题为基础,评估模型与智能体生成代码补丁、修复问题的能力,并提供可复现的执行环境。相较于单纯考查代码片段生成,这类评测更贴近真实开发中的问题处理过程,对系统理解代码、定位问题和完成修复提出了综合要求。

为了确保评测的绝对公正,SWE-bench-Live官方设立了“Verified”核验机制。参评方案必须提交全链路的智能体运行轨迹(Trajectories),由官方团队严格审查评测输入、信息隔离环境,并彻底排查是否存在向智能体泄露标准答案、测试用例或结果的可能。TianxiCode与DeepSeek-v4.1-Flash成功通过审查并斩获“Verified”认证,充分证明了其代码修复成绩的可复现性与高含金量。

TianxiCode架构突破,释放工程级落地能力

如果把“TianxiCode配合DeepSeek-v4.1-Flash”整个系统比作一个软件工程师。那么DeepSeek-v4.1-Flash是工程师的大脑,负责阅读代码、理解语义、构思解法;而TianxiCode则是工程师的眼、手、工具箱以及工作流规范。再聪明的大脑,离开了一双能敲代码、查日志的“手”和的严谨工作习惯,也无法在复杂的现实工程中独自解决 Bug。

多项榜单对比数据印证了这一点:若缺乏顶层智能体架构的系统协同,即便调用顶级闭源模型,面对真实工程难题也常常束手无策。而这些足以见证TianxiCode的技术含金量。

在实际软件工程场景下,TianxiCode展现出跨文件多跳检索与精准上下文管理、自驱动规划与多轮工具调用、闭环补丁生成与测试驱动自愈三大系统工程能力。

跨文件多跳检索(Multi-Hop Retrieval)与精准上下文管理(Context Pruning & Slicing)让TianxiCode能够像资深工程师一样“顺藤摸瓜”寻找问题,在大型代码库中快速定位缺陷根因。

自驱动规划(Autonomous Planning)与多轮工具调用(Multi-turn Tool Calling)赋予TianxiCode像真人程序员一样“边看边敲”:遇到Bug会先列出排错计划,主动打开终端命令行去运行测试、翻阅日志、比对修改记录。遇到解决不了的问题,它还会灵活换个思路继续排查,实现自主推进。

闭环补丁生成(Closed-Loop Patching)与测试驱动自愈(Test-Driven Self-Correction)可以让TianxiCode能够自测自纠。TianxiCode会自动在隔离环境中运行代码,一旦发现新代码报错或破坏了其他功能,就立刻进行自我反思与修改,直至补丁通过项目验收。

可以说,TianxiCode扎实的自研工程底座展示了复杂的现实软件研发场景下,强大的智能体框架带来的决定性力量。

从榜单前列走向产业深处,天禧生态加速AI普惠

作为天禧AI生态在专业技术领域的关键研发布局,TianxiCode此次在国际顶级评测中跻身第一梯队,不仅是一次技术实力的集中验证,更为智能体在真实研发场景的落地铺平了道路。

代码智能体的最终价值,不在于单一榜单的排名,而在于为一线开发者分担繁重的排错与工程协同成本。未来,联想天禧AI将持续推动TianxiCode的技术成果向开发者实际工具链沉淀,依托成熟的自主智能体架构,让安全、高效、真正具备自主问题解决能力的专业代码工具,深度赋能到联想的硬件设备中。

本文由联想提供,量子位获授权转载,观点归原作者所有。

版权所有,未经授权不得以任何形式转载及使用,违者必究。

阅读原始来源 →

前因后果

  1. AI猫狗短剧走红,博主靠萌宠内容变现钛媒体 · DeepSeek
  2. 字节Seed发现DeepSeek-V4存在相位敏感性36氪 人工智能 · DeepSeek
  3. 闲鱼成AI算力与Token灰色集市:H20、低价会员都能买钛媒体 · DeepSeek
  4. AI挤压存储产能:内存条一年涨价超300%钛媒体 · Lenovo
  5. 字节 Seed 发现 DeepSeek 长上下文性能漂移原因DoNews · DeepSeek
  6. 字节Seed揭示长文本性能波动:分块KV缓存相位敏感AIbase AI新闻 · DeepSeek

评论

我用过:分享经验 我怎么看:发表观点
你觉得这条新闻有多重要?还没有评分

还没有评论,来说说你的看法。