联想天禧自研代码智能体TianxiCode登顶SWE-bench-Live榜单
联想天禧AI自研代码智能体框架TianxiCode配合DeepSeek-v4.1-Flash,在SWE-bench-Live(Lite分榜)中以71%的问题解决率位列第一,并通过官方Verified核验。
核心事实
据量子位转载内容,联想天禧AI自主研发的专业代码智能体框架 TianxiCode 在软件工程评测 SWE-bench-Live(Lite 分榜)中,配合 DeepSeek-v4.1-Flash 取得 71% 的问题解决率,位列该分榜第一,并已通过官方审核。报道称,该方案通过了 SWE-bench-Live 官方设立的“Verified”核验机制,需提交全链路智能体运行轨迹,由官方团队审查评测输入与信息隔离环境,并排查是否存在向智能体泄露标准答案、测试用例或结果的可能。
背景与影响
SWE-bench-Live 以真实 GitHub 项目中的问题为基础,评估模型与智能体生成代码补丁、修复问题的能力,并提供可复现的执行环境,与只考查代码片段生成的传统测试不同。报道将 TianxiCode 定位为联想天禧AI在代码生成与工程开发方向的代码智能子能力,称其未来将应用到联想 AI 硬件产品中。
在架构层面,报道把 DeepSeek-v4.1-Flash 比作“大脑”,把 TianxiCode 比作“眼、手、工具箱以及工作流规范”,并列出三项能力:跨文件多跳检索与上下文管理、自驱动规划与多轮工具调用、闭环补丁生成与测试驱动自愈。报道还称,TianxiCode 的技术成果将向开发者实际工具链沉淀。
限制与来源
上述成绩、核验结论与能力描述均来自联想提供、量子位获授权转载的内容,本文未做独立验证。榜单排名与解决率可能随评测版本、分榜设置与提交时间变化,具体以 SWE-bench-Live 官方页面及联想官方信息为准。TianxiCode 的可用范围、支持语言、账号与地区支持、发布时间及是否收费,素材中未予说明,需以官网当前信息为准。