英伟达团队分享KDD Cup数据分析智能体构建经验
英伟达KGMON团队在KDD Cup 2026 Data Agents竞赛中获得第二名,其方案核心是围绕小型固定LLM构建更小、更清晰、更易验证的智能体框架,包括统一SQL查询接口、前置模式侦察、受限工具集与执行轨迹检查等做法。
英伟达团队披露KDD Cup数据分析智能体构建思路
据英伟达开发者博客文章,英伟达KGMON团队在KDD Cup 2026 Data Agents竞赛中获得第二名。该竞赛要求智能体针对数据库、CSV与JSON文件、散文文档、PDF以及简报视频等异构数据源回答自然语言问题,并统一使用一个小型、固定的LLM,因此框架本身成为主要优化对象。团队将结构化数据源统一转换为单一SQLite数据库,仅暴露schema()与sql(query)两个接口,以减少路由错误并保留模型的推理能力。
关键做法与适用边界
文章总结的做法包括:在主推理循环前加入只读的“模式侦察”步骤,向智能体说明表、列、可能的连接键、单位与数据质量问题;将工具集限制为schema()、sql(query)、write_answer(df)和prose_helper()等少数函数,并由中间件修复格式错误的调用;把文档检查与结构化分析分离,通过受限预览与正则搜索将片段交给独立的零温度LLM调用处理,避免原始散文进入主上下文。此外,团队记录提示、工具调用与中间结果的执行轨迹,由专门的检查智能体归类失败原因。文章同时提示,重复尝试与集成会提高token消耗、延迟与算力成本,视频预处理与表格抽取也更适合竞赛场景,生产系统可按需取舍。
限制与来源
上述内容来自英伟达开发者博客,作者为Eduardo Rocha de Andrade、Jiwei Liu、Maximilian Jeblick、Raja Biswas与Isabel Hulseman。文章明确表示,这并非适用于所有数据科学智能体的通用配方,相关工具与流程的具体可用性、功能范围与部署要求,请以英伟达官方渠道当前信息为准。