EvoOntology - 面向数据智能体的自演化本体层
EvoOntology 是中国人民大学 ruc-datalab 开源的自演化本体层项目,通过 MCP 工具向数据智能体暴露带版本的本体层,并依据执行轨迹持续演化。项目采用 MIT 许可,截至 2026-09-30 星标 529,尚无正式 release。
EvoOntology 是一个面向数据智能体(Data Agent)的自演化本体层(Ontology Layer)项目,由中国人民大学 ruc-datalab 维护,采用 MIT 许可证。它要解决的问题是项目自述中所说的「智能体—数据鸿沟」:当数据分散在异构的表、文件和数据库之间时,表名、列名、文件路径和零散观测本身很少能说明指标定义、实体关系或业务约束,智能体只能反复推断,容易产生语义错误。EvoOntology 的做法是把本体层当作可训练的智能体状态而非模型权重,通过 MCP 工具按需暴露语义,并依据真实工作负载与执行轨迹持续调整。它适合已经在使用 Claude Code、Codex 等智能体工具,并且需要让智能体稳定理解自有数据语义的开发者与数据团队。
维护者与状态
项目由 ruc-datalab 维护,仓库创建于 2026-09-15,最后提交时间为 2026-09-29。截至 2026-09-30,仓库星标数为 529。需要说明的是,该项目目前尚无正式 release,仓库以主分支代码和插件市场分发为主,使用前应对版本稳定性有合理预期。许可证为 MIT。
主要能力
以下能力均来自项目自述,属于维护者对自身设计的描述,未经独立验证。
- 通用智能体插件(MCP):项目自述可无缝集成 Claude Code、Codex 及其他 AI 智能体,以 MCP 工具形式提供本体层访问。
- 自动本体构建:据项目说明,可直接从用户数据出发构建量身定制的本体层。
- 持续自演化:README 中称,本体层会基于交互历史不断演化与精炼。
- 三层结构:项目自述本体层由 Content Layer(含 Terms、Mappings、Constraints、Evidence 四类节点及语义关系与结构引用)、Schema Layer(定义节点字段、允许的语义关系类型与结构引用模式)和 Tool Layer(通过 browse_semantics、resolve_semantics 及紧凑会话清单暴露本体)组成。
- 生命周期:据项目说明,流程分为 Build(从工作负载推导候选概念并对照原始数据验证,发布 ontology_v0)、Use(智能体按需查询并记录工具交互与结果)、Evolve(诊断重复行为并生成局部候选补丁)、Evaluate(在相同数据、智能体、解码设置与交互预算下比较 Parent 与 Candidate)、Publish or reject(通过则发布为 ontology_vN+1,否则保留 Parent)五个阶段。
- 设计原则:项目自述强调主动访问(只检索当前步骤所需语义)、有据构建(验证后才提交语义对象)、定向演化(局部更新 Content、Schema、Tool 三层)、门控版本(配对评估显示可复现改进才发布 Candidate)以及智能体集成。
- 评测环境:README 中称内置 BIRD、DDR-10K、InsightBench 三个数据智能体场景的自包含适配器,各自实现 EvolutionAdapter 并保留原生 rollout 与评测协议。
使用入口
仓库地址为 ruc-datalab/EvoOntology。
据项目说明,安装方式是从 GitHub 插件市场安装,无需克隆仓库、创建虚拟环境或单独执行 pip install。Claude Code 下的命令为:
claude plugin marketplace add ruc-datalab/EvoOntology claude plugin install evoontology@evoontology claude plugin list
启动新会话后可使用 /evoontology:build-ontology、/evoontology:evolve-ontology、/evoontology:explore-ontology 三个命令。Codex 下的命令为:
codex plugin marketplace add ruc-datalab/EvoOntology codex plugin add evoontology-codex@evoontology codex plugin list
启动新线程后,可让 Codex 使用 $build-ontology、$evolve-ontology、$explore-ontology。项目自述两个插件共用同一套 Build / Evolve / Explore 工作流名称,仅平台调用语法不同。本体构建完成后,数据智能体可直接调用 browse_semantics 与 resolve_semantics,无需额外本体配置。仓库中列出 benchmarks 目录,可用 python -m benchmarks list 查看已注册环境。
许可与限制
许可证为 MIT。项目自述中提到的已知边界包括:SQLite 内置只读任务回放,其他数据源需借助宿主工具并显式记录观测;Codex 插件的问题准备可结合用户需求、相关项目历史与有据探索,问题与轨迹文件为可选项;Build 与 Evolve 会自动打开结果浏览器。此外,项目自述的评测结果基于论文中的四骨干分析子集,完整六骨干结果与评测协议需参见论文表格,本文不引用具体分数。由于项目尚无正式 release,接口与工作流可能随主分支变化,实际使用请以仓库内文档与 LICENSE 为准。