2026年08月21日:Towards Complex Ontology Alignment using Large Language Models

  • 主页 /
  • 通知公告 /
  • 通知公告

2026年08月21日:Towards Complex Ontology Alignment using Large Language Models

【报告内容】

汇报人:李博

汇报单位:太原理工大学

主题:Towards Complex Ontology Alignment using Large Language Models

1、Introduction

2、Method

3、Experiment

4、Conclusion

【报告总结】

1、待解决的问题描述

1)复杂对齐自动化困难:复杂逻辑映射涉及属性、关系与约束的组合匹配,自动化推理难度大,传统方法难以应对真实场景中的复杂语义关联。

2)已有大语言模型对齐方法局限:多数研究只处理简单对齐;复杂对齐赛道上能产出复杂映射的系统少,且依赖共享实例数据。

3)提示设计挑战:一次性输入完整本体文件与查询容易造成模型混淆,需要结构化、分步的提示策略。

2、相关创新方案

1)本体模块:围绕单一核心概念构建自包含的知识封装体,整合与该概念直接相关的类、属性和语义关系,为模型提供额外的领域上下文。该思想来自模块化本体建模 MOMo。

2)任务无关提示技术:比较零样本、少样本和思维链三种提示方式,采用思维链式的链式提示,避免一次性输入完整文件与查询造成的混淆。

3)五步提示流程:上传目标本体 GMO 建立上下文;从源本体 GBO 提取实体术语发起初步查询;根据模块清单定向筛选相关模块;注入模块详细定义、属性与关系;在增强后的精准上下文中执行最终查询。

4)方法不依赖两个本体共享的实例数据,是首个不依赖共享实例数据、能在复杂对齐任务上取得较好准确率的工作。

3、实验总结

数据集:GeoLink 复杂对齐数据集,基于海洋科学领域真实本体 GBO 和 GMO,包含领域专家手工校验的 109 条复杂对齐规则。

模型与指标:核心评估模型为 GPT-4;采用召回率与精确率两个指标。

关键结果:不借助模块信息时,109 条规则中仅 5 条(4.5%)能被部分识别,且本质上都是简单的一对一映射;超过 95% 的复杂规则必须依靠模块信息才能被发现。加入模块信息后,73.3% 的规则召回率不低于 0.5,62.3% 不低于 0.75,45% 达到 1.0;精确率方面,69.7% 不低于 0.5,59.6% 不低于 0.75,45.8% 达到 1.0。召回率与精确率均值均为 0.67,中位数分别为 0.75 和 0.80。

实例验证:加入 Funding Award 模块后,GPT-4 准确找到 Award 规则对应的全部四个目标实体,该实例召回率和精确率均达到 1.0。

4、未来工作

引入人工在环机制,扩展到更多数据集,尝试不同的模块表示方式,结合符号推理、传统简单对齐算法和模型微调。

报告时间:2026082119:30

腾讯会议:311-5999-8176

点我下载本讨论课相关文献或PPT吧~(提取码:iipr)