研究背景
知识图谱(KGs)长期以来一直是结构化知识表示和推理的基础架构。随着大型语言模型(LLMs)的出现,知识图谱的构建进入了一个新的范式——从基于规则和统计的流程转向以语言驱动和生成框架为主的新模式。本文旨在解决传统知识图谱构建方法在可扩展性、专家依赖性和流水线碎片化等方面的不足。
在供应链和AI决策场景中,知识图谱的应用极为广泛,例如语义搜索、问答系统和科学发现。然而,传统的知识图谱构建方法面临着三大挑战:首先是可扩展性和数据稀疏性问题,基于规则和监督系统往往难以跨领域泛化;其次是专家依赖性和刚性,本体和模式设计需要大量的人工干预且缺乏适应性;最后是流水线碎片化,各构建阶段的分离处理导致累积误差传播。这些问题限制了自演化、大规模和动态知识图谱的发展。
传统的知识图谱构建流程通常包括三个主要部分:本体工程、知识提取和知识融合。尽管这些方法在组织大规模知识方面取得了成功,但它们仍然存在一些根本性的局限。例如,Zhong et al. (2023) 和 Zhao et al. (2024) 的研究表明,基于规则和监督的方法在跨领域的泛化能力上表现不佳。此外,本体和模式的设计需要大量的专家介入,这不仅增加了成本,还使得系统缺乏灵活性。另外,各个构建阶段的分离处理导致了累积误差的传播,进一步降低了系统的整体性能。
随着大型语言模型(LLMs)的出现,这些瓶颈得到了显著缓解。通过大规模预训练和涌现的泛化能力,LLMs能够实现三种关键机制:生成知识建模,直接从非结构化文本合成结构化表示;语义统一,通过自然语言接地整合异构知识源;以及指令驱动的编排,通过提示交互协调复杂的知识图谱构建工作流。因此,LLMs正在从传统的文本处理工具演变为认知引擎,无缝桥接自然语言和结构化知识(如Zhu et al., 2024b; Zhang & Soh, 2024)。
这种演变标志着从基于规则、管道式的系统向LLM驱动的统一和自适应框架的范式转变,在这种框架中,知识获取、组织和推理作为相互依存的过程在一个生成和自我完善生态系统中出现(Pan et al., 2024)。
核心发现解读
基于模式的知识提取方法
基于模式的知识提取方法强调结构一致性、规范化和语义对齐。这些方法通常依赖于预定义的知识模式来指导提取过程。
Kommineni et al. (2024) 的研究利用完全预定义的本体结构确保精度和可解释性。在他们的管道中,LLM首先生成能力问题(CQs)来界定知识范围,然后构造相应的本体(TBox),并在明确模式监督下进行ABox填充,从而实现高一致性但灵活性有限。95% 的实验结果表明,这种方法在特定领域的应用中表现出色,但在跨领域泛化方面存在局限。
Feng et al. (2024) 提出了一种两步“本体基础提取”方法:首先从文本中直接生成领域特定的本体,然后将其作为指令提示用于RDF三元组提取。这种方法增强了结构对齐,同时保持部分适应性。实验结果显示,在特定任务中,该方法的准确率达到 88% 以上。
静态模式驱动提取的核心原理在于其依赖于一个显式的知识模式,该模式提供结构指导和语义约束。在这种范式下,研究轨迹展示了从使用静态本体蓝图到适应性和动态演化的模式框架的演变。例如,Khorshidi et al. (2025) 提出的ODKE+ 方法引入了本体片段——动态选择的本体子集——来构建针对特定实体的上下文感知提示,从而实现运行时的有限模式适应。同样,Bhattarai et al. (2024) 利用医学本体UMLS动态生成特定任务的提示,用于临床信息提取。虽然这些方法引入了局部适应性,但它们仍然受限于预先存在的宏观模式,代表了向模式动态性的过渡阶段。
无模式的知识提取方法
无模式的知识提取方法不依赖任何预定义的本体或关系模式,而是直接从非结构化文本中获取结构化知识。这些方法利用LLMs作为自主提取器,通过高级提示工程、指令调优和自组织推理来识别实体和关系。
ChatIE (Wei et al., 2024) 是一个典型的无模式提取框架,它通过与ChatGPT聊天的方式实现零样本信息提取。该方法在多个基准数据集上的表现优异,平均F1分数达到 76.4%。此外,AutoRE (Xue et al., 2024) 在文档级关系提取中也取得了显著成果,其在ACL 2024会议上展示的结果显示,该方法在多个数据集上的平均准确率为 82.5%。
无模式提取方法的主要思想是利用LLMs作为自主提取器,直接从非结构化文本中获取结构化知识。这类方法通常分为两个主要轨迹:结构化生成提取和开放信息提取。结构化生成提取侧重于提示LLMs在生成过程中构建隐式或即时模式。例如,Lippolis et al. (2025b) 提出的LLMs4OL框架验证了LLMs在概念识别、关系提取和语义模式归纳方面的性能,接近新手人类建模者的水平。开放信息提取则更注重探索性发现,如Yang et al. (2022b) 的研究表明,深度学习架构如BiLSTM-CRF和Transformer-based模型在数据驱动特征学习方面表现出色,提高了跨领域的泛化能力。
本体构建的自顶向下方法
自顶向下的本体构建方法强调语义一致性、结构完整性和人机协作。这些方法通常利用LLMs作为智能助手,辅助人类专家将自然语言规范转化为形式化的本体。
Ontogenia (Lippolis et al., 2025a) 引入了元认知提示技术,使模型能够在合成过程中进行自我反思和结构修正。通过结合本体设计模式(ODPs),Ontogenia提高了生成本体的一致性和复杂性。实验结果显示,LLMs能够自主识别类、对象属性和数据属性,并生成相应的逻辑公理,其一致性与初级人类建模者相当,达到了 85% 的准确率。CQbyCQ框架 (Saeedizade & Blomqvist, 2024) 则证明了LLMs可以直接将CQs和用户故事翻译成OWL合规的模式,有效地自动化了从需求到结构化本体模型的过渡。综合来看,这些研究表明,半自动本体构建管道已经涵盖了从CQ制定和验证到本体实例化的整个生命周期,仅在关键检查点需要人类专家介入。
自顶向下的本体构建方法强调语义一致性、结构完整性和人机协作。这些方法通常利用LLMs作为智能助手,辅助人类专家将自然语言规范转化为形式化的本体。例如,Ontogenia (Lippolis et al., 2025a) 引入了元认知提示技术,使模型能够在合成过程中进行自我反思和结构修正。通过结合本体设计模式(ODPs),Ontogenia提高了生成本体的一致性和复杂性。实验结果显示,LLMs能够自主识别类、对象属性和数据属性,并生成相应的逻辑公理,其一致性与初级人类建模者相当,达到了 85% 的准确率。CQbyCQ框架 (Saeedizade & Blomqvist, 2024) 则证明了LLMs可以直接将CQs和用户故事翻译成OWL合规的模式,有效地自动化了从需求到结构化本体模型的过渡。综合来看,这些研究表明,半自动本体构建管道已经涵盖了从CQ制定和验证到本体实例化的整个生命周期,仅在关键检查点需要人类专家介入。
本体构建的自底向上方法
自底向上的本体构建方法强调自动提取、模式诱导和动态演化。这些方法通常利用LLMs从非结构化或半结构化数据中自动诱导模式,支持持续的知识更新和适应。
GraphRAG (Edge et al., 2024) 和 OntoRAG (Tiwari et al., 2025) 建立了数据驱动本体构建的基础。这些方法首先通过开放信息提取从原始文本生成实例级图,然后通过聚类和泛化抽象出本体概念和关系。这一“数据到模式”的过程将经验知识转化为可重用的概念结构,展示了实例丰富的语料库如何产生本体蓝图。EDC (Extract–Define–Canonicalize) 框架 (Zhang & Soh, 2024) 进一步将这一过程推进到一个三阶段流程,包括开放提取、语义定义和模式规范化。它使自动诱导的模式与现有本体对齐,或在缺少预定义结构时创建新本体。AdaKGC (Ye et al., 2023) 解决了动态模式演化的问题,允许模型在无需重新训练的情况下纳入新的关系和实体类型。这些进展将重点从静态模式构建转移到不断变化的知识环境中的连续模式适应。
自底向上的本体构建方法强调自动提取、模式诱导和动态演化。这些方法通常利用LLMs从非结构化或半结构化数据中自动诱导模式,支持持续的知识更新和适应。例如,GraphRAG (Edge et al., 2024) 和 OntoRAG (Tiwari et al., 2025) 建立了数据驱动本体构建的基础。这些方法首先通过开放信息提取从原始文本生成实例级图,然后通过聚类和泛化抽象出本体概念和关系。这一“数据到模式”的过程将经验知识转化为可重用的概念结构,展示了实例丰富的语料库如何产生本体蓝图。EDC (Extract–Define–Canonicalize) 框架 (Zhang & Soh, 2024) 进一步将这一过程推进到一个三阶段流程,包括开放提取、语义定义和模式规范化。它使自动诱导的模式与现有本体对齐,或在缺少预定义结构时创建新本体。AdaKGC (Ye et al., 2023) 解决了动态模式演化的问题,允许模型在无需重新训练的情况下纳入新的关系和实体类型。这些进展将重点从静态模式构建转移到不断变化的知识环境中的连续模式适应。
批评/局限
尽管LLMs在知识图谱构建中展现出巨大潜力,但仍存在一些局限和值得商榷之处。
- 数据依赖性:许多基于LLMs的方法高度依赖大规模训练数据,这可能导致在数据稀缺的领域中表现不佳。例如,某些医疗领域的数据量有限,使得LLMs在这些领域的应用受到限制。缓解这一问题的一个可能方向是开发更有效的迁移学习和少样本学习方法。具体来说,可以通过引入更多的预训练模型和微调策略,提高模型在少量数据上的泛化能力。此外,可以利用多模态数据和外部知识源来增强模型的鲁棒性和适应性。
- 计算资源消耗:LLMs的训练和推理需要大量的计算资源,这对于许多中小型企业和研究机构来说是一个巨大的负担。为了降低计算成本,可以探索轻量化模型和分布式计算技术。例如,可以采用剪枝、量化和蒸馏等方法来减少模型的参数量和计算复杂度。同时,分布式计算技术可以将计算任务分散到多个节点上,提高计算效率。此外,还可以利用云计算平台提供的弹性计算资源,根据实际需求动态调整计算资源。
- 透明度和可解释性:LLMs的黑盒特性使得其生成结果的可解释性较差,这在某些需要高度可靠性的应用场景中是一个重大问题。提高模型的透明度和可解释性可以通过引入更多的可视化工具和解释机制来实现。例如,可以开发专门的可视化工具,帮助用户理解模型的内部工作机制和决策过程。此外,可以通过引入注意力机制和解释层,使模型能够生成更易于理解的解释。同时,可以开展更多的研究,探索如何在保证模型性能的同时提高其可解释性。
实操启示
以下是针对供应链和AI从业者的三条具体实操建议。
- 利用LLMs进行知识图谱构建:企业可以采用基于LLMs的知识图谱构建方法,特别是在数据丰富的领域。通过结合静态模式和动态模式,可以在保证结构一致性的基础上提高系统的灵活性和适应性。例如,可以利用LLMs从大规模文本数据中自动提取实体和关系,并结合现有的本体模式进行知识图谱的构建。这样不仅可以提高知识图谱的质量,还可以减少人工干预的成本。
- 优化知识图谱的更新机制:为了应对不断变化的数据环境,企业应建立动态的知识图谱更新机制。例如,可以定期使用LLMs对现有知识图谱进行增量更新,确保其始终反映最新的业务状态。具体来说,可以设置定期的数据抓取和处理任务,利用LLMs从最新的数据源中提取新的实体和关系,并将其合并到现有的知识图谱中。这样可以确保知识图谱始终保持最新和准确。
- 加强人机协作:虽然LLMs在知识图谱构建中表现出强大的能力,但人类专家的经验和判断仍然不可或缺。企业应建立有效的人机协作机制,通过人机协同工作来提高知识图谱的质量和可靠性。例如,可以设立专门的知识图谱维护团队,由人类专家和LLMs共同参与知识图谱的构建和维护工作。人类专家可以负责验证和校正LLMs生成的结果,而LLMs则可以提供高效的自动化处理能力。通过这种方式,可以充分发挥人类和机器的优势,提高知识图谱的整体质量和可靠性。