
摘要: Jessica Talisman 的《The Ontology Pipeline》把图书馆学方法变成了一套 6 级台阶、9 道工序的语义工程管线,指出盲目套用 Google 产品分类法等公共分类法正在让 AI 知识系统趋于同质化。

钩子:你的 RAG 可能输在「词都没对齐」
很多团队接触大模型落地时,第一时间想到的是换模型、调 prompt、加算力。结果上线后却发现:检索回来的片段总是答非所问,实体名称一会儿全称一会儿缩写,产品线层级忽深忽浅,同一个概念在不同业务系统里长着三副面孔。
问题往往不出在模型身上,而出在「知识的地基」上。
Jessica Talisman 在《The Ontology Pipeline® — A Semantic Knowledge Management Framework》(2025 年 5 月)里给了一个很直接也略显刺耳的判断:业界对公开分类法(taxonomy)的过度依赖,正在制造大量同质化的知识生态。典型例子就是 Google Product Taxonomy——拿来就能用、层级清晰、覆盖广,但它是为 Google Shopping 设计的,不是为你的业务设计的。把它直接塞进知识图谱或 RAG,等于用别人家的地图导航自己家的仓库。仓库里有什么、货架怎么编号、同一商品是不是有不同的内部编码,这张地图一概不管。
这篇框架性文档的核心主张可以概括为一句话:语义知识管理不该是黑箱,它可以被拆成一条可重复、可估算、可度量的工程管线。Talisman 本人出身于图书馆学情报学(Library and Information Science,LIS),她把图书馆员整理卡片目录那套方法论,升级成了面向大语言模型和 AI 系统的数据治理流水线。

背景:LLM 时代,为什么需要语义工程
大语言模型擅长生成通顺的文本,却不擅长处理「同一个东西有多个名字」「同一个名字指代不同东西」这类语义问题。企业内部的数据湖、CRM、ERP、文献库、产品目录各自为政,术语不统一、元数据缺失、层级关系混乱。直接把这样的数据喂给模型,结果不是智能,是「有文化的幻觉」。
Talisman 在文档开头列了一组她反复看到的痛点:
- 技术人员要么把语义系统看成「贴标签」的简单活,要么看成投入产出比不明的重体力活;
- 因为缺少现成框架,语义知识管理系统的建设和维护长期像黑箱,难以估算短期和长期投入;
- 投资回报难以直接量化,价值往往只能间接体现在 RAG 效果、实体管理系统和信息检索指标上。

图 1:图书馆学为 AI 系统准备数据的循环:准备与清洗、协调建模、摄取、分析修正、复用内容、报告度量,再回到起点。来源:原书插图,基于 Fuzheado CC0 改作。
Talisman 认为,图书馆学和信息科学领域已经花了上百年处理这些问题。从卡片目录到联机检索,从受控词表到知识组织系统,LIS 形成了一套可重复的、以「准确性和可靠性」为目标的方法论。机器学习与人工智能在过去十几年里也常被图书馆界用作编目和工作流工具,因此这个学科天然适合给当下的 AI 系统当「数据质量守门人」。
方法:一条六阶段管线,把语义工程从艺术变成工程
《The Ontology Pipeline》把语义知识管理拆成 6 个递进的构建块:
- 受控词表(Controlled Vocabulary):先对术语做去重、合并、消歧和定义;
- 元数据标准(Metadata Standards):用结构化、描述性和管理性元数据给数据资产「建档」;
- 分类法(Taxonomy):把受控词表组织成层级化的父—子关系;
- 叙词表(Thesaurus):在层级关系之上加入等价、关联和近义关系;
- 本体(Ontology):用类、属性、关系和逻辑公理描述领域;
- 知识图谱(Knowledge Graph):把前五阶段的成果整合成 RDF 语义网络,成为可视化与查询层。

图 2:The Ontology Pipeline 的六阶段递进关系:受控词表 → 叙词表 → 分类法 → 本体。来源:原书插图,改编自 ANSI/NISO Z39.19。
这六个阶段不是一次性的瀑布流,而是迭代上升的循环。每个阶段都在为下一阶段做准备,同时把数据清洗、准备、协调、建模、测试、富化、强制、报告和度量这 9 道工序嵌入其中。Talisman 的用意很明确:只有把每一步变成可识别、可估算的工作包,企业才敢往语义基础设施里投钱。
阶段一:受控词表——先给概念「定名分」
构建语义系统的第一步不是画图,而是清洗和定义术语。Talisman 强调,必须对同义词、近义词、缩写和重复项做统一处理,并为每个术语写下定义,让所有用户和系统对同一个词有共同理解。

图 3:NASA 受控词表中的 "Mission to Planet Earth" 条目,包含定义(DEF)、使用代称(UF)、广义词(GS)和相关词(RT)。来源:NASA Thesaurus,原书插图。
这个例子很直观:MTPE 是 Mission to Planet Earth 的缩写,programs、NASA programs 是它的广义词,climate change、Earth Observing System 等是相关词。通过这套符号系统,人和机器都能知道「我们在说同一件事」。
阶段二:元数据标准——给数据贴「身份证」
有了受控词表,下一步是为数据资产建立元数据标准。Talisman 把元数据元素分成三类:
- 结构性(Structural):让机器可读;
- 描述性(Descriptive):提供上下文;
- 管理性(Administrative):记录资产维护和血缘。

图 4:元数据元素与取值协同工作,示例中 "Mad Men Season 5: Plot Predictions" 这篇文章的结构化、描述性和管理性元数据。来源:Brain Traffic,原书插图。
元数据标准和受控词表是「双打」关系:标准负责规定字段,词表负责提供字段的可取值。两者结合,才能支撑实体对齐、词表管理和基于 schema 的验证矩阵。
阶段三:分类法——把概念排成树
很多人在缺乏受控词表和元数据标准的情况下就急着建分类法,结果分类层级越搭越乱,很快难以维护。Talisman 把分类法定义为「由父—子或宽窄关系构成的层级分类系统」,它是把受控词表变成关系网络的第一步。

图 5:Adobe Experience Manager 的分类法示例,展示 "Administration and security" 下的层级结构。来源:Jessica Talisman, 2025,原书插图。
她建议不要把分类法长期养在电子表格里。表格缺乏机器可读的语义编码,也难以做结构校验。应该使用 SKOS 这类上层本体,并把 ISO 25964-1/2、RDF 校验、ANSI/NISO Z39.19 等标准纳入验证矩阵,提前发现递归循环和关系冲突。
阶段四:叙词表——在树里加「关系网」
分类法回答的是「这个概念的上下级是谁」,叙词表回答的是「这个概念还跟谁是朋友」。Talisman 偏好让分类法自然演化为叙词表,因为叙词表是走向本体驱动知识管理的关键一步。

图 6:叙词表中的 BT(上位词)、NT(下位词)、SYN(同义词)等关系示例。来源:Jessica Talisman, 2025,原书插图。
用 SKOS-XL 或 Simple Knowledge Organization System 等轻量级本体对叙词表编码后,机器和人都能基于上下文消除歧义,这也为后续本体的逻辑推理打下了基础。
阶段五:本体——给领域写一部「规则书」
本体描述的是类、属性、关系和逻辑公理。它告诉系统:这个概念属于哪个类、有哪些属性、能跟哪些概念发生关系、在什么条件下会触发推理。Talisman 把本体比作「写一个定义领域、复杂系统以及所有角色、地点、事物和概念之间关系的故事」。

图 7:本体通过类、属性、关系和公理组织信息,主语—谓语—宾语(Subject–Predicate–Object)是其基本表达方式。来源:Ontotext,原书插图。
她强调,如果没有前面四个阶段的清洗和结构化,直接建本体会非常困难。因为当底层数据本身缺乏逻辑时,引入逻辑只会放大混乱。
阶段六:知识图谱——六阶段成果的「可视化层」
知识图谱是这条管线的终点,也是新的起点。它不是一张从零画起的网络,而是受控词表、元数据模式、分类法、叙词表和本体的集合体。

图 8:知识图谱作为语义网络,把对象、事件、情境和概念及其关系可视化呈现。来源:Jessica Talisman, 2025,原书插图。
Talisman 把知识图谱称为「语义知识管理系统的罗塞塔石碑」。它让业务人员能直观地与系统交互,用 SPARQL 和 SHACL 做精确查询和约束验证,也让知识从后台数据变成前台可对话的一等公民。
结果:这套管线到底交付了什么
《The Ontology Pipeline》不是一篇论文,没有给出 p 值或消融实验。它交付的是一套工程化的思维框架和可度量的工作分解:
- 可估算的投入:把黑箱拆成 6 个阶段和 9 道工序后,企业可以按阶段估算人力、工具和周期;
- 可重复的方法论:每个阶段都有输入、输出、质量标准和退出条件,降低对个别专家的依赖;
- 可解释的 AI 数据基础:统一的术语、元数据、层级和关系网络,是 RAG、实体管理、信息检索等业务场景的共同底座;
- 可审计的改进路径:通过清洗、测试、报告和度量,组织能持续追踪语义系统的成熟度和投资回报。
换句话说,这套管线的直接产品不是某个模型,而是让模型「少犯错」的数据环境。
专家解读:为什么语义工程该由「数据质量守门人」主导
从第三方视角看,Talisman 的框架戳中了一个行业盲区:太多 AI 项目把 80% 精力花在模型层,却只用 20% 精力处理数据语义。结果是,模型越强大,对底层数据一致性的要求越高,数据缺陷被放大的也越明显。
RAG 系统的检索准确率、实体管理系统的对齐率、信息检索的查全率和查准率,本质上都是语义工程指标。把这些指标交给没有受过术语控制、分类法和元数据训练的纯算法团队,往往会出现「代码能跑,但概念对不上」的尴尬。
图书馆学和信息科学训练的是「如何让不同来源、不同格式、不同语境的信息被一致地组织、检索和理解」。在大模型时代,这种能力恰恰是企业最缺的数据基础设施能力。它不是让机器变得更聪明,而是让机器先能「看懂」企业自己的语言。Talisman 的框架不是让图书馆员取代算法工程师,而是让语义工程师成为 AI 项目的「数据质量守门人」。
产业影响:从「知识图谱项目」到「语义基础设施投资」
这套框架对产业的最大冲击,是改变了企业对语义知识管理的定位。
过去,知识图谱、本体、分类法常常被视为某个部门的独立项目,预算软、周期长、成果难量化。Talisman 把它重新包装成一种基础设施投资:像数据仓库、数据治理平台一样,语义系统有自己的阶段、成本和绩效指标。
具体影响体现在三个层面:
- 采购层面:企业可以按阶段招标和验收,而不是一次性要求供应商「做一个知识图谱」;
- 组织层面:可以设立语义工程师、知识管理员、本体架构师等角色,形成专门的职能线;
- 战略层面:把语义能力纳入 AI 就绪度评估,让领导层看到不干净的数据会如何拖累大模型项目。
当企业能把「清洗了多少术语」「建了多少层分类」「覆盖了多少元数据字段」「发现了多少关系冲突」变成可汇报的指标时,语义工程就从成本中心变成了风险控制中心。
局限争议:这不是万能药
Talisman 的文档本身带有框架倡导者的色彩,阅读时需要保持一定的批判距离。
首先,这条管线假设组织已经愿意投入相当的前期成本。对于中小团队来说,完整走完 6 个阶段可能过于沉重。现实项目中,很多时候只需要一个轻量分类法或一个领域本体就能解决 80% 问题,未必需要一次性建成完整管线。
其次,文档对工具选型着墨不多,只点到 Graphwise 和 TopQuadrant 这类语义中间件。企业在落地时还需要面对平台兼容性、与现有数据栈集成、变更管理、多语言本地化等具体问题。
最后,管线强调从受控词表开始,但许多企业的数据现状是「先有分类法,后有词表」。如何在不推倒重来的前提下逆向治理,文档没有给出详细操作指南。这也是实践中常见的争议点:究竟是「自上而下」先建本体,还是「自下而上」从现有分类法归纳。
未来研究方向:管线成熟之后往哪走
基于文档自身的局限和行业现状,下一步至少有三个方向值得探索:
- 半自动化构建:把 LLM 用于术语抽取、同义词发现、元数据补全和分类建议,降低人工成本,同时用本体约束保证质量;
- 持续治理与演化:把语义系统纳入 CI/CD 和数据治理运营(DataOps),实现版本控制、影响分析和自动回归测试;
- 垂直行业模板:针对医药、制造、金融、能源等领域,沉淀可复用的领域本体片段和分类法模板,缩短项目启动周期。
作者本人已经提到 LLM 需要干净、结构良好、语义富化的数据,因此「谁能保证数据质量」这个问题,将越来越指向语义工程团队。
同类对比:它和传统做法差在哪
业界常见的知识组织系统大致可以分为四个层级:术语表(Term List)、名称规范(Name Authority)、分类法(Taxonomy)和叙词表(Thesaurus),再往上才是本体(Ontology)。

图 9:受控词表 / 知识组织系统的表达力光谱,从术语表到本体,复杂度和表达能力逐级提升。来源:ANSI/NISO Z39.19,原书插图。
The Ontology Pipeline 的贡献在于把这条光谱变成了一条工程管线,并明确告诉从业者:不要跳级。没有受控词表和元数据标准就建分类法,就像在流沙上盖楼;没有分类法和叙词表就建本体,逻辑再漂亮也经不起真实数据的冲击。
与 Data Mesh、Data Catalog、Schema.org 等方案相比,The Ontology Pipeline 更偏向「语义层的系统构建方法论」,而不是数据治理平台或通用词汇表。它不是要替代这些工具,而是给它们之间的协作提供一张路线图。
结尾升华:知识,终于成了基础设施
《The Ontology Pipeline》最值得记住的一句话,不是某个技术定义,而是它的核心主张:语义知识管理可以也应该被工程化、被估算、被度量。
在大模型把「知识」重新推到舞台中央的今天,企业真正的护城河可能不是用了哪个模型,而是能不能把自己的领域知识整理成机器可理解、可推理、可维护的结构。Talisman 用图书馆学的方法论提醒我们:这场工作的起点,不是算法,而是给每一个概念定好名字、位置和关系。
当知识从文档堆里被释放出来,变成可查询、可验证、可扩展的语义网络时,它才真正成为企业的基础设施。如果你也在搭建这类语义基础设施,欢迎到云栈社区分享你的实践与思考。
附录 · 口径说明
- 本文基于 Jessica Talisman, MLS 于 2025 年 5 月 27 日发布的框架文档《The Ontology Pipeline® — A Semantic Knowledge Management Framework》改写,所有核心概念、阶段划分和插图均来自该文档。
- 文中引用标准包括 SKOS、ISO 25964-1/2、RDF 校验、ANSI/NISO Z39.19 等,均出自原文。
- 为便于中文阅读,部分术语采用行业通用译法:ontology 译作「本体」,controlled vocabulary 译作「受控词表」,taxonomy 译作「分类法」,thesaurus 译作「叙词表」,metadata 译作「元数据」。