
摘要
西门子 2026 白皮书拆解 GSK、薄膜产线等案例:知识图谱与数字孪生确实省下了真金白银,但 60% 的 AI 项目仍倒在数据就绪之前。
引子:GSK 那笔 4 亿美元的「图」
一瓶疫苗里的药片变色,放在过去需要多少时间才能锁定真凶?GSK 给出的答案是:靠一张供应链知识图谱,把问题定位从「大海捞针」变成按图索骥。这张图谱横跨数十个生产基地、数千种产品、数百万个工艺步骤,藏着自 1995 年以来疫苗与药物的完整谱系,以及总计 110 亿条关系与属性数据。西门子 2026 白皮书披露,它为 GSK 省下了约 4 亿美元。这正是制药业从「靠人找」迈向「靠图查」的分水岭。

这不是 AI 制药最抓眼球的故事,却是最「不性感」也最扎实的一类。没有大模型发布会上的惊呼,只有变色药片被知识图谱迅速归位的闭环。对正在为数据孤岛焦头烂额的制药企业来说,它可能比任何概念都更接近真相。因为真正值钱的不是 AI 本身,而是 AI 脚下那张可被信任的数据网络。
背景:制药业的数据债务正在到期
制药业正处于一种矛盾的夹缝里。一边是生物药、细胞与基因疗法把治疗边界推向从前难以想象的高度;另一边是研发成本、监管压力和时间窗口把利润率压得越来越薄。西门子生命科学副总裁 Maria Grahm 在手册中直言:更高的效率、更快的开发周期、更节约资源的生产方式,已不仅是技术命题,更是经济命题。
这种压力的核心不是缺少数据,而是数据没有被治理。实验室笔记本、电子表格、LIMS、文献、ERP、MES 各说各话,科学家每年因低效流程损失约 50 天,10–20% 的开发工作因数据完整性与可访问性问题被迫重复。这不是「缺 AI」的问题,而是 AI 赖以生存的上下文层缺位的典型症状。当企业大谈生成式 AI 时,底层数据往往连最基本的来源、版本、单位、实验条件都没有对齐。
生物药的崛起让这个问题更严重。细胞和基因疗法往往是高度个性化的,一次生产就是一个独特批次,工艺窗口狭窄,质量属性对微小波动极其敏感。这意味着数据不但要全,还要带着工艺上下文、仪器参数、环境条件、操作人员记录。少了这些上下文,再强大的模型也只能在表面拟合,无法进入真正的工艺优化。数据债务一旦到期,利息会以项目延期和合规风险的形式出现。
| 阶段 |
典型痛点 |
数字化抓手 |
| 药物发现 |
数据分散在实验室笔记、文献、LIMS |
知识图谱统一结构化与非结构化数据 |
| 工艺设计 |
试错周期长、参数化困难、样本少 |
数字孪生 + 小样本 ML 快速筛选 |
| 智能制造 |
批次放行慢、异常响应被动、纸质记录多 |
企业级智能体 + 预测性质量闭环 |
方法:把 PLM 哲学搬进分子世界
西门子对制药业的判断带着明显的制造业基因。它把制药行业比作 25 年前的 PLM:disparate applications, no APIs, no enterprise-level data integration。离散制造走过的路——以产品生命周期管理为核心、把数据完整性作为系统级能力——正在被复制到分子科学。药品也是一种产品,只是它的「零件」是原子和细胞,它的「BOM」是配方和工艺参数。

这一战略最近的动作是 51 亿美元收购 Dotmatics。这家生命科学研究软件商填补的不是某个单点工具,而是企业级数据管理层。配合 Teamcenter Copilot——2024 年已经在世界上最成熟的产品数据管理系统上落地的 AI 助手——西门子试图把「数据准确性、可用性、完整性」做成制药 AI 的默认底座。你向 Copilot 问「前五名保修热点」,它会用 RapidMiner 分析数据、预测严重度并定位风险;这种问答式交互,核心在于把工程领域的经验迁移到药物研发。
制造业的成熟方法论之所以适用,是因为制药业同样在追逐一个核心目标:在正确的时间把正确的信息交给正确的人。无论是设计变更的影响分析,还是质量偏差的根因追溯,底层逻辑都是同一套——先让数据被找到、被理解、被信任,再让 AI 开始工作。
研发:Luma 把时间还给科学家
在研发侧,西门子把这套统一底座命名为 Luma。它的目标是让 R&D 不再是一个个孤立的实验记录,而是一个「Design-Make-Test-Decide」的连续循环。每一个实验的数据点、设计意图、决策都被附上科学上下文,成为可被 AI 复用的资产,而不是一次性消耗品。
Luma 要解决的不仅是小分子,还有生物药与细胞和基因疗法这类结构复杂、生产过程敏感的现代疗法。传统系统无法精确表达这些分子结构,导致数据表达失真、流程碎片化。Luma 通过统一数据模型,把不同模态的研发活动拉进同一个上下文层。西门子将其形容为一个 lab-in-a-loop:一个敏捷、智能的生态系统,让科学家更快做出更明智的决策。
其效果很难用一张图说清,但可以从一个数字反推:当科学家不再花 50 天在数据整理上,省下来的时间会回到实验设计、假设验证和跨团队协作里。这省下的不只是工时,更是认知带宽。科学家可以把注意力从「找数据」转向「问更好的问题」。
结果一:110 亿条关系如何锁定变色药片

GSK 案例是 Siemens 白皮书中关于「上下文层」最具体的注脚。它的供应链知识图谱覆盖自 1995 年以来的疫苗与药物谱系,把数十个生产基地、数千种产品、数百万个工艺步骤连成一个可查询网络。总量达到 110 亿条关系和属性数据,底层搭在 Databricks Graph Studio 的战略智能层上。
这个图谱真正发挥作用的时刻并不宏大:当某个瓶子里的药片出现变色,系统需要回答三个问题——问题是不是发生在制造过程中?发生在哪个阶段?成因是什么?在没有统一关系网络之前,这类问题要靠人工逐层排查,邮件往来、系统切换、版本核对可能耗费数周。有了知识图谱,查询可以直接沿关系链下钻:某基地 → 某批次 → 某工序 → 某原料 → 某供应商,把被动响应变成主动溯源。
这张图里的节点类型极其丰富:生产基地、产品、原料、工艺步骤、设备、供应商、检测结果、放行记录,每一种实体之间都有明确关系。它不只是把表格连起来,而是把「某批药在何时由哪台设备用哪套参数生产」这类业务语义编码进网络结构。正是这些关系让查询可以从一个异常现象出发,沿多跳路径锁定根因。
西门子称,这套能力的商业价值约为 4 亿美元。这个数字不是模型算出来的,而是来自「避免停产、减少召回、加速根因分析」的综合节省。知识图谱在这里不是展示品,而是风险收敛的杠杆。它也让 GSK 的 AI 智能体 有了可信的上下文——回答不是从黑盒里生成,而是从可验证的关系网络中检索。
| 案例 |
数据规模 |
核心动作 |
可量化收益 |
| GSK 供应链知识图谱 |
110 亿关系/属性 |
跨基地/产品/工序溯源 |
约 4 亿美元节省 |
| 37 行定向研发 |
37 行可用实验 + 76,800 组合 |
参数化 + 交叉验证 + ML 预测 |
加速研发流程 |
| 薄膜智能制造 |
700 位置 × 43 截面 |
AI 找驱动因素 + 机器人调参 |
废品率降 25% 等 |
结果二:37 行数据如何生出 76,800 种组合
如果说 GSK 案例展示的是「数据多了怎么管」,那么药物定向研发案例展示的是「数据极少怎么搞」。某客户的真实可用实验数据只有 37 行,却要同时满足溶出曲线、硬度等多项药物特性。按传统做法,下一步只能是做更多实验,而实验周期和成本都会把人逼到墙角。
西门子的做法不是再去补做几十轮实验,而是把生产流程参数化:把啮合块位置这类工程参数转成 0/1 特征,用交叉验证压低随机划分带来的误差,再按特定取值生成 76,800 种组合,交给机器学习模型快速预测药物属性。研究人员只在预测结果里挑选符合目标的工艺原料组合进行真实验证。

参数化的精妙之处在于把工程师的工艺语言翻译成模型能理解的结构化语言。一个螺杆上啮合块的位置、一段工艺中的温度曲线、一次混合的剪切速率——这些原本散落在操作规程里的经验,被编码成离散或连续特征。交叉验证则确保模型不会因为 37 行数据的随机划分而给出过于乐观的预测。模型学习的是参数组合与药物属性之间的映射,而不是记忆某一次实验结果。
这个方法的边界也很清楚:它不能替代湿实验,但能大幅压缩需要做的湿实验数量。37 行不是被「放大」成 76,800 个真实样本,而是被用来生成候选空间,再由人类专家做最终判断。这背后是一种务实的小样本学习哲学:与其追求一个万能模型,不如把先验知识编码进特征工程,让模型在人类可解释的结构里搜索。
结果三:薄膜产线的人在回路优化

智能制造一侧的案例来自西门子白皮书所引用的 WEF 全球灯塔网络 2026 公开材料。薄膜生产过程中,材料厚度的均匀性直接决定成品率。AI 分析了约 700 个位置的材料厚度,切成 43 个截面去寻找关键驱动因素;智能机器人根据分析结果自动调整参数,但每一次变更都由操作员确认。

这种「人在回路」不是点缀,而是设计原则:AI 给出建议,机器人执行动作,人类保留最终确认权。结果是厚度稳定时间下降 25%,厚度偏差导致的降级减少 53%,废品率减少 25%。在速度控制场景中,换型启动时间缩短 50%,性能损失减少 57%,速度相关缺陷率降低 37%。
这些数字的真正意义不在于百分比本身,而在于它们发生在一个强调可追溯、可审计、权责明确的体系里。智能制造的合规风险极高,「算法建议 + 人工确认 + 全记录留痕」的组合,才是制药场景可复制的模板。机器人做了什么、为什么这么做、谁确认了、参数如何回滚,全部有据可查。
这张产线上的知识网络也并不复杂。它收集厚度传感器、速度控制器、机器人动作、人工确认、环境变量,把它们关联到一个统一的因果模型里。AI 不是神秘地给出答案,而是把「哪些位置、哪些截面、哪些参数组合导致了波动」可视化给操作员。工人的经验仍然重要,只是不再被淹没在噪声里。
核心创新:贯穿药物全生命周期的数字主线
把 GSK、37 行实验、薄膜产线串起来看,西门子的真正产品不是某个单点工具,而是一条数字主线(digital thread)。它从药物发现的知识图谱出发,经过工艺设计的数字孪生,最终进入智能制造的智能体平台,让早期的科学上下文在下游工艺与生产中被继承。
这条主线的关键特征有三点。
第一,上下文连续性。实验阶段捕获的科学意图、配方版本、分析方法,在放大生产和批次放行阶段仍然可被调用,不会因为团队交接而丢失。
第二,数据可审计性。每个行动、每个决策、每个模型输出都能追溯到具体数据、人员和版本。这不是为了漂亮,而是为了满足 FDA、EMA 等监管机构的审查要求。
第三,人在回路。AI 负责快速预测与筛选,人类负责确认与权责承担,机器人负责可重复执行。三者之间的边界清晰,任何一环出了问题都能单独排查。
数字主线的直接收益是减少交接损失。工艺团队不需要重新理解研发团队的实验假设,质量团队不需要在纸质记录里翻找批次历史,供应链团队可以看到某一批异常产品与上游工艺参数的关联。这种继承性让知识从「个人记忆」变成「组织资产」。
这条主线解决的不是「有没有 AI」,而是「AI 能不能在受控环境中持续产生可解释的价值」。没有这条主线,AI 模型就是孤岛里的聪明人;有了它,AI 才能成为企业级能力。
局限与边界:60% 的 AI 项目为何失败
Gartner 的数据被西门子白皮书反复引用:60% 的 AI 项目因缺乏 AI-ready 数据而被放弃。这个数字为所有炫目的案例按下了暂停键。知识图谱省下的 4 亿美元值得羡慕,但如果企业的 ERP、MES、LIMS、文档系统口径不一、主数据混乱、实验记录缺少上下文,那么 AI 只能在干净的 POC 里表演,无法进入生产线。
另一个更冷峻的数据来自员工感知:65% 的员工认为 AI 对个人有帮助,但只有 12% 认为 AI 真正改变了组织。这说明技术落地和个人体验之间存在巨大鸿沟。AI 在制药业不是缺能力,而是缺让能力规模化扎根的治理机制。一个模型在 Jupyter Notebook 里跑得漂亮,并不代表它能在 37 个基地、数千个 SKU 的复杂网络里跑得稳。
组织层面的滞后尤其值得警惕。数据治理、流程改造、跨部门协作、合规审查——这些工作不性感,却是决定 AI 能否上量的关键。许多企业把预算砸在模型和算力上,却舍不得花同等资源清理数据、对齐语义、建立主数据管理。结果就是模型越来越多,能用的越来越少。
| 边界 |
表现 |
破解路径 |
| 数据孤岛 |
口径不一致、上下文缺失 |
先画数据源地图,统一主数据与语义 |
| 样本稀疏 |
可用实验行数不足 |
参数化 + 仿真 + 交叉验证 + 人在回路验证 |
| 合规信任 |
决策不可追溯、责任模糊 |
电子批记录 + 模型版本管理 + 操作员确认 |
产业影响:从 WEF 灯塔网络看规模化
WEF 全球灯塔网络 2026 年的发布为这场讨论提供了产业级参照。该网络已扩展至 223 家灯塔工厂,覆盖 30 多个国家和 40 个行业。2026 年新增 23 家,其中包括薄膜领域的 Kunlene Film Industries(苏州)。WEF 同时推出了 Lumina 工业智能平台,汇总 1,000 多次成功转型的数据。
Lumina 的数据集显示,94% 的成功转型都结合了多技术域,AI 通常与物联网、云、数字孪生一起部署;把技术变革与人才、可持续战略结合的企业,绩效平均超出同行 16% 以上。这些数字说明:制药业的 AI 想要规模化,不能靠单点模型,必须像 WEF 灯塔企业那样,把技术、组织、数据治理和人才培养打包推进。
这种「打包」并不是口号。它意味着 IT 与 OT 的接口必须标准化,数据科学家与工艺工程师必须共享同一套语义,合规团队必须参与模型设计初期。任何一环被外包或后置,都会在规模化阶段付出数倍代价。薄膜产线能降废品 25%,不是靠一个模型,而是靠传感器、机器人、MES、质量系统、操作员培训同时就位。
对制药企业来说,WEF 的启示很直接:先成为数据治理的灯塔,再谈 AI 的灯塔。否则再多的算法也只能点亮一隅,无法照亮整个生命周期。制药企业如果只看案例里的百分比,很容易误以为买套 AI 软件就能复制。但 Kunlene 苏州的真正投入是在数据接口、传感器、操作员培训、质量体系上同步推进了三十多个用例。没有这些前置条件,再先进的算法也拿不到现场的干净数据,更谈不上持续优化。规模化的第一步,永远是把数据接口对齐这件脏活做完。
结尾:把科学家还给科学
回到 GSK 那 4 亿美元。它的本质不是买了一张花哨的图谱,而是把过去消耗在数据查找、根因排查、跨系统核对上的时间,重新释放给了真正需要人类判断的地方。
知识图谱、数字孪生、智能体、Luma——这些技术不会自己让制药变快。它们只是工具。真正的变化发生在:当科学家的 50 天被还回来,当操作员的确认权被尊重,当每一次 AI 建议都能被追溯到可审计的数据链。
AI 制药的边界不是 AI 能不能生成答案,而是我们有没有把数据治理、组织信任与人的判断放在答案之前。省下 4 亿美元的不是图谱本身,而是那张图谱背后的一套新工作方式。制药业的未来,属于那些既能让算法跑通,也能让人负得起责的组织。唯有如此,科学家才能重新回到科学本身。对从业者而言,最紧迫的问题不再是「模型参数有多大」,而是「关系链能不能被追溯到 1995 年的那一批原料」。这个答案,决定了 AI 到底是工具,还是又一轮昂贵的烟花。
更多技术深度内容,欢迎访问云栈社区。