理解 AI 制药:
数据为什么是最难的一环
这篇文章用最直白的方式,讲清楚 AI 制药需要什么数据、这些数据干什么用、以及 数药智库 如何把这些数据变成可决策的靶点报告。
1. 靶点是什么?
在讲数据之前,先理解一件事:AI制药在"研究什么"。
你身体里有几万种蛋白质,它们像机器一样维持生命运转。但当某个蛋白质出了问题(过度活跃、异常表达、突变),就会导致疾病。
这个"出问题的蛋白质",就是靶点(Target)。药物研发的目标,就是设计一种分子(小分子、抗体、RNA药物等)去"修复"或"阻断"这个蛋白质。
AI制药要做的:找到正确的锁,并设计出能打开它的钥匙。
2. 药物发现的全流程
从"疾病"到"上市药物",需要经过这样的步骤:
蓝色节点是"干实验室"环节(用计算机做),黄色节点是"湿实验室"环节(用真实试剂做)。
传统方式,一个药物从0到上市平均需要 10-15年,耗资 10-26亿美元,而90%以上的候选药物会在临床阶段失败。
3. 为什么数据是最难的一环?
很多人以为AI制药的瓶颈是"算法"。但现实恰恰相反:算法是公开的,算力可以租,只有数据是稀缺的。
数据难在哪?三个层面:
① 数据分散在几十个数据库里
你研究一个靶点,需要从Open Targets查疾病关联、去UniProt找蛋白序列、去PDB找3D结构、去TTD查成药性、去DepMap看CRISPR筛选…… 每个数据库格式不同、命名不同、更新频率不同。
② 命名混乱
同一个基因,有人叫 HER2、有人叫 ERBB2、有人叫 NEU、有人叫 CD340。
程序要做字符串匹配,一不小心就匹配错了。
③ 数据质量参差
公共数据库里有实验数据、有AI预测数据、有文献报道、有自动注释。哪些可信、哪些是噪声,需要专业判断。
📊 行业共识
生物医药领域的研究者,平均花费 50%-60% 的时间在手动整理和清洗数据上,而不是在真正的科学发现上。
4. 十大数据源全景
数药智库 整合了 10 个权威数据源,每个数据源回答 AI 制药中的一个关键问题。
Open Targets · 靶点-疾病关联
回答:"哪些蛋白质和这个疾病有关?" 它整合遗传学、文献、表达等多维证据,为每个"靶点-疾病"组合打出一个综合评分。 评分≥0.5的靶点,通常被认为有足够的研究价值。
UniProt · 蛋白质序列与功能
回答:"这个蛋白质长什么样?" 提供蛋白质的氨基酸序列(就是20种氨基酸组成的字符串)、功能注释、变异信息。 是AI模型的"基础输入"——因为蛋白质序列决定了它的形状和功能。
PDB · 蛋白质3D结构
回答:"这个蛋白质的形状是什么?" 存储科学家用X射线、冷冻电镜等方法解析出的3D结构。 有了结构,才能做分子对接——把候选药物分子"塞"进蛋白质的口袋里,看能不能匹配。
TTD · 成药性与调控网络
回答多个问题:
• "有人做过这个靶点的药吗?" → 成药性评估
• "它和谁一起工作?" → PPI互作网络
• "谁在调控它?" → miRNA调控
• "它参与哪些信号通路?" → 生物通路
DepMap · CRISPR基因筛选
回答:"如果敲除这个基因,癌细胞会死吗?" 用CRISPR技术逐个敲除癌细胞中的基因,看细胞是否还能存活。 如果某个基因敲除后癌细胞死了,说明它是"必需基因"——但同时,作为靶点可能有毒性风险,因为正常细胞也需要它。
STRING · 蛋白质互作网络
回答:"这个蛋白质和谁有关系?" 整合实验、文献、共表达等证据,构建了一个超级大的蛋白质"社交网络"(超过200亿对关系)。 通过它,可以找到靶点上下游的调控关系,也可以发现新的潜在靶点。
HPA · 人体组织分布
回答:"这个蛋白质在人体的哪些组织表达?" 如果靶点只在病变组织高表达、在正常组织不表达,那么针对它做药就有"治疗窗口"。 反之,如果它在心脏、肝脏等重要器官也高表达,那么药物可能有严重副作用。
ChEMBL · 化合物活性数据
回答:"有什么分子能作用于这个靶点?" 人工从文献中提取的化合物-靶点活性数据(IC50、Ki等)。 这些是AI训练的"正样本"——让模型知道"什么样的分子能结合靶点"。
InertDB · 惰性化合物(负样本)
回答:"什么样的分子没活性?" AI模型需要"正样本"(有活性)和"负样本"(无活性)才能学会区分。 InertDB提供了6.7万个"实验证明无活性"的化合物,填补了负样本的空白。
Open Targets 26.09 · 可成药性画像 🆕
回答三个维度的问题:
• "能做药吗?" → 4 种模态可及性(小分子 / 抗体 / PROTAC / 其他)
• "是必需基因吗?" → CRISPR 组织筛选
• "有没有安全性事件?" → 已知不良事件库
这三层证据是"能否成药 + 会不会毒"的核心。
ClinicalTrials.gov · 全球临床试验 🆕
回答:"这个靶点竞争激烈吗?" 从已上市药物的名称反查全球临床试验,聚合出每个靶点的试验总数。 ≥ 1000 项 = 红海,< 20 项 = 蓝海机会。 客户立项时最先看的就是这个——"红海里的靶点,我们要不要差异化?"
5. 数据之间的关系
这些数据不是独立的,它们通过基因符号(Gene Symbol)和UniProt ID串联成一张网。
| 数据源 | 提供什么 | 回答的问题 |
|---|---|---|
| Open Targets | 靶点-疾病关联评分 | 这个靶点和疾病有关吗? |
| UniProt | 蛋白序列 + 功能 | 它长什么样? |
| PDB | 3D结构 | 它的形状是什么? |
| TTD | 成药性 + PPI + miRNA + 通路 | 有人做过药吗?和谁协作? |
| DepMap | CRISPR筛选 | 敲除后会死吗?毒性风险? |
| STRING | 蛋白互作网络 | 它的社交圈有多大? |
| HPA | 组织分布 | 在哪些组织表达?有副作用吗? |
| ChEMBL | 化合物活性 | 有什么分子能作用于它? |
| InertDB | 负样本化合物 | 什么样的分子没活性? |
| Open Targets 26.09 🆕 | 可成药性画像 + 必需性 + 安全性 | 能做药吗?是必需基因吗?有什么不良事件? |
| ClinicalTrials.gov 🆕 | 全球临床试验 | 竞争激烈吗?红海还是蓝海? |
• Open Targets 告诉你"他适不适合这个岗位"
• UniProt 告诉你"他的简历"
• PDB 告诉你"他的长相"
• TTD 告诉你"他以前有没有被录用过、和谁一起工作过"
• DepMap 告诉你"如果开除他会怎样"
• STRING 告诉你"他的社交圈"
• HPA 告诉你"他平时在哪里活动"
• ChEMBL 告诉你"哪些管理方式对他有效"
• InertDB 告诉你"什么样的管理方式对他无效"
• Open Targets 26.09 告诉你"他能不能胜任、有没有隐患"
• ClinicalTrials.gov 告诉你"有多少公司在抢这个岗位"
6. 数药智库 做了什么?
数药智库 不做数据生产——所有原始数据都来自上述权威平台。我们做的是:
① 跨源整合
把分散在10个数据库里的数据,通过统一的基因ID对齐,输出一张可以JOIN的表。 用户不用再分别去10个网站下载、清洗、对齐。
② 别名归一
把 HER2、ERBB2、NEU、CD340 识别为同一个基因。
用户搜任意一个名字,都能命中。
③ 标准化清洗
单位统一、缺失值标记、去重、格式规范化。输出ML-Ready的数据集——用户拿到就能直接喂给模型。
④ 一键交付
按疾病打包,包含数据表、数据字典、质量报告、序列、3D 结构。一个 ZIP,开箱即用。
⑤ 多维评分 🆕
9 维度加权评分(TTD 成药性 25% + 可成药性画像 15% + CRISPR 15% + 必需性 10% + 组织分布 10% + 3D 结构 8% + 活性化合物 7% + 安全性 5% + 网络 5%), 输出 A/B/C/D 四级风险分层。所有靶点用同一套标尺横向对比。
⑥ 竞争格局分析 🆕
基于 ClinicalTrials.gov 的临床试验数,自动分析每个靶点是"红海"还是"蓝海"。 客户做立项时一眼就能看出"这个方向还有没有机会"。
⑦ 可定制评分 🆕
5 种预设标准(标准 / 安全性优先 / 数据驱动 / 抗体 / 小分子), 客户可根据研发偏好重新排序。同一个疾病,不同团队看到不同答案。
🎯 一句话定位
数药智库 是"靶点决策平台"——不仅整合 10 个数据源、13 层证据, 还回答"该不该做、能不能做、会不会毒、竞争如何", 输出可直接用于立项、BD 尽调、管线复盘的量化报告。
7. 一句话总结
AI 制药的瓶颈不在算法,在数据。
一个靶点值不值得做药,需要从 13 层证据回答:
它和疾病有关吗?长什么样?什么形状?
有人做过吗?能做药吗?是必需基因吗?
敲除会死吗?和谁协作?在哪表达?
什么分子有效?什么分子无效?
有什么不良事件?竞争激烈吗?
数药智库 把这 13 层证据整合成一份决策报告。