科研项目全生命周期管理系统
解耦小分子药物抗淀粉样效能与细胞毒性
数据库搜索计划(ChatGPT)
思路汇报
记录科研思路的来源、讨论情况与详细内容
Prompt
我有一个课题的初步想法,内容是纤维抑制能力与细胞毒性的共性研究和分子设计,计划标题是Bridging Amyloid Protection and Cytotoxic Liability: Reprogramming Molecular Recognition for Safer Aggregation Inhibitors.
课题想法主要是:有一类分子,能够破坏纤维或抑制纤维生长(如破坏神经退行性疾病相关纤维),从而可以治疗疾病;但同时具有细胞毒性(可能是与DNA、RNA等、或者与其他分子结合,从而具有细胞毒性)。我们希望提出这么一点,并找到其共性。
第一步做分子筛选,找出上述分子,说明这是一件普遍存在的事情;
第二步解释相互作用机制,例如两种结合的相互作用有共性(如都靠pipi stacking);
第三步,肯定有区别,所以基于上述机制做AI辅助分子设计,如让他还是可以与纤维结合但是降低细胞毒性。。
作为该课题的第一步,先要进行数据库搜索。现在有哪些现存的数据库,包含分子抑制破坏淀粉样纤维、分子细胞毒性数据?我想找一类分子,满足
(1)可以破坏神经退行性疾病相关纤维
(2)具有病理毒性,且其病理毒性与其结合DNA、RNA等正常生物分子有关。
ChatGPT回复
这个课题具有明确的可行性,但目前没有一个数据库能直接检索“既解聚神经退行性淀粉样纤维、又因结合DNA/RNA而产生细胞毒性”的交集。最现实的路线是:
以淀粉样活性数据库为起点,用标准化结构/InChIKey连接核酸结合、细胞毒性和遗传毒性数据库,再对候选物进行文献级机制核验。
第一批最值得研究的分子不是一般“抗淀粉样天然产物”,而是平面多环、带正电荷的DNA嵌入剂,尤其是蒽环类和蒽醌/蒽二酮类。Mitoxantrone(米托蒽醌)是目前最接近你设想的阳性对照。
一、建议使用的数据库组合
| 数据层 | 资源 | 能获得什么 | 主要局限 |
|---|---|---|---|
| 淀粉样纤维配体 | 2025 Amyloid Fibril Ligand Dataset | 2,404个化合物、4,288条Aβ、tau、α-syn纤维结合数据;含SMILES、Kd/Ki/IC50和文献 | 主要是“纤维结合”,不等于抑制或解聚 |
| 聚集/成纤维实验 | ChEMBL | 可按Aβ、tau、α-syn、PrP靶点及aggregation、fibrillization、seeding、disaggregation等实验描述检索 | 同一靶点下混有结合、酶活、细胞表型等异质数据 |
| 高通量聚集筛选 | PubChem BioAssay | 活性和非活性化合物、浓度响应;例如Aβ42成纤维抑制AID 1712、Aβ42 assembly AID 1115567 | ThT/荧光筛选容易出现染料竞争、淬灭和内滤效应 |
| AD动物/转化证据 | AlzPED | AD候选药物、动物模型、病理及认知终点 | 不是原始聚集动力学数据库 |
| 纤维结构 | Amyloid Atlas、Amyloid Explorer | Aβ、tau、α-syn等纤维多态体和结合位点,适合后续结构设计 | 不提供系统的小分子活性数据 |
| 广谱核酸结合 | NALDB | DNA、RNA、G4、triplex、aptamer等核酸配体;Kd、Ki、IC50、ΔTm、序列及文献 | 部分数据较旧,需要重新核验结构和实验条件 |
| 特异RNA结合 | R-BIND 2.0 | 有细胞或动物功能证据的RNA靶向小分子 | 刻意排除了许多普通、非特异性核酸嵌入剂,因此会漏掉一部分“毒性型RNA结合物” |
| G4核酸结合 | G4LDB 2.2 | G-quadruplex DNA/RNA配体、结构与实验信息 | 只覆盖G4/i-motif体系 |
| 核酸-配体结构 | NAKB | 含核酸的PDB结构及配体注释,适合建立DNA/RNA结合结构集 | 有结构不代表有定量毒性 |
| 综合毒性 | EPA CompTox、ToxCast | 细胞毒性、遗传毒性、通路和体内毒性;ToxCast提供cytotoxicity burst等结果 | 很多终点是表型性的,不能直接证明由DNA/RNA结合导致 |
| NIH毒理整合 | NICE/ICE | 整合Tox21、ToxCast、体内毒理和预测数据 | 仍需追溯原始实验 |
| 毒物机制 | T3DB、CTD、OECD eChemPortal | 毒物-靶点、作用机制、遗传毒性和监管危害数据 | 不是统一的CC50数据库 |
| 大规模细胞毒性 | DepMap PRISM、NCI CellMiner | 数百细胞系上的剂量响应,可快速发现强广谱细胞毒性 | 癌细胞杀伤不能直接代表对正常神经元的毒性 |
此外,ChEMBL和PubChem本身也包含大量cell viability、cytotoxicity、DNA damage和topoisomerase实验,结构连接时很方便。
二、最值得优先检查的候选分子
1. Mitoxantrone:目前最接近完整假设
Mitoxantrone可以抑制Aβ42的种子介导延伸、从protofibril向成熟纤维转化以及de novo fibrillization;报道IC50约为1.7–2.5 μM,并在APP转基因小鼠中降低淀粉样病理和寡聚体水平。原始研究
另一方面,它是典型DNA反应性药物:
- DNA嵌入;
- 稳定topoisomerase II–DNA复合物并产生DNA断裂;
- 干扰DNA和RNA合成;
- 还可以直接结合tau pre-mRNA茎环结构。NCI机制说明、tau RNA结合研究
它非常适合作为课题的机制阳性对照。不过严格讲,现有Aβ研究更强地证明了“阻止种子延伸和纤维成熟”,还不是“将已经成熟的Aβ纤维完全溶解”。
2. 蒽环/蒽二酮类:最适合建立机制与SAR系列
建议把以下化合物作为同一系列:
- Doxorubicin
- Daunorubicin/daunomycin
- Mitoxantrone
- Pixantrone
- 4′-iodo-4′-deoxydoxorubicin,IDOX
- 必要时加入ethidium bromide作为工具化合物
一项很接近你课题假设的研究已经发现,EtBr、doxorubicin、mitoxantrone和chelerythrine等DNA嵌入剂可以调节IAPP、AGel、lysozyme和PrP等多种淀粉样蛋白的组装,作者明确提出核酸与淀粉样体系都依赖疏水、π–π堆积和氢键网络。RSC Advances研究
IDOX尤其值得关注:
- 能以高亲和力结合多类天然淀粉样沉积,包括Alzheimer β-amyloid;
- 抑制纤维生长并促进组织沉积清除;
- 能把成熟TTR纤维重塑为无定形物;
- 同时保留典型的DNA嵌入性质。天然淀粉样结合研究、TTR纤维破坏研究
不足是,成熟纤维破坏证据主要来自TTR,而不是成熟Aβ/tau/α-syn纤维。
Pixantrone则适合作为“毒性可拆分”的匹配类似物。它仍结合DNA并抑制topoisomerase II,但与mitoxantrone/doxorubicin相比,铁结合、ROS和心肌损伤较低,且topoisomerase II亚型选择性有所改变。机制比较
因此它不是已经解决问题的“安全分子”,但非常适合研究哪些结构因素控制DNA结合、ROS、topo II毒性和纤维识别。
3. CNS-11、temoporfin:真实tau体系中的“活性+毒性”线索
在患者脑来源tau paired helical filaments的解聚筛选中,研究者使用cryo-EM、定量EM和细胞seeding实验寻找解聚剂。CNS-11显示纤维解聚但具有N2a细胞毒性;temoporfin也因为对biosensor细胞有毒而被排除。Nature Communications研究
这类分子可以证明“强纤维重塑活性和细胞毒性可以共存”,但现有研究没有证明其毒性是由DNA/RNA结合造成。因此适合作为表型阳性对照,而不是核酸机制阳性对照。
4. Tetracycline/doxycycline:非DNA机制的对照系列
Doxycycline、minocycline等可以逆转Aβ或PrP自组装,并对老化纤维产生明显解聚作用。Aβ/hIAPP研究、PrP研究
但它们的主要正常生物分子脱靶更接近核糖体和线粒体翻译系统,而不是DNA嵌入,而且doxycycline本身临床安全窗较大。因此更适合作为“仍能解聚纤维、但不依赖平面核酸嵌入”的机制对照。
还有一个重要现象:doxycycline处理某些成熟纤维时会暂时释放有毒寡聚体,造成短暂细胞毒性。β2-microglobulin研究
这说明必须区分:
- 化合物本身的细胞毒性;
- 化合物与DNA/RNA结合导致的毒性;
- 纤维解聚后释放寡聚体造成的毒性。
三、对“严格满足两个条件”的判断
如果严格要求:
- 已证明解聚预先形成的、成熟的神经退行性疾病相关纤维;
- 已证明存在细胞毒性;
- 又有因果证据说明该毒性来源于DNA/RNA或其他正常生物大分子结合;
目前公开证据中,我没有发现一个所有环节都已经完全闭合的标准分子。
现有证据大致是:
| 分子 | 成熟神经纤维解聚 | DNA/RNA相关毒性 | 综合判断 |
|---|---|---|---|
| Mitoxantrone | 中:强种子延伸/纤维成熟抑制,非严格成熟Aβ解聚 | 强 | 最佳起始阳性对照 |
| IDOX | 中:成熟TTR纤维破坏;结合Alzheimer amyloid | 强 | 最佳跨体系机制证据 |
| Doxorubicin/daunorubicin | 中低:主要为成纤维抑制或protofibril重塑 | 强 | 优秀SAR成员 |
| Pixantrone | 中低:Aβ组装抑制 | 强,但部分毒性降低 | 优秀匹配分子 |
| CNS-11 | 强:患者来源tau纤维解聚 | 有细胞毒性,但原因未知 | 表型阳性、机制待查 |
| Doxycycline | 强:Aβ/PrP成熟纤维解聚 | 核糖体/线粒体相关,不是典型DNA嵌入 | 非核酸机制对照 |
| EGCG | 强:患者来源tau PHF解聚 | 核酸毒性不突出,存在其他多靶点问题 | 抗淀粉样对照 |
这个“证据链尚未闭合”的缺口,反而可以成为课题的重要出发点。
四、建议建立的数据证据分级
必须把“binding、inhibition和disaggregation”分开,否则很容易得到错误结论。
建议把抗淀粉样证据分为:
- A级:患者来源或成熟纤维,经EM/AFM/cryo-EM证明数量或长度下降,同时seeding能力和不可溶组分下降。
- B级:重组蛋白预形成成熟纤维,经至少两种正交实验确认解聚。
- C级:抑制种子延伸、secondary nucleation或protofibril向纤维转化。
- D级:仅抑制de novo fibrillization,尤其是只有ThT读数。
核心数据字段至少包括:
- amyloid_target:Aβ40、Aβ42、tau、α-syn、PrP、mHTT、TDP-43等;
- assembly_state:monomer、oligomer、seed、protofibril、mature fibril、patient-derived fibril;
- effect_type:nucleation、elongation、seeding、remodeling、disaggregation;
- potency与处理时间;
- 正交实验方法;
- DNA/RNA结合模式和Kd/Ki/ΔTm;
- topo II、DNA damage、RNA translation等机制;
- 正常神经元、胶质细胞、心肌细胞、肝细胞的CC50;
- 化合物本身毒性与解聚产物毒性。
可定义两个很有用的指标:
[ SI_{mathrm{tox/amyloid}} =log_{10}left(frac{CC_{50, normal cell}} {IC_{50, amyloid}}right) ][ SI_{mathrm{recognition}} =log_{10}left(frac{K_d^{DNA/RNA}} {K_d^{fibril}}right) ]
两个指标越大,分别表示治疗窗口越好、越偏向纤维识别而非核酸识别。
五、最推荐的第一轮执行方案
- 从2025 fibril ligand dataset提取Aβ、tau、α-syn配体,补充ChEMBL和PubChem中的aggregation/seeding/disaggregation实验。
- 统一母体结构、盐型、canonical SMILES和InChIKey,保留立体化学和代谢物关系。
- 与NALDB、R-BIND、G4LDB和NAKB进行结构连接,标注intercalation、groove binding、G4 binding和RNA motif binding。
- 与CompTox/NICE、PubChem/ChEMBL cytotoxicity、PRISM及CellMiner连接。
- 对排名前20–50个化合物人工阅读原始文献,特别核验:
- 是否真的是预形成纤维解聚;
- 是否只有ThT荧光下降;
- 毒性是否与抗淀粉样有效浓度重叠;
- DNA/RNA结合和毒性之间是否具有因果证据。
- 第一轮实验可围绕以下matched set展开:
- Mitoxantrone
- Pixantrone
- Doxorubicin
- Daunorubicin
- IDOX
- Ethidium bromide
- CNS-11或temoporfin作为“解聚+毒性”表型对照
- EGCG和doxycycline作为非典型核酸嵌入对照
最后需要注意,2017年的DNA intercalator–amyloid研究已经覆盖了“核酸嵌入剂也能调节淀粉样组装”这一基本概念。因此课题创新点最好不要只停留在“二者都依赖π–π stacking”,而应落在:
系统性的跨数据库共性证明、成熟纤维解聚的严格证据分级、核酸结合与细胞毒性的因果拆分,以及利用结构/AI定量提升“纤维相对核酸”的识别选择性。
相应地,标题可以进一步收紧为:
Decoupling Amyloid Recognition from Nucleic-Acid Liability: Mechanism-Resolved Screening and Molecular Reprogramming of Aggregation Inhibitors
Prompt 2
我不想做实验。第一轮可以否都设计成搜索和计算筛选,不要其他步骤
ChatGPT回复
完全可以。第一轮可以设计为纯数据库检索、文献挖掘和计算筛选,不包含任何湿实验。更准确地说,第一轮的目标不是“实验上证明因果关系”,而是:
建立跨数据库证据图谱,确认这种“抗淀粉样活性—核酸结合—细胞毒性”重叠是否具有统计普遍性,识别其共同分子特征,并产生可供后续设计的高置信候选集。
第一轮总体设计
```mermaid
flowchart LR
A["淀粉样活性数据<br/>结合/抑制/解聚"] --> D["结构标准化<br/>InChIKey连接"]
B["DNA/RNA结合数据<br/>嵌入/G4/RNA motif"] --> D
C["细胞毒性与遗传毒性<br/>CC50/DNA damage/Topo II"] --> D
D --> E["证据分级与人工核验"]
E --> F["统计富集和化学空间分析"]
F --> G["纤维–核酸竞争性计算"]
G --> H["多目标AI筛选与分子设计"]
H --> I["优先候选物与可解释设计规则"]
```
工作包1:构建跨数据库分子集合
1. 抗淀粉样分子集合
来源:
- 2025 Amyloid Fibril Ligand Dataset
- ChEMBL
- PubChem BioAssay
- AlzPED
- 论文补充材料
检索靶点:
- Aβ40、Aβ42
- tau
- α-synuclein
- PrP
- mHTT/polyQ
- TDP-43、FUS
所有记录按作用阶段分类:
| 标签 | 含义 |
|---|---|
| Binding | 仅证明结合纤维 |
| Formation inhibition | 抑制从单体形成纤维 |
| Seed inhibition | 抑制种子介导的延伸 |
| Remodeling | 改变纤维形态或聚集状态 |
| Disaggregation | 解聚预先形成的成熟纤维 |
| Seeding reduction | 降低处理后纤维的播种能力 |
这一分类非常重要,不能把“ThT下降”统一称为纤维解聚。
2. 核酸结合和核酸损伤集合
来源:
- NALDB
- R-BIND
- G4LDB
- NAKB/PDB
- ChEMBL、PubChem
- topoisomerase I/II相关实验
建议把核酸作用进一步拆为:
- DNA intercalation
- DNA groove binding
- G-quadruplex DNA/RNA binding
- sequence-specific RNA binding
- nonspecific electrostatic binding
- topoisomerase–DNA complex stabilization
- DNA/RNA synthesis inhibition
- DNA strand break/genotoxicity
这样可以检验究竟是“π–π堆积本身”还是“平面性+正电荷+核酸嵌入几何”导致毒性。
3. 细胞毒性集合
来源:
- CompTox/ToxCast
- NICE/ICE
- ChEMBL、PubChem cytotoxicity assays
- DepMap PRISM
- NCI CellMiner
- T3DB、CTD、eChemPortal
优先保留:
- 正常神经元和胶质细胞
- iPSC-derived neuron
- 心肌细胞
- 肝细胞
- 一般非肿瘤细胞
- 遗传毒性、微核、comet、γH2AX等终点
癌细胞IC50可以作为“广谱细胞杀伤”信号,但不能直接等同于正常细胞毒性。
工作包2:结构标准化与证据图谱
以化学结构而不是分子名称连接数据库:
- 去除盐和溶剂;
- 统一母体化合物;
- 标准化芳香性、互变异构体和电荷;
- 生成canonical SMILES;
- 生成完整InChIKey和connectivity InChIKey;
- 保留立体异构体、代谢物及前药关系;
- 计算实验pH下可能的质子化状态。
最终每个分子形成一条证据链:
化学结构 → 淀粉样靶点 → 聚集阶段 → 活性浓度 → 核酸靶点及结合方式 → 细胞毒性浓度 → 毒性机制 → 原始文献
建议把“直接证据”和“模型预测”分开存储,不能混在一个字段里。
工作包3:检验这种重叠是否普遍存在
不只是列举几个案例,而是做统计检验。
对照组设计
至少构建四组:
- 抗淀粉样活性+核酸结合/细胞毒性;
- 抗淀粉样活性+低核酸结合;
- 核酸结合/细胞毒性+无抗淀粉样活性;
- 两类活性均无的matched decoys。
对照物需要按分子量、logP、芳香环数等匹配,避免得出“分子越疏水越容易什么都结合”的伪结论。
统计分析
比较以下性质的富集程度:
- 芳香环数量与最大稠合芳香表面积;
- 分子平面性;
- 芳香原子比例;
- 正电荷数量和pKa;
- cLogP/logD;
- 氢键供受体分布;
- 分子柔性;
- fraction sp³;
- polar surface area;
- 自聚集和胶体形成倾向;
- PAINS、荧光干扰和氧化还原活性。
可使用:
- Fisher精确检验;
- logistic regression;
- propensity-score matching;
- permutation test;
- scaffold enrichment;
- matched molecular-pair analysis;
- SHAP等可解释性分析。
核心问题是:
在控制分子量、疏水性和一般药物样性质后,平面多环结构、正电性和π表面积是否仍显著预测“抗淀粉样活性+核酸毒性”的重叠?
这比简单展示mitoxantrone等案例更能支持“普遍存在”。
工作包4:纤维与核酸竞争性结构计算
建议采用“多受体、相对选择性”设计,不只对一个蛋白做一次 docking。
受体集合
淀粉样纤维:
- Aβ40/42不同多态体;
- AD患者来源tau PHF/SF;
- α-syn不同疾病多态体;
- PrP或其他目标纤维。
脱靶集合:
- B-DNA代表序列;
- GC-rich和AT-rich DNA;
- G-quadruplex DNA;
- 双链RNA;
- RNA stem-loop;
- 必要时加入topoisomerase II–DNA复合物。
计算层级
- Ensemble docking:对多个纤维多态体和核酸构象筛选;
- 显式溶剂MD:检查结合姿势是否稳定;
- MM/GBSA或其他相对自由能方法:用于排序;
- interaction fingerprint:比较π–π、阳离子–π、盐桥、疏水和氢键;
- 计算纤维相对于核酸的选择性。
可以定义:
[ DeltaDelta G_{mathrm{selectivity}} = Delta G_{mathrm{fibril}} - Delta G_{mathrm{DNA/RNA}} ]
但绝对值会受方法误差影响,最好用于同骨架类似物之间的相对比较,而不是宣称精确结合常数。
特别需要避免把“对纤维的强docking score”直接解释为“能够解聚纤维”。解聚属于动力学和构象重塑问题,静态对接最多说明结合可能性。解聚倾向需要结合:
- 是否占据protofilament界面;
- 是否破坏steric zipper;
- 是否竞争关键芳香侧链堆积;
- MD中是否增加界面水化;
- 是否降低protofilament接触稳定性。
工作包5:AI多任务预测
可以建立三个主要预测任务:
[ P_{mathrm{amyloid}},quad P_{mathrm{NA-binding}},quad P_{mathrm{cytotoxicity}} ]
其中抗淀粉样任务最好继续拆分为:
- fibril binding;
- formation inhibition;
- seeded growth inhibition;
- mature fibril disaggregation。
推荐采用“传统模型+图神经网络”并行:
- Morgan fingerprint + random forest/XGBoost;
- 图神经网络或分子预训练模型;
- scaffold split;
- time split或文献年代切分;
- 外部数据库验证。
不能使用随机切分作为唯一结果,因为同一系列类似物进入训练集和测试集会严重高估性能。
最终做Pareto多目标排序:
- 最大化成熟纤维结合/解聚可能性;
- 最小化DNA/RNA结合;
- 最小化正常细胞毒性;
- 控制溶解度、logD、BBB、代谢稳定性和胶体聚集风险。
工作包6:纯计算分子重设计
第一轮就可以进行生成式或规则驱动设计,但建议从matched molecular pairs开始,比直接“AI生成几万个新分子”更可解释。
优先研究的结构改造包括:
- 降低完整分子平面性;
- 引入适量sp³中心;
- 用位阻阻止插入DNA碱基对;
- 降低永久正电荷;
- 重新分布正电荷,避免连续阳离子表面;
- 保留适合纤维沟槽的定向氢键;
- 保留对特定cross-β cleft的形状互补;
- 限制能进入DNA夹层的最小平面尺寸;
- 增加对纤维表面非核酸型残基的特异相互作用。
Mitoxantrone–pixantrone–doxorubicin–IDOX系列很适合做第一组matched-pair学习对象。
第一轮的建议输出
完全不做实验时,第一轮仍可形成五个实质性成果:
- 一个结构标准化的跨数据库数据集;
- “抗淀粉样—核酸结合—细胞毒性”证据图谱;
- 关于重叠是否具有统计普遍性的定量结果;
- 一套可解释的共同识别特征和选择性规则;
- 约20–50个已有候选物,以及50–200个计算设计分子的优先级清单。
论文或课题表述应使用:
- computationally prioritized;
- database-supported;
- predicted recognition selectivity;
- literature-supported mechanistic association。
暂时不要使用“证明核酸结合导致细胞毒性”或“证明分子能够解聚成熟纤维”,除非已经有对应的公开实验文献。
因此,第一轮可以概括为三个纯计算研究目标:
Aim 1: 构建抗淀粉样活性、核酸结合和细胞毒性的跨数据库证据图谱。
Aim 2: 识别三类活性重叠的共同分子识别机制并建立预测模型。
Aim 3: 通过多目标计算设计,提高纤维相对核酸的识别选择性,生成低毒候选分子。
这样的第一轮本身已经可以形成一篇数据库/化学信息学论文,并为后续是否需要实验验证保留选择,而不必在当前课题阶段安排湿实验。
附件资料
与本次汇报相关的图片、文档和其他文件