Research Project

解耦小分子药物抗淀粉样效能与细胞毒性

研究方向 药理机制和药物分子设计
项目识别号 2026A01
项目类别 主导项目
Research Progress Report

数据库搜索计划(ChatGPT)

汇报日期:2026年7月17日 项目识别号:2026A01
思路汇报
所属科研项目 解耦小分子药物抗淀粉样效能与细胞毒性
项目识别号 2026A01
项目年份 2026
项目类别 主导项目
Idea Report

思路汇报

记录科研思路的来源、讨论情况与详细内容

思路来源 GPT思考

Prompt

我有一个课题的初步想法,内容是纤维抑制能力与细胞毒性的共性研究和分子设计,计划标题是Bridging Amyloid Protection and Cytotoxic Liability: Reprogramming Molecular Recognition for Safer Aggregation Inhibitors.

课题想法主要是:有一类分子,能够破坏纤维或抑制纤维生长(如破坏神经退行性疾病相关纤维),从而可以治疗疾病;但同时具有细胞毒性(可能是与DNA、RNA等、或者与其他分子结合,从而具有细胞毒性)。我们希望提出这么一点,并找到其共性。

第一步做分子筛选,找出上述分子,说明这是一件普遍存在的事情;
第二步解释相互作用机制,例如两种结合的相互作用有共性(如都靠pipi stacking);
第三步,肯定有区别,所以基于上述机制做AI辅助分子设计,如让他还是可以与纤维结合但是降低细胞毒性。。

作为该课题的第一步,先要进行数据库搜索。现在有哪些现存的数据库,包含分子抑制破坏淀粉样纤维、分子细胞毒性数据?我想找一类分子,满足
(1)可以破坏神经退行性疾病相关纤维
(2)具有病理毒性,且其病理毒性与其结合DNA、RNA等正常生物分子有关。

ChatGPT回复

这个课题具有明确的可行性,但目前没有一个数据库能直接检索“既解聚神经退行性淀粉样纤维、又因结合DNA/RNA而产生细胞毒性”的交集。最现实的路线是:

以淀粉样活性数据库为起点,用标准化结构/InChIKey连接核酸结合、细胞毒性和遗传毒性数据库,再对候选物进行文献级机制核验。

第一批最值得研究的分子不是一般“抗淀粉样天然产物”,而是平面多环、带正电荷的DNA嵌入剂,尤其是蒽环类和蒽醌/蒽二酮类。Mitoxantrone(米托蒽醌)是目前最接近你设想的阳性对照。

一、建议使用的数据库组合

数据层 资源 能获得什么 主要局限
淀粉样纤维配体 2025 Amyloid Fibril Ligand Dataset 2,404个化合物、4,288条Aβ、tau、α-syn纤维结合数据;含SMILES、Kd/Ki/IC50和文献 主要是“纤维结合”,不等于抑制或解聚
聚集/成纤维实验 ChEMBL 可按Aβ、tau、α-syn、PrP靶点及aggregation、fibrillization、seeding、disaggregation等实验描述检索 同一靶点下混有结合、酶活、细胞表型等异质数据
高通量聚集筛选 PubChem BioAssay 活性和非活性化合物、浓度响应;例如Aβ42成纤维抑制AID 1712Aβ42 assembly AID 1115567 ThT/荧光筛选容易出现染料竞争、淬灭和内滤效应
AD动物/转化证据 AlzPED AD候选药物、动物模型、病理及认知终点 不是原始聚集动力学数据库
纤维结构 Amyloid AtlasAmyloid Explorer Aβ、tau、α-syn等纤维多态体和结合位点,适合后续结构设计 不提供系统的小分子活性数据
广谱核酸结合 NALDB DNA、RNA、G4、triplex、aptamer等核酸配体;Kd、Ki、IC50、ΔTm、序列及文献 部分数据较旧,需要重新核验结构和实验条件
特异RNA结合 R-BIND 2.0 有细胞或动物功能证据的RNA靶向小分子 刻意排除了许多普通、非特异性核酸嵌入剂,因此会漏掉一部分“毒性型RNA结合物”
G4核酸结合 G4LDB 2.2 G-quadruplex DNA/RNA配体、结构与实验信息 只覆盖G4/i-motif体系
核酸-配体结构 NAKB 含核酸的PDB结构及配体注释,适合建立DNA/RNA结合结构集 有结构不代表有定量毒性
综合毒性 EPA CompToxToxCast 细胞毒性、遗传毒性、通路和体内毒性;ToxCast提供cytotoxicity burst等结果 很多终点是表型性的,不能直接证明由DNA/RNA结合导致
NIH毒理整合 NICE/ICE 整合Tox21、ToxCast、体内毒理和预测数据 仍需追溯原始实验
毒物机制 T3DB、CTD、OECD eChemPortal 毒物-靶点、作用机制、遗传毒性和监管危害数据 不是统一的CC50数据库
大规模细胞毒性 DepMap PRISMNCI CellMiner 数百细胞系上的剂量响应,可快速发现强广谱细胞毒性 癌细胞杀伤不能直接代表对正常神经元的毒性

此外,ChEMBL和PubChem本身也包含大量cell viability、cytotoxicity、DNA damage和topoisomerase实验,结构连接时很方便。

二、最值得优先检查的候选分子

1. Mitoxantrone:目前最接近完整假设

Mitoxantrone可以抑制Aβ42的种子介导延伸、从protofibril向成熟纤维转化以及de novo fibrillization;报道IC50约为1.7–2.5 μM,并在APP转基因小鼠中降低淀粉样病理和寡聚体水平。原始研究

另一方面,它是典型DNA反应性药物:

  • DNA嵌入;
  • 稳定topoisomerase II–DNA复合物并产生DNA断裂;
  • 干扰DNA和RNA合成;
  • 还可以直接结合tau pre-mRNA茎环结构。NCI机制说明tau RNA结合研究

它非常适合作为课题的机制阳性对照。不过严格讲,现有Aβ研究更强地证明了“阻止种子延伸和纤维成熟”,还不是“将已经成熟的Aβ纤维完全溶解”。

2. 蒽环/蒽二酮类:最适合建立机制与SAR系列

建议把以下化合物作为同一系列:

  • Doxorubicin
  • Daunorubicin/daunomycin
  • Mitoxantrone
  • Pixantrone
  • 4′-iodo-4′-deoxydoxorubicin,IDOX
  • 必要时加入ethidium bromide作为工具化合物

一项很接近你课题假设的研究已经发现,EtBr、doxorubicin、mitoxantrone和chelerythrine等DNA嵌入剂可以调节IAPP、AGel、lysozyme和PrP等多种淀粉样蛋白的组装,作者明确提出核酸与淀粉样体系都依赖疏水、π–π堆积和氢键网络。RSC Advances研究

IDOX尤其值得关注:

  • 能以高亲和力结合多类天然淀粉样沉积,包括Alzheimer β-amyloid;
  • 抑制纤维生长并促进组织沉积清除;
  • 能把成熟TTR纤维重塑为无定形物;
  • 同时保留典型的DNA嵌入性质。天然淀粉样结合研究TTR纤维破坏研究

不足是,成熟纤维破坏证据主要来自TTR,而不是成熟Aβ/tau/α-syn纤维。

Pixantrone则适合作为“毒性可拆分”的匹配类似物。它仍结合DNA并抑制topoisomerase II,但与mitoxantrone/doxorubicin相比,铁结合、ROS和心肌损伤较低,且topoisomerase II亚型选择性有所改变。机制比较
因此它不是已经解决问题的“安全分子”,但非常适合研究哪些结构因素控制DNA结合、ROS、topo II毒性和纤维识别。

3. CNS-11、temoporfin:真实tau体系中的“活性+毒性”线索

在患者脑来源tau paired helical filaments的解聚筛选中,研究者使用cryo-EM、定量EM和细胞seeding实验寻找解聚剂。CNS-11显示纤维解聚但具有N2a细胞毒性;temoporfin也因为对biosensor细胞有毒而被排除。Nature Communications研究

这类分子可以证明“强纤维重塑活性和细胞毒性可以共存”,但现有研究没有证明其毒性是由DNA/RNA结合造成。因此适合作为表型阳性对照,而不是核酸机制阳性对照。

4. Tetracycline/doxycycline:非DNA机制的对照系列

Doxycycline、minocycline等可以逆转Aβ或PrP自组装,并对老化纤维产生明显解聚作用。Aβ/hIAPP研究PrP研究

但它们的主要正常生物分子脱靶更接近核糖体和线粒体翻译系统,而不是DNA嵌入,而且doxycycline本身临床安全窗较大。因此更适合作为“仍能解聚纤维、但不依赖平面核酸嵌入”的机制对照。

还有一个重要现象:doxycycline处理某些成熟纤维时会暂时释放有毒寡聚体,造成短暂细胞毒性。β2-microglobulin研究
这说明必须区分:

  1. 化合物本身的细胞毒性;
  2. 化合物与DNA/RNA结合导致的毒性;
  3. 纤维解聚后释放寡聚体造成的毒性。

三、对“严格满足两个条件”的判断

如果严格要求:

  1. 已证明解聚预先形成的、成熟的神经退行性疾病相关纤维;
  2. 已证明存在细胞毒性;
  3. 又有因果证据说明该毒性来源于DNA/RNA或其他正常生物大分子结合;

目前公开证据中,我没有发现一个所有环节都已经完全闭合的标准分子。

现有证据大致是:

分子 成熟神经纤维解聚 DNA/RNA相关毒性 综合判断
Mitoxantrone 中:强种子延伸/纤维成熟抑制,非严格成熟Aβ解聚 最佳起始阳性对照
IDOX 中:成熟TTR纤维破坏;结合Alzheimer amyloid 最佳跨体系机制证据
Doxorubicin/daunorubicin 中低:主要为成纤维抑制或protofibril重塑 优秀SAR成员
Pixantrone 中低:Aβ组装抑制 强,但部分毒性降低 优秀匹配分子
CNS-11 强:患者来源tau纤维解聚 有细胞毒性,但原因未知 表型阳性、机制待查
Doxycycline 强:Aβ/PrP成熟纤维解聚 核糖体/线粒体相关,不是典型DNA嵌入 非核酸机制对照
EGCG 强:患者来源tau PHF解聚 核酸毒性不突出,存在其他多靶点问题 抗淀粉样对照

这个“证据链尚未闭合”的缺口,反而可以成为课题的重要出发点。

四、建议建立的数据证据分级

必须把“binding、inhibition和disaggregation”分开,否则很容易得到错误结论。

建议把抗淀粉样证据分为:

  • A级:患者来源或成熟纤维,经EM/AFM/cryo-EM证明数量或长度下降,同时seeding能力和不可溶组分下降。
  • B级:重组蛋白预形成成熟纤维,经至少两种正交实验确认解聚。
  • C级:抑制种子延伸、secondary nucleation或protofibril向纤维转化。
  • D级:仅抑制de novo fibrillization,尤其是只有ThT读数。

核心数据字段至少包括:

  • amyloid_target:Aβ40、Aβ42、tau、α-syn、PrP、mHTT、TDP-43等;
  • assembly_state:monomer、oligomer、seed、protofibril、mature fibril、patient-derived fibril;
  • effect_type:nucleation、elongation、seeding、remodeling、disaggregation;
  • potency与处理时间;
  • 正交实验方法;
  • DNA/RNA结合模式和Kd/Ki/ΔTm;
  • topo II、DNA damage、RNA translation等机制;
  • 正常神经元、胶质细胞、心肌细胞、肝细胞的CC50;
  • 化合物本身毒性与解聚产物毒性。

可定义两个很有用的指标:

[ SI_{mathrm{tox/amyloid}} =log_{10}left(frac{CC_{50, normal cell}} {IC_{50, amyloid}}right) ][ SI_{mathrm{recognition}} =log_{10}left(frac{K_d^{DNA/RNA}} {K_d^{fibril}}right) ]

两个指标越大,分别表示治疗窗口越好、越偏向纤维识别而非核酸识别。

五、最推荐的第一轮执行方案

  1. 从2025 fibril ligand dataset提取Aβ、tau、α-syn配体,补充ChEMBL和PubChem中的aggregation/seeding/disaggregation实验。
  2. 统一母体结构、盐型、canonical SMILES和InChIKey,保留立体化学和代谢物关系。
  3. 与NALDB、R-BIND、G4LDB和NAKB进行结构连接,标注intercalation、groove binding、G4 binding和RNA motif binding。
  4. 与CompTox/NICE、PubChem/ChEMBL cytotoxicity、PRISM及CellMiner连接。
  5. 对排名前20–50个化合物人工阅读原始文献,特别核验:
    • 是否真的是预形成纤维解聚;
    • 是否只有ThT荧光下降;
    • 毒性是否与抗淀粉样有效浓度重叠;
    • DNA/RNA结合和毒性之间是否具有因果证据。
  6. 第一轮实验可围绕以下matched set展开:
    • Mitoxantrone
    • Pixantrone
    • Doxorubicin
    • Daunorubicin
    • IDOX
    • Ethidium bromide
    • CNS-11或temoporfin作为“解聚+毒性”表型对照
    • EGCG和doxycycline作为非典型核酸嵌入对照

最后需要注意,2017年的DNA intercalator–amyloid研究已经覆盖了“核酸嵌入剂也能调节淀粉样组装”这一基本概念。因此课题创新点最好不要只停留在“二者都依赖π–π stacking”,而应落在:

系统性的跨数据库共性证明、成熟纤维解聚的严格证据分级、核酸结合与细胞毒性的因果拆分,以及利用结构/AI定量提升“纤维相对核酸”的识别选择性。

相应地,标题可以进一步收紧为:

Decoupling Amyloid Recognition from Nucleic-Acid Liability: Mechanism-Resolved Screening and Molecular Reprogramming of Aggregation Inhibitors

Prompt 2

我不想做实验。第一轮可以否都设计成搜索和计算筛选,不要其他步骤

ChatGPT回复

完全可以。第一轮可以设计为纯数据库检索、文献挖掘和计算筛选,不包含任何湿实验。更准确地说,第一轮的目标不是“实验上证明因果关系”,而是:

建立跨数据库证据图谱,确认这种“抗淀粉样活性—核酸结合—细胞毒性”重叠是否具有统计普遍性,识别其共同分子特征,并产生可供后续设计的高置信候选集。

第一轮总体设计

```mermaid
flowchart LR
    A["淀粉样活性数据<br/>结合/抑制/解聚"] --> D["结构标准化<br/>InChIKey连接"]
    B["DNA/RNA结合数据<br/>嵌入/G4/RNA motif"] --> D
    C["细胞毒性与遗传毒性<br/>CC50/DNA damage/Topo II"] --> D
    D --> E["证据分级与人工核验"]
    E --> F["统计富集和化学空间分析"]
    F --> G["纤维–核酸竞争性计算"]
    G --> H["多目标AI筛选与分子设计"]
    H --> I["优先候选物与可解释设计规则"]
```

工作包1:构建跨数据库分子集合

1. 抗淀粉样分子集合

来源:

  • 2025 Amyloid Fibril Ligand Dataset
  • ChEMBL
  • PubChem BioAssay
  • AlzPED
  • 论文补充材料

检索靶点:

  • Aβ40、Aβ42
  • tau
  • α-synuclein
  • PrP
  • mHTT/polyQ
  • TDP-43、FUS

所有记录按作用阶段分类:

标签 含义
Binding 仅证明结合纤维
Formation inhibition 抑制从单体形成纤维
Seed inhibition 抑制种子介导的延伸
Remodeling 改变纤维形态或聚集状态
Disaggregation 解聚预先形成的成熟纤维
Seeding reduction 降低处理后纤维的播种能力

这一分类非常重要,不能把“ThT下降”统一称为纤维解聚。

2. 核酸结合和核酸损伤集合

来源:

  • NALDB
  • R-BIND
  • G4LDB
  • NAKB/PDB
  • ChEMBL、PubChem
  • topoisomerase I/II相关实验

建议把核酸作用进一步拆为:

  • DNA intercalation
  • DNA groove binding
  • G-quadruplex DNA/RNA binding
  • sequence-specific RNA binding
  • nonspecific electrostatic binding
  • topoisomerase–DNA complex stabilization
  • DNA/RNA synthesis inhibition
  • DNA strand break/genotoxicity

这样可以检验究竟是“π–π堆积本身”还是“平面性+正电荷+核酸嵌入几何”导致毒性。

3. 细胞毒性集合

来源:

  • CompTox/ToxCast
  • NICE/ICE
  • ChEMBL、PubChem cytotoxicity assays
  • DepMap PRISM
  • NCI CellMiner
  • T3DB、CTD、eChemPortal

优先保留:

  • 正常神经元和胶质细胞
  • iPSC-derived neuron
  • 心肌细胞
  • 肝细胞
  • 一般非肿瘤细胞
  • 遗传毒性、微核、comet、γH2AX等终点

癌细胞IC50可以作为“广谱细胞杀伤”信号,但不能直接等同于正常细胞毒性。

工作包2:结构标准化与证据图谱

以化学结构而不是分子名称连接数据库:

  • 去除盐和溶剂;
  • 统一母体化合物;
  • 标准化芳香性、互变异构体和电荷;
  • 生成canonical SMILES;
  • 生成完整InChIKey和connectivity InChIKey;
  • 保留立体异构体、代谢物及前药关系;
  • 计算实验pH下可能的质子化状态。

最终每个分子形成一条证据链:

化学结构 → 淀粉样靶点 → 聚集阶段 → 活性浓度 → 核酸靶点及结合方式 → 细胞毒性浓度 → 毒性机制 → 原始文献

建议把“直接证据”和“模型预测”分开存储,不能混在一个字段里。

工作包3:检验这种重叠是否普遍存在

不只是列举几个案例,而是做统计检验。

对照组设计

至少构建四组:

  1. 抗淀粉样活性+核酸结合/细胞毒性;
  2. 抗淀粉样活性+低核酸结合;
  3. 核酸结合/细胞毒性+无抗淀粉样活性;
  4. 两类活性均无的matched decoys。

对照物需要按分子量、logP、芳香环数等匹配,避免得出“分子越疏水越容易什么都结合”的伪结论。

统计分析

比较以下性质的富集程度:

  • 芳香环数量与最大稠合芳香表面积;
  • 分子平面性;
  • 芳香原子比例;
  • 正电荷数量和pKa;
  • cLogP/logD;
  • 氢键供受体分布;
  • 分子柔性;
  • fraction sp³;
  • polar surface area;
  • 自聚集和胶体形成倾向;
  • PAINS、荧光干扰和氧化还原活性。

可使用:

  • Fisher精确检验;
  • logistic regression;
  • propensity-score matching;
  • permutation test;
  • scaffold enrichment;
  • matched molecular-pair analysis;
  • SHAP等可解释性分析。

核心问题是:

在控制分子量、疏水性和一般药物样性质后,平面多环结构、正电性和π表面积是否仍显著预测“抗淀粉样活性+核酸毒性”的重叠?

这比简单展示mitoxantrone等案例更能支持“普遍存在”。

工作包4:纤维与核酸竞争性结构计算

建议采用“多受体、相对选择性”设计,不只对一个蛋白做一次 docking。

受体集合

淀粉样纤维:

  • Aβ40/42不同多态体;
  • AD患者来源tau PHF/SF;
  • α-syn不同疾病多态体;
  • PrP或其他目标纤维。

脱靶集合:

  • B-DNA代表序列;
  • GC-rich和AT-rich DNA;
  • G-quadruplex DNA;
  • 双链RNA;
  • RNA stem-loop;
  • 必要时加入topoisomerase II–DNA复合物。

计算层级

  1. Ensemble docking:对多个纤维多态体和核酸构象筛选;
  2. 显式溶剂MD:检查结合姿势是否稳定;
  3. MM/GBSA或其他相对自由能方法:用于排序;
  4. interaction fingerprint:比较π–π、阳离子–π、盐桥、疏水和氢键;
  5. 计算纤维相对于核酸的选择性。

可以定义:

[ DeltaDelta G_{mathrm{selectivity}} = Delta G_{mathrm{fibril}} - Delta G_{mathrm{DNA/RNA}} ]

但绝对值会受方法误差影响,最好用于同骨架类似物之间的相对比较,而不是宣称精确结合常数。

特别需要避免把“对纤维的强docking score”直接解释为“能够解聚纤维”。解聚属于动力学和构象重塑问题,静态对接最多说明结合可能性。解聚倾向需要结合:

  • 是否占据protofilament界面;
  • 是否破坏steric zipper;
  • 是否竞争关键芳香侧链堆积;
  • MD中是否增加界面水化;
  • 是否降低protofilament接触稳定性。

工作包5:AI多任务预测

可以建立三个主要预测任务:

[ P_{mathrm{amyloid}},quad P_{mathrm{NA-binding}},quad P_{mathrm{cytotoxicity}} ]

其中抗淀粉样任务最好继续拆分为:

  • fibril binding;
  • formation inhibition;
  • seeded growth inhibition;
  • mature fibril disaggregation。

推荐采用“传统模型+图神经网络”并行:

  • Morgan fingerprint + random forest/XGBoost;
  • 图神经网络或分子预训练模型;
  • scaffold split;
  • time split或文献年代切分;
  • 外部数据库验证。

不能使用随机切分作为唯一结果,因为同一系列类似物进入训练集和测试集会严重高估性能。

最终做Pareto多目标排序:

  • 最大化成熟纤维结合/解聚可能性;
  • 最小化DNA/RNA结合;
  • 最小化正常细胞毒性;
  • 控制溶解度、logD、BBB、代谢稳定性和胶体聚集风险。

工作包6:纯计算分子重设计

第一轮就可以进行生成式或规则驱动设计,但建议从matched molecular pairs开始,比直接“AI生成几万个新分子”更可解释。

优先研究的结构改造包括:

  • 降低完整分子平面性;
  • 引入适量sp³中心;
  • 用位阻阻止插入DNA碱基对;
  • 降低永久正电荷;
  • 重新分布正电荷,避免连续阳离子表面;
  • 保留适合纤维沟槽的定向氢键;
  • 保留对特定cross-β cleft的形状互补;
  • 限制能进入DNA夹层的最小平面尺寸;
  • 增加对纤维表面非核酸型残基的特异相互作用。

Mitoxantrone–pixantrone–doxorubicin–IDOX系列很适合做第一组matched-pair学习对象。

第一轮的建议输出

完全不做实验时,第一轮仍可形成五个实质性成果:

  1. 一个结构标准化的跨数据库数据集;
  2. “抗淀粉样—核酸结合—细胞毒性”证据图谱;
  3. 关于重叠是否具有统计普遍性的定量结果;
  4. 一套可解释的共同识别特征和选择性规则;
  5. 约20–50个已有候选物,以及50–200个计算设计分子的优先级清单。

论文或课题表述应使用:

  • computationally prioritized;
  • database-supported;
  • predicted recognition selectivity;
  • literature-supported mechanistic association。

暂时不要使用“证明核酸结合导致细胞毒性”或“证明分子能够解聚成熟纤维”,除非已经有对应的公开实验文献。

因此,第一轮可以概括为三个纯计算研究目标:

Aim 1: 构建抗淀粉样活性、核酸结合和细胞毒性的跨数据库证据图谱。
Aim 2: 识别三类活性重叠的共同分子识别机制并建立预测模型。
Aim 3: 通过多目标计算设计,提高纤维相对核酸的识别选择性,生成低毒候选分子。

这样的第一轮本身已经可以形成一篇数据库/化学信息学论文,并为后续是否需要实验验证保留选择,而不必在当前课题阶段安排湿实验。

Attachments

附件资料

与本次汇报相关的图片、文档和其他文件

本次科研项目进展汇报没有上传附件。