AI 圈大事记

新基准TopU-LBVS针对配体虚拟筛选引入难负样本评估

论文AI 评分 65/100arXiv cs.AI待复核
AI 聚合

本条为 AI 依据下方公开信源自动整理生成的摘要,不构成转载,可能存在偏差,请以原文为准。整理者:贝果科技 AI 资讯助手。

针对配体虚拟筛选现有基准易高估性能的问题,研究团队推出多靶点基准TopU-LBVS。该工具基于ChEMBL 35数据,覆盖7类共93个蛋白靶点,以1:40比例构建含性质匹配且结构相似诱饵的筛选库,旨在消除物理化学与近邻指纹捷径。其提供三种固定协议:全量泛化、低数据学习及含随机诱饵对照的七靶点精简版。十种基线测试表明,随机诱饵下的表现在难负样本筛选时显著下降。代码与数据已公开。

全文梳理

AI 摘要依据下方信源原文自动整理,非原文转载

现有评估高估性能

配体虚拟筛选是早期药物发现的实用初筛工具,但当前基准常因采用随机负样本、简单诱饵、靶点覆盖有限及非标准化评估协议而导致性能被高估。TopU-LBVS旨在解决这些问题,通过构建难负样本筛选条件,提供更贴近真实的评估环境,迫使模型无法再依赖简单的物理化学性质或近邻指纹捷径来做出判断。

基准构建与协议设计

该基准基于ChEMBL 35生物活性数据构建,涵盖7个蛋白大类共93个靶点。每个靶点的筛选库包含约400至10000个化合物,活性分子与诱饵的比例固定为1:40,且诱饵在性质上匹配、结构上相似。基准提供三种固定评估协议:TopU-LBVS-full评估跨93个靶点的泛化能力;TopU-LBVS-low评估难负样本分布下的低数据学习;TopU-LBVS-mini提供紧凑的七靶点协议,配对随机诱饵对照,便于低成本开发并直接测量随机与难负样本诱饵间的差距。

基线测试与开源情况

研究团队在指纹方法、分子图神经网络、指纹混合模型及现代分子模型等十种参考基线上进行测试。结果显示,在随机诱饵评估下表现良好的模型,在切换至难负样本筛选条件时性能急剧退化。为支持未来配体虚拟筛选与分子表征学习方法的可复现比较,团队已公开相关数据、固定数据划分、评估代码及基线实现。

为什么值得看

揭示传统随机诱饵评估与真实难负样本间的巨大性能落差,为分子表征学习提供更严苛的测试床。

信源1 家

  1. [1]arXiv cs.AI一手信源TopU-LBVS: A Realistic Multi Target Benchmark for Ligand Based Virtual Screening

关键事实

  • TopU-LBVS覆盖7个蛋白类别的93个蛋白靶点,活性与诱饵比例固定为1:40[1]

  • 基准提供三种协议:全量泛化、低数据学习及七靶点精简版[1]

  • 十种基线模型在难负样本筛选下性能较随机诱饵评估大幅下降[1]

  • 数据源自ChEMBL 35,代码与评估脚本已开源[1]

相关 · 论文

本页内容由 AI 自动聚合公开信源生成,仅供了解行业动态参考,不构成任何投资或决策建议。如需引用请以原文出处为准。