建议收藏!免费下载 SGC 蛋白质-配体数据的 3 条宝藏路径
- 2026-10-11 06:20:42
建议收藏!免费下载 SGC 蛋白质-配体数据的 3 条宝藏路径

SGC(Structural Genomics Consortium,结构基因组学联盟)作为一个致力于“开放科学”的组织,其核心是将生成的所有数据和研究成果无限制地免费公开(Public Domain)。它的主要目标是为药物研发相关的医学蛋白质提供基础支持。
根据SGC的平台和公开资源,他们目前主要收录、生成并公开以下几类核心数据和资源:
1. 蛋白质三维结构数据 (Protein Structures)
- 结构解析数据:自2003年成立以来,SGC 已经解析并公开了 超过 4,000 个 人类蛋白质的三维结构。这些蛋白质大都是与医学和潜在药物研发相关的
- 公共存取:
这些结构数据通常会提交到公共数据库中,例如蛋白质数据库 (PDB, Protein Data Bank)。 - 复合物结构:
包括蛋白质与合成小分子结合的复合物结构(借助英国牛津郡的 Diamond 同步辐射光源合作完成)。
2. 化学探针数据 (Chemical Probes)
SGC 的重点项目是开发“化学探针”,这是一种用于研究特定蛋白质在细胞内功能的小分子抑制剂。他们优先关注那些相对“未被充分研究”的蛋白质家族(暗蛋白质组 / Dark Proteome),探索其在健康和疾病中的作用。过去十年间,SGC 已经向公共领域贡献了 约 120 多种(接近 200 种) 高质量的化学探针。他们不仅公开探针的化学结构信息,还免费向科学界分发了超过 25,000 份探针样本。
3. 生物试剂与实验资源 (Reagents & Protocols)
- 质粒库 (Plasmid Collection):
包含了用于表达各种目标蛋白质的质粒载体。科学家可以通过平台(如 Addgene)申请获取来自 SGC 多伦多、牛津、斯德哥尔摩等节点的表达质粒。 - 蛋白质生产方案:
共享用于纯化和制备特定蛋白质的方法和协议。 - 检测和分析方法 (Assays):
开发和公开筛选分析法,例如支持 IDG(Illuminating the Druggable Genome)联盟的 NanoBRET 检测技术等。
4. 数据集与机器学习应用 (AI-Ready Datasets)
为了支持 Target 2035 计划以及计算科学和人工智能(AI)在药物发现中的应用,SGC 正在积极构建兼容机器学习的大规模数据集:
- 蛋白质-配体结合数据 (Protein-ligand binding data):他们计划利用如亲和选择质谱 (AS-MS) 等技术,为超过 2000 种不同的人类蛋白质生成结合数据,用于训练和测试机器学习模型
- AIRCHECK (人工智能就绪的化学知识库):
正如前面提到的,提供结构化、高质量的数据,用于优化小分子-蛋白质相互作用的预测模型。 - 基准测试数据集 (Benchmarking Datasets):
面向 CACHE、MAINFRAME 等计划开放,提供经过实验验证的靶向结合数据。
5. 生物信息学资源与数据门户 (Bioinformatics Resources)
SGC 维护了多个在线门户,整合其生成的各类结构和化学数据:
- ChemBioPort:
这是一个在线门户,用于导航和查询人类蛋白质组的结构、功能以及对应的化学抑制剂信息。 - ChromoHub:
这是一个专门针对染色质相关蛋白质结构和功能数据的导航枢纽。 - (可能还有 UbiHub 等特定靶点的门户网站)。
6. 靶点促成包 (Target Enabling Packages, TEPs)
TEP 是一种整合资源包,专门针对那些在遗传学上与关键疾病相关联的靶点蛋白质。 它汇集了有关该靶点的生化、化学试剂和专业知识,旨在催化科学家对这些新靶点进行早期的探索和表征。
本文来自网友投稿或网络内容,如有侵犯您的权益请联系我们删除,联系邮箱:wyl860211@qq.com 。