ProtGPS是什么?一文让你看懂ProtGPS的技术原理、主要功能、应用场景

来源:卓商AI
发布时间:2025-04-05

ProtGPS概述简介

ProtGPS(Protein Localization Prediction Model)是麻省理工学院(MIT)和怀特黑德生物医学研究所推出的,基于深度学习的蛋白质语言大模型,用在预测蛋白质在细胞内的亚细胞定位。ProtGPS基于分析蛋白质的氨基酸序列,用进化尺度的蛋白质变换器(Transformer)架构学习序列中的复杂模式和相互关系。ProtGPS能预测蛋白质在12种不同亚细胞区域(如核仁、核斑点等)的分布概率,成功指导生成能特异性组装到特定亚细胞区域的新型蛋白质序列。ProtGPS能识别导致蛋白质亚细胞定位改变的致病突变,为理解细胞功能和疾病机制提供新的工具和视角。

ProtGPS的功能特色

预测蛋白质在细胞内的分布:预测蛋白质在12种不同亚细胞区域(如核仁、核斑点、应激颗粒等)的定位概率。

设计具有特定亚细胞定位的蛋白质:生成新的蛋白质序列,特异性地组装到目标亚细胞区域(如核仁或核斑点)。

识别致病突变对蛋白质定位的影响:分析突变对蛋白质亚细胞定位的影响,预测致病突变是否会导致蛋白质分布异常。

ProtGPS的技术原理

基于Transformer的序列学习:基于ESM2(Evolutionary Scale Model 2)架构,一种基于Transformer的蛋白质语言大模型。同时学习输入序列中所有氨基酸之间的关系,捕捉蛋白质序列中的复杂模式和相互作用。

神经网络分类器联合训练:

将ESM2与神经网络分类器联合训练。分类器的任务是根据ESM2提取的特征,预测蛋白质在不同亚细胞区域的定位概率。

训练数据集包括5480个人类蛋白质序列,序列被注释为属于12种不同的亚细胞区域,学习到不同亚细胞区域的蛋白质序列特征。

生成蛋白质序列的算法:为设计具有特定亚细胞定位的蛋白质,用马尔可夫链蒙特卡洛(MCMC)算法。在生成蛋白质序列时,考虑蛋白质的化学空间和内在无序性,确保生成的序列符合自然蛋白质的分布,能特异性地定位到目标亚细胞区域。

致病突变分析:分析致病突变对蛋白质亚细胞定位的影响。比较野生型和突变型蛋白质的定位预测结果,识别那些导致蛋白质分布改变的突变。用信息论中的Shannon熵和Wasserstein距离,用在量化突变对蛋白质定位预测不确定性的影响。

ProtGPS项目介绍

GitHub仓库:https://github.com/pgmikhael/protgps

arXiv技术论文:https://www.biorxiv.org/content

ProtGPS能做什么?

疾病机制研究:识别致病突变对蛋白质亚细胞定位的影响,帮助理解疾病发病机制。

蛋白质工程与药物设计:设计具有特定亚细胞定位的蛋白质,用在开发新型蛋白质药物或生物传感器。

细胞生物学研究:预测蛋白质在不同亚细胞区域的定位,助力细胞内蛋白质功能和相互作用的研究。

基因治疗与基因编辑:设计特异性靶向亚细胞区域的基因编辑工具,提高基因编辑的效率和特异性。

蛋白质功能注释与数据库构建:为蛋白质功能研究提供线索,助力构建更全面的蛋白质功能数据库。

© 版权声明:本站所有原创文章版权均归卓商AI工具集及原创作者所有,未经允许任何个人、媒体、网站不得转载或以其他方式抄袭本站任何文章。
卓商AI
卓商AI

AI爱好者的一站式人工智能AI工具箱,累计收录全球10,000⁺好用的AI工具软件和网站,方便您更便捷的探索前沿的AI技术。本站持续更新好的AI应用,力争做全球排名前三的AI网址导航网站,欢迎您成为我们的一员。

猜你喜欢
  • Coding-Tutor
    Coding-Tutor Coding-Tutor是一个基于大型语言模型(LLM)的编程辅导工具,旨在通过对话式交互帮助学习者提升编程能力。它通过Trace-and-Verif...
  • Reweb
    Reweb Reweb 是一个为 Next.js 和 Tailwind CSS 开发者设计的可视化网站构建工具。它允许用户以无代码的速度构建网站,同时导出高质量的...
  • MetaGPT Framework
    MetaGPT Framework MetaGPT是一个多智能体框架,它通过自然语言编程技术,能够模拟一个完整的软件公司团队,从而实现快速开发和自动化工作流程。它代表了人工智能在软件开发...
  • Stackpointer
    Stackpointer Stackpointer是一个综合性商业搜索引擎,通过分析企业的技术栈来提供详细的商业洞察。用户可以通过关键词或特定技术来搜索企业,帮助创业者制定市场...
  • Mamba-Codestral-7B-v0.1
    Mamba-Codestral-7B-v0.1 Mamba-Codestral-7B-v0.1 是 Mistral AI Team 开发的基于 Mamba2 架构的开源代码模型,性能与最先进的基于 ...
  • lisapet ai
    lisapet ai 引入Lisapet.ai- Premier AI产品开发平台。使用Lisapet.ai,团队可以在创纪录的时间内毫不费力地进行原型,测试和高级AI功能...
  • CubeNote
    CubeNote CubeNote是一个智能AI笔记本,旨在通过将知识带到用户身边,将想法快速转化为成果,从而提高每一分钟的价值,推动个人成功。它通过其独特的功能,如参...
  • 小虫快读
    小虫快读 小虫快读是一款基于OCR和AI大语言模型的高效阅读工具,通过手机相机拍摄书籍页面,利用先进的OCR技术自动识别文字,AI大语言模型几秒内生成书籍的核心...