Hugging Face发布蛋白质潜在语言模型PLL与SLL,推动蛋白质生成研究
文 / Mr.Xu
发布时间:
摘要:Hugging Face的研究团队提出两种新的蛋白质潜在语言模型——蛋白质潜在语言(PLL)和结构潜在语言(SLL),旨在解决自回归Transformer在蛋白质序列和结构生成中的不足。PLL基于冻结的ESM-2编码器构建,将序列映射为4096状态的上下文字母表,而SLL则结合GCP-VQVAE Lite架构,通过辅助序列和置信度监督解码到骨架坐标。实验表明,PLL在序列生成任务中显著降低了低于1.5位残基熵阈值的样本比例,而SLL在序列到结构预测中减少了34%的验证困惑度。此外,SLLM在长蛋白质生成中比基于多序列比对的AlphaFold2快约1000倍,为蛋白质生成领域带来了突破性进展。
蛋白质生成领域的突破性进展
Hugging Face的研究团队在蛋白质生成领域取得了重要突破,提出了两种新的潜在蛋白质语言模型:蛋白质潜在语言(PLL)和结构潜在语言(SLL)。
技术亮点
-
PLL模型:
- 基于冻结的ESM-2编码器构建,将蛋白质序列映射为4096状态的上下文字母表,每个残基对应一个token。
- 在序列生成任务中,PLL显著降低了低于1.5位残基熵阈值的样本比例,相较于传统的氨基酸自回归模型,PLL的拟合计算扩展指数为0.038,而氨基酸模型仅为0.020。
-
SLL模型:
- 结合GCP-VQVAE Lite架构,通过辅助序列和置信度监督解码到骨架坐标。
- 在序列到结构预测任务中,SLL将最佳验证困惑度降低了34%。
- 在长蛋白质生成中,SLLM比基于多序列比对的AlphaFold2快约1000倍。
-
性能提升:
- 在无条件序列生成中,PLLM在所有采样温度下将低于1.5位残基熵阈值的样本比例降低了54%。
- 在骨架生成中,SLLM在多样性和新颖性方面与其他生成模型相比表现优异。
行业影响
- 蛋白质设计:PLL和SLL为蛋白质设计和生成提供了更高效、更精准的工具,有望加速新药研发和生物技术领域的创新。
- AI模型优化:该研究展示了自回归Transformer在处理复杂生物序列时的潜力,为AI模型在生物信息学中的应用提供了新的思路。
- 研究工具:PLL和SLL的发布为研究人员和开发者提供了强大的工具,特别是在处理长蛋白质序列和复杂结构生成任务时展现出巨大优势。
开发者建议
- 模型应用:建议研究人员和开发者尝试将PLL和SLL应用于蛋白质设计和药物发现任务中,以充分利用其高效生成能力。
- 性能优化:在处理长蛋白质序列时,建议优先考虑使用SLLM以获得更快的推理速度。
- 持续关注:建议关注Hugging Face后续发布的更多蛋白质生成相关工具和资源,以获取最新进展。
—— 完 ——消息来源:Hugging Face Daily Papers (2026-10-02)
社区整体评论区
正在加载实时智能评论与划词标注…