ml4bio_RNA-FM:基于基础模型的RNA结构与功能预测项目

用户可利用该项目进行RNA嵌入生成、二级结构预测等任务,助力mRNA和蛋白质相关研究。项目包含RNA-FM及mRNA-FM预训练模型,在多种结构和功能预测任务上表现优于同类单序列RNA语言模型。【此简介由AI生成】

Branch1Tags0
This repository is empty

RNA-FM:RNA基础模型

图片

arXiv Nature Methods Nature Computational Science Bioinformatics RNA-FM服务器 RhoFold服务器

简介

RNA-FM(RNA基础模型)是一款最先进的RNA序列预训练语言模型,是集成化RNA研究生态系统的核心。通过自监督学习在超过2300万条非编码RNA(ncRNA)序列上进行训练,RNA-FM能够从RNA序列中提取全面的结构和功能信息,且无需依赖实验标签。 mRNA-FM 是RNA-FM的直接扩展,专门在4500万条mRNA编码序列(CDS)上训练而成。它旨在捕捉mRNA特有的信息,并在相关任务中展现出卓越性能。 因此,RNA-FM生成的通用RNA嵌入适用于广泛的下游任务,包括但不限于二级和三级结构预测、RNA家族聚类以及功能性RNA分析。

RNA-FM最初在《Nature Methods》上作为RNA生物学的基础模型被提出,在各种结构和功能基准测试中,其性能优于所有已评估的单序列RNA语言模型,为RNA分析带来了前所未有的准确性。基于此,我们团队开发了一个集成化RNA pipeline,其中包括:

  • RhoFold——高精度RNA tertiary结构预测(序列→结构)。
  • RiboDiffusion——基于扩散模型的RNA 3D设计逆折叠(结构→序列)。
  • RhoDesign——用于RNA设计的几何深度学习方法(结构→序列)。

这些工具与RNA-FM协同工作,可从序列预测RNA结构、设计能折叠成特定3D结构的新RNA序列,并分析其功能特性。我们的集成生态系统旨在推动RNA疗法的发展、促进合成生物学的创新,并加深我们对RNA结构-功能关系的理解

参考文献
@article{chen2022interpretable,
  title={Interpretable RNA Foundation Model from Unannotated Data for Highly Accurate RNA Structure and Function Predictions},
  author={Chen, Jiayang and Hu, Zhihang and Sun, Siqi and Tan, Qingxiong and Wang, Yixuan and Yu, Qinze and Zong, Licheng and Hong, Liang and Xiao, Jin and King, Irwin and others},
  journal={arXiv preprint arXiv:2204.00300},
  year={2022}
}
目录

基础模型与扩展生态系统

RNA-FM生态系统组件:我们的平台包含四个集成工具,每个工具针对RNA分析和设计流程中的关键步骤:

模型 任务 描述 代码 论文
RNA-FM 基础模型(表征学习) 针对非编码RNA序列(RNA-FM)和信使RNA序列(mRNA-FM)的预训练Transformer(BERT风格)模型;用于提取嵌入特征并预测碱基配对概率 GitHub Nature Methods
RhoFold 三维结构预测 基于RNA-FM的序列到结构预测模型(提供三维坐标和二级结构) GitHub Nature Methods
RiboDiffusion 逆折叠 用于从结构生成序列的RNA设计生成式扩散模型 GitHub ISMB'2024
RhoDesign 逆折叠 用于从结构生成序列设计的几何深度学习模型(GVP+Transformer) GitHub Nature Computational Science

基础模型

模型 训练语料 序列数量 层数/隐藏维度 参数规模 典型应用场景
RNA-FM 非编码RNA 23.7 M 12 / 640 99 M 非编码RNA结构与功能研究、适配体设计
mRNA-FM 信使RNA 45 M 12 / 1280 239 M mRNA表达建模、CDS分析

RNA-FM

  • RNA-FM 是一个12层BERT编码器,通过掩码token预测任务在 23.7 M 条非编码RNA序列(RNAcentral100)上进行预训练。它生成的640维嵌入已编码二级结构、三维邻近性乃至进化信号,使其成为该生态系统中所有下游工具的表示基础。

    点击折叠RNA-FM详情

    CUHKServer arXiv

    RNA-FM Overview

    • RNA-FM 用于二级结构预测:
      • 在挑战性数据集上,F1分数较经典物理方法和机器学习方法(如LinearFold、SPOT-RNA、UFold)高出 20–30%
      • 对于长RNA(>150核苷酸)和低同源性家族,性能提升尤为显著。

mRNA-FM

  • mRNA-FM 作为RNA-FM的扩展,专门在4500万条mRNA编码序列(CDS)上训练。它专为建模mRNA特异性特征而设计,在mRNA相关任务中实现了最先进的性能。

下游工具

RhoFold(三级结构预测)

  • RhoFold (Tertiary Structure Prediction)——一款由RNA-FM驱动的RNA三维结构预测工具。输入RNA序列后,RhoFold可快速预测其三级结构(PDB格式的3D坐标),同时提供二级结构(CT文件)和每个残基的置信度分数。通过将RNA-FM嵌入与结构预测网络相结合,它在RNA三维结构基准测试中实现了高精度,在RNA-Puzzles挑战赛中显著优于先前的方法。

    点击展开RhoFold详情

    CUHKServer Nature Methods

    RhoFold利用RNA-FM强大的嵌入能力,彻底改变了RNA三级结构预测。通过将深度学习与结构生物学原理相结合,RhoFold可将RNA序列直接转化为精确的3D坐标。该模型采用多阶段架构,首先将RNA-FM的上下文表征转换为距离图和扭转角,然后将这些信息组装成完整的三维结构。与以往常常难以应对RNA复杂折叠图景的方法不同,RhoFold的基础模型方法能够捕捉微妙的序列-结构关系,从而在RNA-Puzzles等具有挑战性的基准测试中实现最先进的性能。该系统支持单序列模式以进行快速预测,当需要更高精度时,还可以整合多序列比对(MSA),使其适用于从小RNA到复杂核酶和核糖开关等各种研究应用。

    RhoFlod Overview

    • RhoFold 用于三级结构预测:
      • 在RNA-Puzzles / CASP类型任务中提供顶级精度。
      • 在几秒钟内预测3D结构(单序列模式),并可整合MSA以进一步提高精度。
      • 达到《Nature Methods》级别的基准,可推广到新的RNA家族。

RiboDiffusion(逆折叠——扩散模型)

  • RiboDiffusion (Inverse Folding – Diffusion)——一种基于扩散模型的RNA设计逆折叠工具。从目标3D骨架结构出发,RiboDiffusion通过迭代生成能够折叠成该形状的RNA序列。这种生成式方法比以往的逆折叠算法具有更高的序列恢复率(约11–16%的提升),同时还能为设计的序列提供可调节的多样性。

    点击展开RiboDiffusion详情

    Bioinformatics

    RiboDiffusion通过基于扩散的生成模型在RNA逆折叠领域取得了突破。传统的RNA设计方法常常难以应对庞大的序列空间,而RiboDiffusion则采用了一种受生成式AI最新进展启发的新颖方法。该模型从随机噪声开始,通过精心控制的扩散过程,迭代优化RNA序列,使其与目标3D骨架结构相符。这种方法使RiboDiffusion能够在探索多样化序列解决方案的同时保持结构保真度,这在生物分子设计中是一个关键的平衡。扩散框架本身就提供了序列多样性,使研究人员能够生成和测试多个均满足结构约束的候选设计。已发表的基准测试表明,RiboDiffusion相比以往方法实现了更高的序列恢复率,这使其在设计功能性RNA(如核糖开关、适配体和其他结构元件)时特别有价值,因为在这些情况下序列-结构关系至关重要。

    Overview

    • RiboDiffusion 用于逆折叠:
      • 一种基于扩散的生成方法,在序列恢复率上比先前方法高出约11–16%
      • 提供可调节的设计多样性,为单一目标形状探索多种有效序列。

RhoDesign(逆折叠——确定性模型)

  • RhoDesign (Inverse Folding – Deterministic)——一种用于RNA设计的确定性几何深度学习模型。RhoDesign使用图神经网络(GVP)和Transformer,针对给定的3D结构(可选择整合二级结构约束)直接解码序列。它在匹配目标结构方面实现了最先进的准确性,在标准基准测试中的序列恢复率超过50%(几乎是传统方法的两倍),并且在当前解决方案中具有最高的结构保真度(TM分数)。

    点击展开RhoDesign详情

    Nature Computational Science

    RhoDesign采用几何深度学习,引入了一种确定性的RNA逆折叠方法。与基于扩散的方法不同,RhoDesign通过结合图向量感知器(GVP)和Transformer网络的专用架构,直接将3D结构信息转化为RNA序列。这种架构能够有效捕捉RNA骨架中的局部几何约束和全局结构模式。RhoDesign可以整合可选的二级结构约束,允许研究人员指定某些碱基配对模式,同时让模型优化其余序列。基准测试表明,RhoDesign在标准数据集上实现了超过50%的显著序列恢复率——几乎是传统方法性能的两倍。此外,设计的序列在当前方法中表现出最高的结构保真度(通过TM分数衡量)。这种准确性和效率的结合使RhoDesign特别适用于精密RNA工程应用,在这些应用中结构完整性至关重要。

    Overview

    • RhoDesign 用于逆折叠:
      • 一种确定性GVP + Transformer模型,在标准3D设计基准测试中序列恢复率**>50%**,几乎是旧算法的两倍。
      • 在测试方法中实现最高的结构保真度(TM分数),已在《Nature Computational Science》发表。

统一工作流程:这些工具协同工作,实现端到端的RNA工程。对于任何感兴趣的RNA序列,可以使用RNA-FM和RhoFold来预测其结构(二级和三级)。相反,给定所需的RNA结构,可以使用RiboDiffusion或RhoDesign(或两者结合进行交叉验证)来设计候选序列。然后,可以通过RhoFold对设计的序列进行折叠验证,从而形成闭环。这种由RNA-FM嵌入驱动的正向和逆向设计循环,创建了一个强大的闭环工作流程,用于探索RNA结构-功能空间。通过无缝整合预测和设计,RNA-FM生态系统加速了RNA科学中的设计-构建-测试范式,为RNA疗法、合成生物学构建以及我们对RNA生物学的理解奠定了突破的基础。


应用场景

RNA 三维结构预测

  • 基于语言模型的深度学习方法实现精准RNA三维结构预测——介绍了RhoFold+,该方法将RNA-FM嵌入与几何模块相结合,在CASP/RNA-Puzzles基准测试中达到了SOTA精度(论文代码
  • NuFold:端到端RNA三级结构预测——将RNA-FM特征整合到U-former网络架构中,其预测精度可与当前最先进的折叠预测工具相媲美(论文代码
  • TorRNA——利用大型语言模型改进主链扭转角预测——采用RNA-FM作为序列编码器,与之前的方法相比,将扭转角中值误差降低了2–16%(论文

RNA设计与逆折叠

  • 利用结构预测进行RNA适配体的深度生成设计——采用RhoDesign设计出荧光增益>3倍的Mango适配体变体(经湿实验验证)(论文代码
  • RiboDiffusion:基于三级结构的RNA逆折叠生成扩散模型——在RhoFold生成的数据上训练扩散采样器;与基于二级结构的基准方法相比,原生序列恢复率提升了11–16%(论文代码
  • gRNAde:用于三维RNA逆设计的几何深度学习方法——通过RhoFold正向折叠验证每个设计,原生序列恢复率达到56%,而Rosetta为45%(论文代码
  • RILLIE框架——将16亿参数的RNA语言模型与RhoDesign相集成,用于Broccoli/Pepper适配体的计算机定向进化(代码

功能注释与亚细胞定位

  • RNALoc-LM:基于预训练RNA语言模型的RNA亚细胞定位预测——用RNA-FM嵌入替代独热编码输入,使长链非编码RNA(lncRNA)、环状RNA(circRNA)和微小RNA(miRNA)的定位预测MCC值提升4–8%(论文代码
  • PlantRNA-FM:用于植物转录本的可解释RNA基础模型——将RNA-FM架构适配于超过2500万条植物RNA;发现与翻译相关的结构基序,并在基因区域注释任务上达到F1 = 0.97(论文代码

RNA-蛋白质相互作用

  • ZHMolGraph:用于RNA-蛋白质相互作用预测的网络引导深度学习方法——在图神经网络(GNN)中结合RNA-FM(用于RNA)和ProtTrans(用于蛋白质)嵌入,对未见过的RNA-蛋白质对,AUROC提升高达28%(论文代码

核心要点:在结构预测、从头序列设计、功能注释和相互作用建模等领域,研究社区正逐步采用RNA-FM及其RhoFold/RiboDiffusion/RhoDesign工具包作为可靠的构建模块——充分展示了该生态系统的多功能性和实际应用价值。


安装与使用

使用Conda配置环境

以下是在本地配置RNA-FM及其扩展流程(如RhoFold)环境的步骤。
(如果您不想在本地安装,请参考前面提到的在线服务器。)

  1. 克隆仓库并创建Conda环境
git clone https://github.com/ml4bio/RNA-FM.git
cd RNA-FM
conda env create -f environment.yml
  1. 激活并进入工作区
conda activate RNA-FM
cd ./redevelop
  1. 从我们的 Hugging Face 仓库 下载预训练模型,并将 .pth 文件放入 pretrained 文件夹。

    对于 mRNA-FM,请确保您的输入 RNA 序列长度为 3 的倍数(密码子),并将 mRNA-FM 的专用权重也放入同一个 pretrained 文件夹中。

快速开始使用

环境准备就绪且权重下载完成后,您可以按以下方式执行常见任务:

1. 嵌入生成

使用 RNA-FM 为输入序列提取核苷酸水平的嵌入:

python launch/predict.py \
    --config="pretrained/extract_embedding.yml" \
    --data_path="./data/examples/example.fasta" \
    --save_dir="./results" \
    --save_frequency 1 \
    --save_embeddings

此命令会处理 example.fasta 中的序列,并将每个核苷酸的 640 维嵌入保存到 ./results/representations/

  • 使用 mRNA-FM: 若要使用 mRNA-FM 变体而非默认的 ncRNA 模型,请添加模型名称参数,并确保输入序列已按密码子对齐:

    python launch/predict.py \
        --config="pretrained/extract_embedding.yml" \
        --data_path="./data/examples/example.fasta" \
        --save_dir="./results" \
        --save_frequency 1 \
        --save_embeddings \
        --save_embeddings_format raw \
        MODEL.BACKBONE_NAME mrna-fm
    

    对于 mRNA-FM,您可以通过额外参数 MODEL.BACKBONE_NAME 来调用它。 请记住,mRNA-FM 采用密码子分词,因此每个序列的长度必须能被 3 整除。

2. RNA 二级结构预测

使用 RNA-FM 根据序列预测 RNA 二级结构(碱基配对):

python launch/predict.py \
    --config="pretrained/ss_prediction.yml" \
    --data_path="./data/examples/example.fasta" \
    --save_dir="./results" \
    --save_frequency 1

RNA-FM 会将碱基对概率矩阵(.npy)和二级结构(.ct)输出至 ./results/r-ss

在线服务器

RNA-FM 服务器 RhoFold 服务器

如果您不想在本地安装任何程序,可以使用我们的 RNA-FM 服务器。该服务器提供简洁的网页界面,您可以:

  • 提交 RNA 序列以获取其预测的二级结构和/或嵌入向量。
  • 无需本地计算资源或配置即可获取结果。

(另有 RhoFold 服务器 可用于单条 RNA 序列的三级结构预测。)

进一步开发与 Python API

教程

如果您仅需使用预训练模型(而非运行所有 pipeline 脚本),可以直接安装 RNA-FM

pip install rna-fm

或者,获取 GitHub 上的最新版本:

cd ./RNA-FM
pip install .

RNA-FM

接下来,在您自己的 Python 项目中加载 RNA-FM

import torch
import fm

# 1. Load RNA-FM model
model, alphabet = fm.pretrained.rna_fm_t12()
batch_converter = alphabet.get_batch_converter()
model.eval()  # disables dropout for deterministic results

# 2. Prepare data
data = [
    ("RNA1", "GGGUGCGAUCAUACCAGCACUAAUGCCCUCCUGGGAAGUCCUCGUGUUGCACCCCU"),
    ("RNA2", "GGGUGUCGCUCAGUUGGUAGAGUGCUUGCCUGGCAUGCAAGAAACCUUGGUUCAAUCCCCAGCACUGCA"),
    ("RNA3", "CGAUUCNCGUUCCC--CCGCCUCCA"),
]
batch_labels, batch_strs, batch_tokens = batch_converter(data)

# 3. Extract embeddings (on CPU)
with torch.no_grad():
    results = model(batch_tokens, repr_layers=[12])
token_embeddings = results["representations"][12]

mRNA-FM

对于mRNA-FM,可通过 fm.pretrained.mrna_fm_t12() 进行加载,并确保输入序列为密码子对齐(如上述快速入门所示)。

import torch
import fm

# 1. Load mRNA-FM model
model, alphabet = fm.pretrained.mrna_fm_t12()
batch_converter = alphabet.get_batch_converter()
model.eval()  # disables dropout for deterministic results

# 2. Prepare data
data = [
    ("CDS1", "AUGGGGUGCGAUCAUACCAGCACUAAUGCCCUCCUGGGAAGUCCUCGUGUUGCACCCCUA"),
    ("CDS2", "AUGGGGUGUCGCUCAGUUGGUAGAGUGCUUGCCUGGCAUGCAAGAAACCUUGGUUCAAUCCCCAGCACUGCA"),
    ("CDS3", "AUGCGAUUCNCGUUCCC--CCGCCUCC"),
]
batch_labels, batch_strs, batch_tokens = batch_converter(data)

# 3. Extract embeddings (on CPU)
with torch.no_grad():
    results = model(batch_tokens, repr_layers=[12])
token_embeddings = results["representations"][12]

更多教程可在 GitHub 上找到。相关的笔记本文件存储在 tutorials 文件夹中。

笔记本教程

通过我们全面的教程开始使用 RNA-FM:

教程 描述 格式
RNA 家族聚类与类型分类
在 Colab 中打开
如何提取 RNA-FM 嵌入用于 RNA 家族聚类和 RNA 类型分类。本教程涵盖嵌入的可视化以及在其基础上训练简单分类器的方法。 Jupyter 笔记本
RNA 二级结构预测 如何使用 RNA-FM 预测 RNA 二级结构、输出碱基配对概率矩阵以及可视化预测的碱基配对(二级结构)。 Python 脚本
UTR 功能预测
在 Colab 中打开
如何利用 RNA-FM 嵌入预测 mRNA 中非翻译区(5′ 和 3′ UTR)的功能特性。这包括训练模型以根据 UTR 序列预测基因表达或蛋白质翻译指标。 Jupyter 笔记本
mRNA 表达预测
在 Colab 中打开
如何使用 mRNA-FM 变体从 mRNA 序列预测基因表达水平。本教程演示了加载专用的 mRNA 模型、提取嵌入以及构建分类器以区分高表达和低表达基因的方法。 Jupyter 笔记本

其他资源:

这些教程涵盖了 RNA-FM 的核心应用,从基本的嵌入提取到高级的功能预测。每个教程都提供了可立即在浏览器或本地环境中运行的实践示例。

生态系统使用示例

我们建议探索高级的RhoFoldRiboDiffusionRhoDesign项目,以完成诸如3D结构预测或RNA设计等任务。以下是简要的使用示例:

点击展开RNA-FM生态系统详情

RhoFold(序列→结构)

# Example: Predict 3D structure for an RNA sequence in FASTA.
cd RhoFold
python inference.py \
    --input_fas ./example/input/5t5a.fasta \
    --output_dir ./example/output/5t5a/ \
    --ckpt ./pretrained/RhoFold_pretrained.pt

输出结果

  • unrelaxed_model.pdb / relaxed_1000_model.pdb(三维坐标)
  • ss.ct(二级结构)
  • results.npz(距离/角度预测 + 置信度分数)
  • log.txt(运行日志、pLDDT 等)

RiboDiffusion(结构→序列)

cd RiboDiffusion
CUDA_VISIBLE_DEVICES=0 python main.py \
    --PDB_file examples/R1107.pdb \
    --config.eval.n_samples 5

这将生成5条候选RNA序列,这些序列可折叠为R1107.pdb中提供的结构。输出的FASTA文件将保存到exp_inf/fasta/目录下。

RhoDesign(结构→序列)

cd RhoDesign
python src/inference.py \
    --pdb ../example/2zh6_B.pdb \
    --ss ../example/2zh6_B.npy \
    --save ../example/

这会生成一个经过设计的RNA序列,该序列预计会折叠成目标3D形状(PDB文件2zh6_B.pdb,可选择使用2zh6_B.npy中的二级结构约束)。输出序列将保存到指定文件夹中。您可以调整采样温度等参数,以探索更多样化或更高保真度的设计。

API参考

API参考

RNA-FM生态系统中的每个项目都提供命令行界面和Python模块:

  • RNA-FM:核心模块fm用于嵌入提取和二级结构预测。
    • fm.pretrained.rna_fm_t12() – 加载12层ncRNA模型
    • fm.pretrained.mrna_fm_t12() – 加载12层mRNA(密码子)模型
  • RhoFold:使用RhoFoldModel类或inference.py脚本。
    • inference.py接收FASTA序列(可选MSA)并输出3D结构。
    • 添加--single_seq_pred True可在无MSA的情况下运行(单序列模式)。
  • RiboDiffusion:使用main.py脚本或导入扩散模型类。
    • main.py接收PDB结构作为输入并输出设计序列。
    • 修改configs/中的设置(例如cond_scalen_samples)以调整生成效果。
  • RhoDesign:使用inference.py脚本或导入设计模型模块。
    • inference.py接收PDB(可选二级结构/接触图)并输出设计序列。
    • GVP+Transformer架构可整合部分结构约束,并支持高级采样策略。

有关更多详细信息,请参阅每个仓库的文档或tutorials文件夹中的笔记本。


相关RNA语言模型

名称 数据集 模态 tokenization 架构 骨干网络 预训练任务 层数 模型参数 数据量 代码 权重 数据 许可证
RNA‑FM ncRNA 序列 碱基 仅编码器 Transformer MLM 12 1亿 2300万 GitHub HuggingFace RNAcentral MIT
RNABERT ncRNA 序列 碱基 仅编码器 Transformer MLM / SAL 6 50万 76万 GitHub Drive Rfam 14.3 MIT
RNA‑MSM ncRNA 序列+MSA 碱基 仅编码器 MSA‑Transformer MLM 12 9500万 3932个家族 GitHub Drive Rfam 14.7 MIT
AIDO.RNA ncRNA 序列 碱基 仅编码器 Transformer MLM 32 16亿 4200万 GitHub HuggingFace 公共ncRNA混合集 Apache‑2.0
ERNIE‑RNA ncRNA 序列 碱基 仅编码器 Transformer MLM 12 8600万 2040万 GitHub GitHub Rfam + RNAcentral MIT
GenerRNA ncRNA 序列 BPE 仅解码器 Transformer CLM 24 3.5亿 1609万 GitHub HuggingFace 公共ncRNA混合集 Apache‑2.0
RFamLlama ncRNA 序列 碱基 仅解码器 Llama CLM 6‑10 1300万‑8800万 60万 HuggingFace HuggingFace Rfam 14.10 CC BY‑NC‑4.0
RNA‑km ncRNA 序列 碱基 仅编码器 Transformer MLM 12 1.52亿 2300万 GitHub Drive Rfam + RNAcentral MIT
RNAErnie ncRNA 序列 碱基 仅编码器 Transformer MLM 12 1.05亿 2300万 GitHub GitHub 公共ncRNA混合集 Apache‑2.0
OPED pegRNA 序列 k‑mer 编码器‑解码器 Transformer 回归 n/a n/a 4万 GitHub 公共pegRNA效率数据 MIT
GARNET rRNA 序列 k‑mer 仅解码器 Transformer CLM 18 1900万 8900万tokens GitHub Release 公共rRNA MIT
IsoCLR pre‑mRNA 序列 One‑hot 仅编码器 CNN 对比学习 8 100万‑1000万 100万 GitHub Ensembl / RefSeq
SpliceBERT pre‑mRNA 序列 碱基 仅编码器 Transformer MLM 6 2000万 200万 GitHub Zenodo UCSC/GENCODE MIT
Orthrus pre‑mRNA 序列 碱基 仅编码器 Mamba 对比学习 3‑6 100万‑1000万 4900万 GitHub HuggingFace 直系同源集 Apache‑2.0
LoRNA pre‑mRNA 序列 碱基 仅解码器 StripedHyena 对比学习 16 650万 1亿 GitHub (已宣布) SRA(长读长) MIT
CodonBERT mRNA CDS 序列 密码子 仅编码器 Transformer MLM / HSP 12 8700万 1000万 GitHub HuggingFace NCBI mRNA Apache‑2.0
UTR‑LM 5′UTR 序列 碱基 仅编码器 Transformer MLM / SSP / MFE 6 100万 70万 GitHub GitHub 公共5′UTR集 MIT
3UTRBERT 3′UTR 序列 k‑mer 仅编码器 Transformer MLM 12 8600万 2万 GitHub HuggingFace 公共3′UTR MIT
G4mer mRNA 序列 k‑mer 仅编码器 Transformer MLM 6
HELM mRNA 序列 密码子 多模态 多模态 MLM + CLM 5000万 1530万
RiNALMo RNA 序列 碱基 仅编码器 Transformer MLM 33 1.35亿‑6.5亿 3600万 GitHub (需申请) 公共ncRNA MIT
UNI‑RNA RNA 序列 碱基 仅编码器 Transformer MLM 24 4亿 5亿
ATOM‑1 RNA 序列 碱基 编码器‑解码器 Transformer
BiRNA‑BERT RNA 序列 碱基 + BPE 仅编码器 Transformer MLM 12 1.17亿 3600万 GitHub HuggingFace 公共ncRNA MIT
ChaRNABERT RNA 序列 GBST 仅编码器 Transformer MLM 6‑33 800万‑6.5亿 6200万 (800万演示版) 公共ncRNA
DGRNA RNA 序列 碱基 仅编码器 Mamba MLM 12 1亿 1亿
LAMAR RNA 序列 碱基 仅编码器 Transformer MLM 12 1.5亿 1500万 GitHub (已宣布) 公共ncRNA MIT
OmniGenome RNA 序列、结构 碱基 仅编码器 Transformer MLM / Seq2Str / Str2Seq 16‑32 5200万‑1.86亿 2500万 GitHub HuggingFace 公共多组学 Apache‑2.0
PlantRNA‑FM RNA 序列、结构 碱基 仅编码器 Transformer MLM / SSP / CLS 12 3500万 2500万 HuggingFace HuggingFace 植物RNA集 CC BY‑NC‑4.0
MP‑RNA RNA 序列、结构 碱基 仅编码器 Transformer SSP / SNMR / MRLM 12 5200万‑1.86亿 2500万 GitHub (计划中) 公共ncRNA混合集 Apache‑2.0

引用说明

如果您在研究中使用了RNA-FM或本生态系统的任何组件,请引用相关论文。以下是涵盖基础模型及相关工具的关键 publications 集合(BibTeX 格式):

BibTeX 引用

RNA-FM 与 RNA 结构预测

@article{chen2022interpretable,
  title={Interpretable RNA foundation model from unannotated data for highly accurate RNA structure and function predictions},
  author={Chen, Jiayang and Hu, Zhihang and Sun, Siqi and Tan, Qingxiong and Wang, Yixuan and Yu, Qinze and Zong, Licheng and Hong, Liang and Xiao, Jin and Shen, Tao and others},
  journal={arXiv preprint arXiv:2204.00300},
  year={2022}
}

@article{shen2024accurate,
  title={Accurate RNA 3D structure prediction using a language model-based deep learning approach},
  author={Shen, Tao and Hu, Zhihang and Sun, Siqi and Liu, Di and Wong, Felix and Wang, Jiuming and Chen, Jiayang and Wang, Yixuan and Hong, Liang and Xiao, Jin and others},
  journal={Nature Methods},
  pages={1--12},
  year={2024},
  publisher={Nature Publishing Group US New York}
}

@article{chen2020rna,
  title={RNA secondary structure prediction by learning unrolled algorithms},
  author={Chen, Xinshi and Li, Yu and Umarov, Ramzan and Gao, Xin and Song, Le},
  journal={arXiv preprint arXiv:2002.05810},
  year={2020}
}

@article{WANG2025102991,
   title = {Deep learning for RNA structure prediction},
   author = {Jiuming Wang and Yimin Fan and Liang Hong and Zhihang Hu and Yu Li},
   journal = {Current Opinion in Structural Biology},
   year = {2025},
   doi = {https://doi.org/10.1016/j.sbi.2025.102991},
   url = {https://www.sciencedirect.com/science/article/pii/S0959440X25000090},
}

RNA设计与逆折叠

@article{wong2024deep,
  title={Deep generative design of RNA aptamers using structural predictions},
  author={Wong, Felix and He, Dongchen and Krishnan, Aarti and Hong, Liang and Wang, Alexander Z and Wang, Jiuming and Hu, Zhihang and Omori, Satotaka and Li, Alicia and Rao, Jiahua and others},
  journal={Nature Computational Science},
  pages={1--11},
  year={2024},
  publisher={Nature Publishing Group US New York}
}

@article{huang2024ribodiffusion,
  title={RiboDiffusion: tertiary structure-based RNA inverse folding with generative diffusion models},
  author={Huang, Han and Lin, Ziqian and He, Dongchen and Hong, Liang and Li, Yu},
  journal={Bioinformatics},
  volume={40},
  number={Supplement\_1},
  pages={i347--i356},
  year={2024},
  publisher={Oxford University Press}
}

RNA-蛋白质相互作用(RPI)

@article{wei2022protein,
  title={Protein--RNA interaction prediction with deep learning: structure matters},
  author={Wei, Junkang and Chen, Siyuan and Zong, Licheng and Gao, Xin and Li, Yu},
  journal={Briefings in bioinformatics},
  volume={23},
  number={1},
  pages={bbab540},
  year={2022},
  publisher={Oxford University Press}
}

@article{lam2019deep,
  title={A deep learning framework to predict binding preference of RNA constituents on protein surface},
  author={Lam, Jordy Homing and Li, Yu and Zhu, Lizhe and Umarov, Ramzan and Jiang, Hanlun and H{\'e}liou, Am{\'e}lie and Sheong, Fu Kit and Liu, Tianyun and Long, Yongkang and Li, Yunfei and others},
  journal={Nature communications},
  volume={10},
  number={1},
  pages={4941},
  year={2019},
  publisher={Nature Publishing Group UK London}
}

数据库与资源

@article{wei2024pronet,
  title={ProNet DB: a proteome-wise database for protein surface property representations and RNA-binding profiles},
  author={Wei, Junkang and Xiao, Jin and Chen, Siyuan and Zong, Licheng and Gao, Xin and Li, Yu},
  journal={Database},
  volume={2024},
  pages={baae012},
  year={2024},
  publisher={Oxford University Press UK}
}

单细胞RNA分析

@article{han2022self,
  title={Self-supervised contrastive learning for integrative single cell RNA-seq data analysis},
  author={Han, Wenkai and Cheng, Yuqi and Chen, Jiayang and Zhong, Huawen and Hu, Zhihang and Chen, Siyuan and Zong, Licheng and Hong, Liang and Chan, Ting-Fung and King, Irwin and others},
  journal={Briefings in Bioinformatics},
  volume={23},
  number={5},
  pages={bbac377},
  year={2022},
  publisher={Oxford University Press}
}

药物发现

@article{fan2022highly,
  title={The highly conserved RNA-binding specificity of nucleocapsid protein facilitates the identification of drugs with broad anti-coronavirus activity},
  author={Fan, Shaorong and Sun, Wenju and Fan, Ligang and Wu, Nan and Sun, Wei and Ma, Haiqian and Chen, Siyuan and Li, Zitong and Li, Yu and Zhang, Jilin and others},
  journal={Computational and Structural Biotechnology Journal},
  volume={20},
  pages={5040--5044},
  year={2022},
  publisher={Elsevier}
}

许可协议

本源代码采用MIT许可协议,详见本源代码树根目录下的LICENSE文件。

我们的框架和模型训练受到以下项目的启发:

  • esm(Facebook的蛋白质语言建模框架)
  • fairseq(PyTorch序列建模框架)

感谢这些工作的作者为RNA-FM提供了出色的基础。


感谢您使用RNA-FM!
如遇问题或有疑问,请在GitHub上提交Issue或查阅文档。我们欢迎社区的贡献与合作。

Introduction

用户可利用该项目进行RNA嵌入生成、二级结构预测等任务,助力mRNA和蛋白质相关研究。项目包含RNA-FM及mRNA-FM预训练模型,在多种结构和功能预测任务上表现优于同类单序列RNA语言模型。【此简介由AI生成】

Customize your domain