用户可利用该项目进行RNA嵌入生成、二级结构预测等任务,助力mRNA和蛋白质相关研究。项目包含RNA-FM及mRNA-FM预训练模型,在多种结构和功能预测任务上表现优于同类单序列RNA语言模型。【此简介由AI生成】
RNA-FM:RNA基础模型
简介
RNA-FM(RNA基础模型)是一款最先进的RNA序列预训练语言模型,是集成化RNA研究生态系统的核心。通过自监督学习在超过2300万条非编码RNA(ncRNA)序列上进行训练,RNA-FM能够从RNA序列中提取全面的结构和功能信息,且无需依赖实验标签。 mRNA-FM 是RNA-FM的直接扩展,专门在4500万条mRNA编码序列(CDS)上训练而成。它旨在捕捉mRNA特有的信息,并在相关任务中展现出卓越性能。 因此,RNA-FM生成的通用RNA嵌入适用于广泛的下游任务,包括但不限于二级和三级结构预测、RNA家族聚类以及功能性RNA分析。
RNA-FM最初在《Nature Methods》上作为RNA生物学的基础模型被提出,在各种结构和功能基准测试中,其性能优于所有已评估的单序列RNA语言模型,为RNA分析带来了前所未有的准确性。基于此,我们团队开发了一个集成化RNA pipeline,其中包括:
- RhoFold——高精度RNA tertiary结构预测(序列→结构)。
- RiboDiffusion——基于扩散模型的RNA 3D设计逆折叠(结构→序列)。
- RhoDesign——用于RNA设计的几何深度学习方法(结构→序列)。
这些工具与RNA-FM协同工作,可从序列预测RNA结构、设计能折叠成特定3D结构的新RNA序列,并分析其功能特性。我们的集成生态系统旨在推动RNA疗法的发展、促进合成生物学的创新,并加深我们对RNA结构-功能关系的理解。
参考文献
@article{chen2022interpretable,
title={Interpretable RNA Foundation Model from Unannotated Data for Highly Accurate RNA Structure and Function Predictions},
author={Chen, Jiayang and Hu, Zhihang and Sun, Siqi and Tan, Qingxiong and Wang, Yixuan and Yu, Qinze and Zong, Licheng and Hong, Liang and Xiao, Jin and King, Irwin and others},
journal={arXiv preprint arXiv:2204.00300},
year={2022}
}
目录
基础模型与扩展生态系统
RNA-FM生态系统组件:我们的平台包含四个集成工具,每个工具针对RNA分析和设计流程中的关键步骤:
| 模型 | 任务 | 描述 | 代码 | 论文 |
|---|---|---|---|---|
| RNA-FM | 基础模型(表征学习) | 针对非编码RNA序列(RNA-FM)和信使RNA序列(mRNA-FM)的预训练Transformer(BERT风格)模型;用于提取嵌入特征并预测碱基配对概率 | GitHub | Nature Methods |
| RhoFold | 三维结构预测 | 基于RNA-FM的序列到结构预测模型(提供三维坐标和二级结构) | GitHub | Nature Methods |
| RiboDiffusion | 逆折叠 | 用于从结构生成序列的RNA设计生成式扩散模型 | GitHub | ISMB'2024 |
| RhoDesign | 逆折叠 | 用于从结构生成序列设计的几何深度学习模型(GVP+Transformer) | GitHub | Nature Computational Science |
基础模型
| 模型 | 训练语料 | 序列数量 | 层数/隐藏维度 | 参数规模 | 典型应用场景 |
|---|---|---|---|---|---|
| RNA-FM | 非编码RNA | 23.7 M | 12 / 640 | 99 M | 非编码RNA结构与功能研究、适配体设计 |
| mRNA-FM | 信使RNA | 45 M | 12 / 1280 | 239 M | mRNA表达建模、CDS分析 |
RNA-FM
-
RNA-FM 是一个12层BERT编码器,通过掩码token预测任务在 23.7 M 条非编码RNA序列(RNAcentral100)上进行预训练。它生成的640维嵌入已编码二级结构、三维邻近性乃至进化信号,使其成为该生态系统中所有下游工具的表示基础。
mRNA-FM
- mRNA-FM 作为RNA-FM的扩展,专门在4500万条mRNA编码序列(CDS)上训练。它专为建模mRNA特异性特征而设计,在mRNA相关任务中实现了最先进的性能。
下游工具
RhoFold(三级结构预测)
-
RhoFold (Tertiary Structure Prediction)——一款由RNA-FM驱动的RNA三维结构预测工具。输入RNA序列后,RhoFold可快速预测其三级结构(PDB格式的3D坐标),同时提供二级结构(CT文件)和每个残基的置信度分数。通过将RNA-FM嵌入与结构预测网络相结合,它在RNA三维结构基准测试中实现了高精度,在RNA-Puzzles挑战赛中显著优于先前的方法。
点击展开RhoFold详情
RhoFold利用RNA-FM强大的嵌入能力,彻底改变了RNA三级结构预测。通过将深度学习与结构生物学原理相结合,RhoFold可将RNA序列直接转化为精确的3D坐标。该模型采用多阶段架构,首先将RNA-FM的上下文表征转换为距离图和扭转角,然后将这些信息组装成完整的三维结构。与以往常常难以应对RNA复杂折叠图景的方法不同,RhoFold的基础模型方法能够捕捉微妙的序列-结构关系,从而在RNA-Puzzles等具有挑战性的基准测试中实现最先进的性能。该系统支持单序列模式以进行快速预测,当需要更高精度时,还可以整合多序列比对(MSA),使其适用于从小RNA到复杂核酶和核糖开关等各种研究应用。
- RhoFold 用于三级结构预测:
- 在RNA-Puzzles / CASP类型任务中提供顶级精度。
- 在几秒钟内预测3D结构(单序列模式),并可整合MSA以进一步提高精度。
- 达到《Nature Methods》级别的基准,可推广到新的RNA家族。
- RhoFold 用于三级结构预测:
RiboDiffusion(逆折叠——扩散模型)
-
RiboDiffusion (Inverse Folding – Diffusion)——一种基于扩散模型的RNA设计逆折叠工具。从目标3D骨架结构出发,RiboDiffusion通过迭代生成能够折叠成该形状的RNA序列。这种生成式方法比以往的逆折叠算法具有更高的序列恢复率(约11–16%的提升),同时还能为设计的序列提供可调节的多样性。
点击展开RiboDiffusion详情
RiboDiffusion通过基于扩散的生成模型在RNA逆折叠领域取得了突破。传统的RNA设计方法常常难以应对庞大的序列空间,而RiboDiffusion则采用了一种受生成式AI最新进展启发的新颖方法。该模型从随机噪声开始,通过精心控制的扩散过程,迭代优化RNA序列,使其与目标3D骨架结构相符。这种方法使RiboDiffusion能够在探索多样化序列解决方案的同时保持结构保真度,这在生物分子设计中是一个关键的平衡。扩散框架本身就提供了序列多样性,使研究人员能够生成和测试多个均满足结构约束的候选设计。已发表的基准测试表明,RiboDiffusion相比以往方法实现了更高的序列恢复率,这使其在设计功能性RNA(如核糖开关、适配体和其他结构元件)时特别有价值,因为在这些情况下序列-结构关系至关重要。
- RiboDiffusion 用于逆折叠:
- 一种基于扩散的生成方法,在序列恢复率上比先前方法高出约11–16%。
- 提供可调节的设计多样性,为单一目标形状探索多种有效序列。
- RiboDiffusion 用于逆折叠:
RhoDesign(逆折叠——确定性模型)
-
RhoDesign (Inverse Folding – Deterministic)——一种用于RNA设计的确定性几何深度学习模型。RhoDesign使用图神经网络(GVP)和Transformer,针对给定的3D结构(可选择整合二级结构约束)直接解码序列。它在匹配目标结构方面实现了最先进的准确性,在标准基准测试中的序列恢复率超过50%(几乎是传统方法的两倍),并且在当前解决方案中具有最高的结构保真度(TM分数)。
点击展开RhoDesign详情
RhoDesign采用几何深度学习,引入了一种确定性的RNA逆折叠方法。与基于扩散的方法不同,RhoDesign通过结合图向量感知器(GVP)和Transformer网络的专用架构,直接将3D结构信息转化为RNA序列。这种架构能够有效捕捉RNA骨架中的局部几何约束和全局结构模式。RhoDesign可以整合可选的二级结构约束,允许研究人员指定某些碱基配对模式,同时让模型优化其余序列。基准测试表明,RhoDesign在标准数据集上实现了超过50%的显著序列恢复率——几乎是传统方法性能的两倍。此外,设计的序列在当前方法中表现出最高的结构保真度(通过TM分数衡量)。这种准确性和效率的结合使RhoDesign特别适用于精密RNA工程应用,在这些应用中结构完整性至关重要。
- RhoDesign 用于逆折叠:
- 一种确定性GVP + Transformer模型,在标准3D设计基准测试中序列恢复率**>50%**,几乎是旧算法的两倍。
- 在测试方法中实现最高的结构保真度(TM分数),已在《Nature Computational Science》发表。
- RhoDesign 用于逆折叠:
统一工作流程:这些工具协同工作,实现端到端的RNA工程。对于任何感兴趣的RNA序列,可以使用RNA-FM和RhoFold来预测其结构(二级和三级)。相反,给定所需的RNA结构,可以使用RiboDiffusion或RhoDesign(或两者结合进行交叉验证)来设计候选序列。然后,可以通过RhoFold对设计的序列进行折叠验证,从而形成闭环。这种由RNA-FM嵌入驱动的正向和逆向设计循环,创建了一个强大的闭环工作流程,用于探索RNA结构-功能空间。通过无缝整合预测和设计,RNA-FM生态系统加速了RNA科学中的设计-构建-测试范式,为RNA疗法、合成生物学构建以及我们对RNA生物学的理解奠定了突破的基础。
应用场景
RNA 三维结构预测
- 基于语言模型的深度学习方法实现精准RNA三维结构预测——介绍了RhoFold+,该方法将RNA-FM嵌入与几何模块相结合,在CASP/RNA-Puzzles基准测试中达到了SOTA精度(论文,代码)
- NuFold:端到端RNA三级结构预测——将RNA-FM特征整合到U-former网络架构中,其预测精度可与当前最先进的折叠预测工具相媲美(论文,代码)
- TorRNA——利用大型语言模型改进主链扭转角预测——采用RNA-FM作为序列编码器,与之前的方法相比,将扭转角中值误差降低了2–16%(论文)
RNA设计与逆折叠
- 利用结构预测进行RNA适配体的深度生成设计——采用RhoDesign设计出荧光增益>3倍的Mango适配体变体(经湿实验验证)(论文,代码)
- RiboDiffusion:基于三级结构的RNA逆折叠生成扩散模型——在RhoFold生成的数据上训练扩散采样器;与基于二级结构的基准方法相比,原生序列恢复率提升了11–16%(论文,代码)
- gRNAde:用于三维RNA逆设计的几何深度学习方法——通过RhoFold正向折叠验证每个设计,原生序列恢复率达到56%,而Rosetta为45%(论文,代码)
- RILLIE框架——将16亿参数的RNA语言模型与RhoDesign相集成,用于Broccoli/Pepper适配体的计算机定向进化(代码)
功能注释与亚细胞定位
- RNALoc-LM:基于预训练RNA语言模型的RNA亚细胞定位预测——用RNA-FM嵌入替代独热编码输入,使长链非编码RNA(lncRNA)、环状RNA(circRNA)和微小RNA(miRNA)的定位预测MCC值提升4–8%(论文,代码)
- PlantRNA-FM:用于植物转录本的可解释RNA基础模型——将RNA-FM架构适配于超过2500万条植物RNA;发现与翻译相关的结构基序,并在基因区域注释任务上达到F1 = 0.97(论文,代码)
RNA-蛋白质相互作用
- ZHMolGraph:用于RNA-蛋白质相互作用预测的网络引导深度学习方法——在图神经网络(GNN)中结合RNA-FM(用于RNA)和ProtTrans(用于蛋白质)嵌入,对未见过的RNA-蛋白质对,AUROC提升高达28%(论文,代码)
核心要点:在结构预测、从头序列设计、功能注释和相互作用建模等领域,研究社区正逐步采用RNA-FM及其RhoFold/RiboDiffusion/RhoDesign工具包作为可靠的构建模块——充分展示了该生态系统的多功能性和实际应用价值。
安装与使用
使用Conda配置环境
以下是在本地配置RNA-FM及其扩展流程(如RhoFold)环境的步骤。
(如果您不想在本地安装,请参考前面提到的在线服务器。)
- 克隆仓库并创建Conda环境:
git clone https://github.com/ml4bio/RNA-FM.git
cd RNA-FM
conda env create -f environment.yml
- 激活并进入工作区:
conda activate RNA-FM
cd ./redevelop
-
从我们的 Hugging Face 仓库 下载预训练模型,并将
.pth文件放入pretrained文件夹。对于 mRNA-FM,请确保您的输入 RNA 序列长度为 3 的倍数(密码子),并将 mRNA-FM 的专用权重也放入同一个
pretrained文件夹中。
快速开始使用
环境准备就绪且权重下载完成后,您可以按以下方式执行常见任务:
1. 嵌入生成
使用 RNA-FM 为输入序列提取核苷酸水平的嵌入:
python launch/predict.py \
--config="pretrained/extract_embedding.yml" \
--data_path="./data/examples/example.fasta" \
--save_dir="./results" \
--save_frequency 1 \
--save_embeddings
此命令会处理 example.fasta 中的序列,并将每个核苷酸的 640 维嵌入保存到 ./results/representations/。
-
使用 mRNA-FM: 若要使用 mRNA-FM 变体而非默认的 ncRNA 模型,请添加模型名称参数,并确保输入序列已按密码子对齐:
python launch/predict.py \ --config="pretrained/extract_embedding.yml" \ --data_path="./data/examples/example.fasta" \ --save_dir="./results" \ --save_frequency 1 \ --save_embeddings \ --save_embeddings_format raw \ MODEL.BACKBONE_NAME mrna-fm对于 mRNA-FM,您可以通过额外参数
MODEL.BACKBONE_NAME来调用它。 请记住,mRNA-FM 采用密码子分词,因此每个序列的长度必须能被 3 整除。
2. RNA 二级结构预测
使用 RNA-FM 根据序列预测 RNA 二级结构(碱基配对):
python launch/predict.py \
--config="pretrained/ss_prediction.yml" \
--data_path="./data/examples/example.fasta" \
--save_dir="./results" \
--save_frequency 1
RNA-FM 会将碱基对概率矩阵(.npy)和二级结构(.ct)输出至 ./results/r-ss。
在线服务器
如果您不想在本地安装任何程序,可以使用我们的 RNA-FM 服务器。该服务器提供简洁的网页界面,您可以:
- 提交 RNA 序列以获取其预测的二级结构和/或嵌入向量。
- 无需本地计算资源或配置即可获取结果。
(另有 RhoFold 服务器 可用于单条 RNA 序列的三级结构预测。)
进一步开发与 Python API
教程
如果您仅需使用预训练模型(而非运行所有 pipeline 脚本),可以直接安装 RNA-FM:
pip install rna-fm
或者,获取 GitHub 上的最新版本:
cd ./RNA-FM
pip install .
RNA-FM
接下来,在您自己的 Python 项目中加载 RNA-FM:
import torch
import fm
# 1. Load RNA-FM model
model, alphabet = fm.pretrained.rna_fm_t12()
batch_converter = alphabet.get_batch_converter()
model.eval() # disables dropout for deterministic results
# 2. Prepare data
data = [
("RNA1", "GGGUGCGAUCAUACCAGCACUAAUGCCCUCCUGGGAAGUCCUCGUGUUGCACCCCU"),
("RNA2", "GGGUGUCGCUCAGUUGGUAGAGUGCUUGCCUGGCAUGCAAGAAACCUUGGUUCAAUCCCCAGCACUGCA"),
("RNA3", "CGAUUCNCGUUCCC--CCGCCUCCA"),
]
batch_labels, batch_strs, batch_tokens = batch_converter(data)
# 3. Extract embeddings (on CPU)
with torch.no_grad():
results = model(batch_tokens, repr_layers=[12])
token_embeddings = results["representations"][12]
mRNA-FM
对于mRNA-FM,可通过 fm.pretrained.mrna_fm_t12() 进行加载,并确保输入序列为密码子对齐(如上述快速入门所示)。
import torch
import fm
# 1. Load mRNA-FM model
model, alphabet = fm.pretrained.mrna_fm_t12()
batch_converter = alphabet.get_batch_converter()
model.eval() # disables dropout for deterministic results
# 2. Prepare data
data = [
("CDS1", "AUGGGGUGCGAUCAUACCAGCACUAAUGCCCUCCUGGGAAGUCCUCGUGUUGCACCCCUA"),
("CDS2", "AUGGGGUGUCGCUCAGUUGGUAGAGUGCUUGCCUGGCAUGCAAGAAACCUUGGUUCAAUCCCCAGCACUGCA"),
("CDS3", "AUGCGAUUCNCGUUCCC--CCGCCUCC"),
]
batch_labels, batch_strs, batch_tokens = batch_converter(data)
# 3. Extract embeddings (on CPU)
with torch.no_grad():
results = model(batch_tokens, repr_layers=[12])
token_embeddings = results["representations"][12]
更多教程可在 GitHub 上找到。相关的笔记本文件存储在 tutorials 文件夹中。
笔记本教程
通过我们全面的教程开始使用 RNA-FM:
| 教程 | 描述 | 格式 |
|---|---|---|
| RNA 家族聚类与类型分类 |
如何提取 RNA-FM 嵌入用于 RNA 家族聚类和 RNA 类型分类。本教程涵盖嵌入的可视化以及在其基础上训练简单分类器的方法。 | Jupyter 笔记本 |
| RNA 二级结构预测 | 如何使用 RNA-FM 预测 RNA 二级结构、输出碱基配对概率矩阵以及可视化预测的碱基配对(二级结构)。 | Python 脚本 |
| UTR 功能预测 |
如何利用 RNA-FM 嵌入预测 mRNA 中非翻译区(5′ 和 3′ UTR)的功能特性。这包括训练模型以根据 UTR 序列预测基因表达或蛋白质翻译指标。 | Jupyter 笔记本 |
| mRNA 表达预测 |
如何使用 mRNA-FM 变体从 mRNA 序列预测基因表达水平。本教程演示了加载专用的 mRNA 模型、提取嵌入以及构建分类器以区分高表达和低表达基因的方法。 | Jupyter 笔记本 |
其他资源:
视频教程(中文) - 逐步指导如何使用 RNA-FM 进行各种 RNA 分析任务
这些教程涵盖了 RNA-FM 的核心应用,从基本的嵌入提取到高级的功能预测。每个教程都提供了可立即在浏览器或本地环境中运行的实践示例。
生态系统使用示例
我们建议探索高级的RhoFold、RiboDiffusion和RhoDesign项目,以完成诸如3D结构预测或RNA设计等任务。以下是简要的使用示例:
点击展开RNA-FM生态系统详情
RhoFold(序列→结构)
# Example: Predict 3D structure for an RNA sequence in FASTA.
cd RhoFold
python inference.py \
--input_fas ./example/input/5t5a.fasta \
--output_dir ./example/output/5t5a/ \
--ckpt ./pretrained/RhoFold_pretrained.pt
输出结果:
unrelaxed_model.pdb/relaxed_1000_model.pdb(三维坐标)ss.ct(二级结构)results.npz(距离/角度预测 + 置信度分数)log.txt(运行日志、pLDDT 等)
RiboDiffusion(结构→序列)
cd RiboDiffusion
CUDA_VISIBLE_DEVICES=0 python main.py \
--PDB_file examples/R1107.pdb \
--config.eval.n_samples 5
这将生成5条候选RNA序列,这些序列可折叠为R1107.pdb中提供的结构。输出的FASTA文件将保存到exp_inf/fasta/目录下。
RhoDesign(结构→序列)
cd RhoDesign
python src/inference.py \
--pdb ../example/2zh6_B.pdb \
--ss ../example/2zh6_B.npy \
--save ../example/
这会生成一个经过设计的RNA序列,该序列预计会折叠成目标3D形状(PDB文件2zh6_B.pdb,可选择使用2zh6_B.npy中的二级结构约束)。输出序列将保存到指定文件夹中。您可以调整采样温度等参数,以探索更多样化或更高保真度的设计。
API参考
API参考
RNA-FM生态系统中的每个项目都提供命令行界面和Python模块:
- RNA-FM:核心模块
fm用于嵌入提取和二级结构预测。fm.pretrained.rna_fm_t12()– 加载12层ncRNA模型fm.pretrained.mrna_fm_t12()– 加载12层mRNA(密码子)模型
- RhoFold:使用
RhoFoldModel类或inference.py脚本。inference.py接收FASTA序列(可选MSA)并输出3D结构。- 添加
--single_seq_pred True可在无MSA的情况下运行(单序列模式)。
- RiboDiffusion:使用
main.py脚本或导入扩散模型类。main.py接收PDB结构作为输入并输出设计序列。- 修改
configs/中的设置(例如cond_scale、n_samples)以调整生成效果。
- RhoDesign:使用
inference.py脚本或导入设计模型模块。inference.py接收PDB(可选二级结构/接触图)并输出设计序列。- GVP+Transformer架构可整合部分结构约束,并支持高级采样策略。
有关更多详细信息,请参阅每个仓库的文档或tutorials文件夹中的笔记本。
相关RNA语言模型
| 名称 | 数据集 | 模态 | tokenization | 架构 | 骨干网络 | 预训练任务 | 层数 | 模型参数 | 数据量 | 代码 | 权重 | 数据 | 许可证 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| RNA‑FM | ncRNA | 序列 | 碱基 | 仅编码器 | Transformer | MLM | 12 | 1亿 | 2300万 | GitHub | HuggingFace | RNAcentral | MIT |
| RNABERT | ncRNA | 序列 | 碱基 | 仅编码器 | Transformer | MLM / SAL | 6 | 50万 | 76万 | GitHub | Drive | Rfam 14.3 | MIT |
| RNA‑MSM | ncRNA | 序列+MSA | 碱基 | 仅编码器 | MSA‑Transformer | MLM | 12 | 9500万 | 3932个家族 | GitHub | Drive | Rfam 14.7 | MIT |
| AIDO.RNA | ncRNA | 序列 | 碱基 | 仅编码器 | Transformer | MLM | 32 | 16亿 | 4200万 | GitHub | HuggingFace | 公共ncRNA混合集 | Apache‑2.0 |
| ERNIE‑RNA | ncRNA | 序列 | 碱基 | 仅编码器 | Transformer | MLM | 12 | 8600万 | 2040万 | GitHub | GitHub | Rfam + RNAcentral | MIT |
| GenerRNA | ncRNA | 序列 | BPE | 仅解码器 | Transformer | CLM | 24 | 3.5亿 | 1609万 | GitHub | HuggingFace | 公共ncRNA混合集 | Apache‑2.0 |
| RFamLlama | ncRNA | 序列 | 碱基 | 仅解码器 | Llama | CLM | 6‑10 | 1300万‑8800万 | 60万 | HuggingFace | HuggingFace | Rfam 14.10 | CC BY‑NC‑4.0 |
| RNA‑km | ncRNA | 序列 | 碱基 | 仅编码器 | Transformer | MLM | 12 | 1.52亿 | 2300万 | GitHub | Drive | Rfam + RNAcentral | MIT |
| RNAErnie | ncRNA | 序列 | 碱基 | 仅编码器 | Transformer | MLM | 12 | 1.05亿 | 2300万 | GitHub | GitHub | 公共ncRNA混合集 | Apache‑2.0 |
| OPED | pegRNA | 序列 | k‑mer | 编码器‑解码器 | Transformer | 回归 | n/a | n/a | 4万 | GitHub | — | 公共pegRNA效率数据 | MIT |
| GARNET | rRNA | 序列 | k‑mer | 仅解码器 | Transformer | CLM | 18 | 1900万 | 8900万tokens | GitHub | Release | 公共rRNA | MIT |
| IsoCLR | pre‑mRNA | 序列 | One‑hot | 仅编码器 | CNN | 对比学习 | 8 | 100万‑1000万 | 100万 | GitHub | — | Ensembl / RefSeq | — |
| SpliceBERT | pre‑mRNA | 序列 | 碱基 | 仅编码器 | Transformer | MLM | 6 | 2000万 | 200万 | GitHub | Zenodo | UCSC/GENCODE | MIT |
| Orthrus | pre‑mRNA | 序列 | 碱基 | 仅编码器 | Mamba | 对比学习 | 3‑6 | 100万‑1000万 | 4900万 | GitHub | HuggingFace | 直系同源集 | Apache‑2.0 |
| LoRNA | pre‑mRNA | 序列 | 碱基 | 仅解码器 | StripedHyena | 对比学习 | 16 | 650万 | 1亿 | GitHub | (已宣布) | SRA(长读长) | MIT |
| CodonBERT | mRNA CDS | 序列 | 密码子 | 仅编码器 | Transformer | MLM / HSP | 12 | 8700万 | 1000万 | GitHub | HuggingFace | NCBI mRNA | Apache‑2.0 |
| UTR‑LM | 5′UTR | 序列 | 碱基 | 仅编码器 | Transformer | MLM / SSP / MFE | 6 | 100万 | 70万 | GitHub | GitHub | 公共5′UTR集 | MIT |
| 3UTRBERT | 3′UTR | 序列 | k‑mer | 仅编码器 | Transformer | MLM | 12 | 8600万 | 2万 | GitHub | HuggingFace | 公共3′UTR | MIT |
| G4mer | mRNA | 序列 | k‑mer | 仅编码器 | Transformer | MLM | 6 | — | — | — | — | — | — |
| HELM | mRNA | 序列 | 密码子 | 多模态 | 多模态 | MLM + CLM | — | 5000万 | 1530万 | — | — | — | — |
| RiNALMo | RNA | 序列 | 碱基 | 仅编码器 | Transformer | MLM | 33 | 1.35亿‑6.5亿 | 3600万 | GitHub | (需申请) | 公共ncRNA | MIT |
| UNI‑RNA | RNA | 序列 | 碱基 | 仅编码器 | Transformer | MLM | 24 | 4亿 | 5亿 | — | — | — | — |
| ATOM‑1 | RNA | 序列 | 碱基 | 编码器‑解码器 | Transformer | — | — | — | — | — | — | — | — |
| BiRNA‑BERT | RNA | 序列 | 碱基 + BPE | 仅编码器 | Transformer | MLM | 12 | 1.17亿 | 3600万 | GitHub | HuggingFace | 公共ncRNA | MIT |
| ChaRNABERT | RNA | 序列 | GBST | 仅编码器 | Transformer | MLM | 6‑33 | 800万‑6.5亿 | 6200万 | — | (800万演示版) | 公共ncRNA | — |
| DGRNA | RNA | 序列 | 碱基 | 仅编码器 | Mamba | MLM | 12 | 1亿 | 1亿 | — | — | — | — |
| LAMAR | RNA | 序列 | 碱基 | 仅编码器 | Transformer | MLM | 12 | 1.5亿 | 1500万 | GitHub | (已宣布) | 公共ncRNA | MIT |
| OmniGenome | RNA | 序列、结构 | 碱基 | 仅编码器 | Transformer | MLM / Seq2Str / Str2Seq | 16‑32 | 5200万‑1.86亿 | 2500万 | GitHub | HuggingFace | 公共多组学 | Apache‑2.0 |
| PlantRNA‑FM | RNA | 序列、结构 | 碱基 | 仅编码器 | Transformer | MLM / SSP / CLS | 12 | 3500万 | 2500万 | HuggingFace | HuggingFace | 植物RNA集 | CC BY‑NC‑4.0 |
| MP‑RNA | RNA | 序列、结构 | 碱基 | 仅编码器 | Transformer | SSP / SNMR / MRLM | 12 | 5200万‑1.86亿 | 2500万 | GitHub | (计划中) | 公共ncRNA混合集 | Apache‑2.0 |
引用说明
如果您在研究中使用了RNA-FM或本生态系统的任何组件,请引用相关论文。以下是涵盖基础模型及相关工具的关键 publications 集合(BibTeX 格式):
BibTeX 引用
RNA-FM 与 RNA 结构预测
@article{chen2022interpretable,
title={Interpretable RNA foundation model from unannotated data for highly accurate RNA structure and function predictions},
author={Chen, Jiayang and Hu, Zhihang and Sun, Siqi and Tan, Qingxiong and Wang, Yixuan and Yu, Qinze and Zong, Licheng and Hong, Liang and Xiao, Jin and Shen, Tao and others},
journal={arXiv preprint arXiv:2204.00300},
year={2022}
}
@article{shen2024accurate,
title={Accurate RNA 3D structure prediction using a language model-based deep learning approach},
author={Shen, Tao and Hu, Zhihang and Sun, Siqi and Liu, Di and Wong, Felix and Wang, Jiuming and Chen, Jiayang and Wang, Yixuan and Hong, Liang and Xiao, Jin and others},
journal={Nature Methods},
pages={1--12},
year={2024},
publisher={Nature Publishing Group US New York}
}
@article{chen2020rna,
title={RNA secondary structure prediction by learning unrolled algorithms},
author={Chen, Xinshi and Li, Yu and Umarov, Ramzan and Gao, Xin and Song, Le},
journal={arXiv preprint arXiv:2002.05810},
year={2020}
}
@article{WANG2025102991,
title = {Deep learning for RNA structure prediction},
author = {Jiuming Wang and Yimin Fan and Liang Hong and Zhihang Hu and Yu Li},
journal = {Current Opinion in Structural Biology},
year = {2025},
doi = {https://doi.org/10.1016/j.sbi.2025.102991},
url = {https://www.sciencedirect.com/science/article/pii/S0959440X25000090},
}
RNA设计与逆折叠
@article{wong2024deep,
title={Deep generative design of RNA aptamers using structural predictions},
author={Wong, Felix and He, Dongchen and Krishnan, Aarti and Hong, Liang and Wang, Alexander Z and Wang, Jiuming and Hu, Zhihang and Omori, Satotaka and Li, Alicia and Rao, Jiahua and others},
journal={Nature Computational Science},
pages={1--11},
year={2024},
publisher={Nature Publishing Group US New York}
}
@article{huang2024ribodiffusion,
title={RiboDiffusion: tertiary structure-based RNA inverse folding with generative diffusion models},
author={Huang, Han and Lin, Ziqian and He, Dongchen and Hong, Liang and Li, Yu},
journal={Bioinformatics},
volume={40},
number={Supplement\_1},
pages={i347--i356},
year={2024},
publisher={Oxford University Press}
}
RNA-蛋白质相互作用(RPI)
@article{wei2022protein,
title={Protein--RNA interaction prediction with deep learning: structure matters},
author={Wei, Junkang and Chen, Siyuan and Zong, Licheng and Gao, Xin and Li, Yu},
journal={Briefings in bioinformatics},
volume={23},
number={1},
pages={bbab540},
year={2022},
publisher={Oxford University Press}
}
@article{lam2019deep,
title={A deep learning framework to predict binding preference of RNA constituents on protein surface},
author={Lam, Jordy Homing and Li, Yu and Zhu, Lizhe and Umarov, Ramzan and Jiang, Hanlun and H{\'e}liou, Am{\'e}lie and Sheong, Fu Kit and Liu, Tianyun and Long, Yongkang and Li, Yunfei and others},
journal={Nature communications},
volume={10},
number={1},
pages={4941},
year={2019},
publisher={Nature Publishing Group UK London}
}
数据库与资源
@article{wei2024pronet,
title={ProNet DB: a proteome-wise database for protein surface property representations and RNA-binding profiles},
author={Wei, Junkang and Xiao, Jin and Chen, Siyuan and Zong, Licheng and Gao, Xin and Li, Yu},
journal={Database},
volume={2024},
pages={baae012},
year={2024},
publisher={Oxford University Press UK}
}
单细胞RNA分析
@article{han2022self,
title={Self-supervised contrastive learning for integrative single cell RNA-seq data analysis},
author={Han, Wenkai and Cheng, Yuqi and Chen, Jiayang and Zhong, Huawen and Hu, Zhihang and Chen, Siyuan and Zong, Licheng and Hong, Liang and Chan, Ting-Fung and King, Irwin and others},
journal={Briefings in Bioinformatics},
volume={23},
number={5},
pages={bbac377},
year={2022},
publisher={Oxford University Press}
}
药物发现
@article{fan2022highly,
title={The highly conserved RNA-binding specificity of nucleocapsid protein facilitates the identification of drugs with broad anti-coronavirus activity},
author={Fan, Shaorong and Sun, Wenju and Fan, Ligang and Wu, Nan and Sun, Wei and Ma, Haiqian and Chen, Siyuan and Li, Zitong and Li, Yu and Zhang, Jilin and others},
journal={Computational and Structural Biotechnology Journal},
volume={20},
pages={5040--5044},
year={2022},
publisher={Elsevier}
}
许可协议
本源代码采用MIT许可协议,详见本源代码树根目录下的LICENSE文件。
我们的框架和模型训练受到以下项目的启发:
感谢这些工作的作者为RNA-FM提供了出色的基础。
Introduction
用户可利用该项目进行RNA嵌入生成、二级结构预测等任务,助力mRNA和蛋白质相关研究。项目包含RNA-FM及mRNA-FM预训练模型,在多种结构和功能预测任务上表现优于同类单序列RNA语言模型。【此简介由AI生成】
Customize your domain



