ORF 查找器
在 DNA 序列中查找开放阅读框(ORF)。
忽略短于此长度(氨基酸数)的 ORF。
了解更多
功能简介
ORF 查找器在全部 6 种阅读框中扫描 DNA 序列,列出找到的每一个开放阅读框,并报告阅读框、起止位置、氨基酸长度以及翻译得到的蛋白序列。以密码子数为单位的最小长度过滤器,可以屏蔽任何序列中都会随机出现的短 ORF。判断一段新的 contig、PCR 产物或人工构建体是否含有可信编码区时,这通常是第一步分析。
原理与公式
开放阅读框(ORF)从起始密码子 ATG 开始,延伸到同一阅读框内第一个终止密码子(TAA、TAG 或 TGA),中间不含任何终止密码子。由于遗传密码以互不重叠的三联体读取,双链序列共有 6 种可能的阅读框:给定链上偏移 0、1、2 的三个,以及其反向互补链上的另外三个。工具使用标准遗传密码翻译每个候选区,长度按密码子计且不含终止密码子,并且只报告终止密码子出现在序列内部的 ORF,因此延伸出输入末端的编码区不会被列出。反向阅读框给出的位置是反向互补链上的坐标,而不是输入链上的坐标。
演算示例
对 15 个碱基的序列 5'-ATGAAACCCGGGTAA-3',工具报告出 1 个 ORF,位于 +1 阅读框,起点为第 1 位、终点为第 15 位。密码子 ATG AAA CCC GGG 翻译为蛋白 MKPG,长度 4 个氨基酸,TAA 是收尾的终止密码子。其反向互补序列 TTACCCGGGTTTCAT 中完全不含 ATG,因此反向链上没有 ORF 被报告。
适用场景
完成克隆或构建体组装后,扫描插入片段以确认目标 ORF 完整且在正确阅读框内,并且没有因合成错误或移码引入内部终止密码子。对基因做密码子优化以便表达后,重新扫描可检查优化过程有没有产生提前终止密码子,或在反向链上形成较强的替代 ORF。筛查新 contig 的编码潜力时,建议把最小长度设为约 100 个密码子,因为这种长度的 ORF 很难随机出现,更可能是真实基因。
常见问题
- DNA 中的开放阅读框是什么?
- 它是一段以起始密码子(通常为 ATG)开始、在同一阅读框内不间断延伸到第一个终止密码子的序列,原则上可以被翻译成一条连续的多肽。开放阅读框只是候选编码区,并不等于基因,因为真实基因还需要启动子、核糖体结合位点以及表达证据。
- 为什么要检查全部 6 种阅读框?
- 三联体密码可以从第 1、2、3 个碱基起读,每条链因此有 3 种阅读框;又因为 DNA 是双链,基因可能编码在任一条链上,于是变成 6 种。只扫描正向链会漏掉反方向转录的基因,而这在结构紧凑的细菌和病毒基因组中很常见。
- 最小 ORF 长度应该设成多少?
- 用于基因查找时,100 个密码子是常用阈值。在碱基组成均衡的随机序列中,64 个密码子里有 3 个是终止密码子,平均每约 21 个密码子就出现一个终止信号,因此短 ORF 大量随机存在,而超过约 100 个密码子的 ORF 则很少见。如果本来就在寻找小肽,可以下调阈值。
- ORF 查找器能识别 GTG 等替代起始密码子吗?
- 不能,它只从 ATG 起始。许多细菌使用 GTG 或 TTG 作为替代起始密码子,这类基因会被报告为从下游某个内部 ATG 开始,或者完全漏检。因此用于原核注释时,应把结果视为初筛,再用专门的基因预测工具确认真实起始位点。