DNA 序列清洗器
清洗和标准化 DNA 序列。
了解更多
功能简介
DNA 序列清洗器对原始序列做标准化处理:移除 FASTA 标题行、数字、空白字符和非 ACGT 字符,并可选择统一转为大写。每个清洗步骤都是独立开关,同时显示清洗前后的字符数,便于确认到底删掉了多少内容。之所以需要它,是因为从 GenBank 记录、文献、供应商报告或表格中复制出来的序列几乎从不是干净连续的字符串。
原理与公式
序列清洗属于基于规则的文本标准化,而非生物学计算:以「>」开头的行按 FASTA 标题处理并删除,数字被移除,包括换行在内的所有空白字符被压缩掉;若开启严格选项,A、C、G、T 之外的字符也一并删除。处理顺序在概念上很重要——必须先逐行删除标题行,再去掉空白字符,否则标题文字会混入序列。需要特别注意的是,移除非 ACGT 字符同时会删掉 N、R、Y 等合法的 IUPAC 简并碱基,导致序列变短、下游坐标整体偏移;若位置信息重要,应保留这些字符并改用可以处理简并碱基的工具。
演算示例
一段 GenBank 风格的文本——标题行为「>」加 gi 12345 sample,随后是带行号的 1 atgcg gtcac 与 11 ttagc——清洗后合并为单一字符串 ATGCGGTCACTTAGC,长度 15 个碱基。标题行、位置编号 1 与 11、行内空格和换行全部被去除,小写输入统一转为大写。保留下来的都是真实碱基,因此清洗后的 15 就是序列的真实长度。
适用场景
在做 Tm、ORF 或 GC 含量计算之前,先清洗来自 PDF 或 GenBank ORIGIN 区块的序列,否则行号和空格会被当作字符计入,使密码子位置发生错位。当合作者把多行 FASTA 记录直接写在邮件正文里时,清洗可得到连续字符串,便于粘贴到订购表单或比对工具中。当 Sanger 测序结果末端带有一串 N 和杂散质量符号时,可开启移除非 ACGT 选项只保留明确碱基,但要记住这会改变编号。
常见问题
- 怎么去掉 DNA 序列里的数字和空格?
- 粘贴原始文本后勾选「移除数字」和「移除空白」,数字、空格、制表符和换行会被剥离,剩余碱基拼接为一条连续字符串。从 GenBank ORIGIN 区块或论文插图中复制的序列每行都带位置编号,通常都需要这样处理。
- 清洗会把 N 和其他简并碱基删掉吗?
- 只有开启「移除非 ACGT 字符」时才会,该选项会删除 A、C、G、T 之外的所有字符,包括 N、R、Y 和表示空位的短横线。删除会使序列变短,之前记录的坐标将无法对应;若需保留位置信息,请关闭该选项,或用替换而非删除的方式处理简并碱基。
- 可以清洗包含多条序列的 multi-FASTA 吗?
- 移除标题行的选项会删掉所有以「>」开头的行,因此包含多条记录的文件会在删除全部标题后,把剩余碱基连成一条连续序列。对单条记录没有问题,但多条记录会被静默拼接,所以请先把 multi-FASTA 拆成单条序列再清洗。
- 为什么清洗之后序列长度变了?
- 因为被删除的字符原本也被计入字符串长度。清洗前后的计数会明确告诉你减少了多少字符,降幅较大通常意味着原文含有行号、空格或简并碱基。如果清洗后的长度与构建体预期一致,说明原字符串只是夹带了冗余字符,序列本身没有问题。