碱基计数

DNA 碱基计数器

统计 DNA 序列中每种核苷酸的出现次数。

输入 DNA 序列以统计碱基。

工具描述

碱基计数器统计 DNA 序列中每种核苷酸(A、T、C、G)及其他非标准字符的数量。适用于序列质量检查和组成分析。

使用说明

在输入框中粘贴或输入 DNA 序列,A、T、C、G 及其他字符的数量和百分比会即时显示。

了解更多

功能简介

DNA 碱基计数器统计序列中 A、T、C、G 各自出现的次数,换算为占总数的百分比,并把其余字符归入「其他」一行。统计不区分大小写,因此测序文件中的小写序列与大写序列处理方式相同。学生可用它核对碱基组成,实验人员则常用它快速检查从供应商、测序报告或文献中粘贴过来的序列是否干净。

原理与公式

每种碱基的频数就是简单计数,占比为 计数 / 总数 × 100,其中总数包含表格中报告的全部字符。这些数字之所以有意义,源于 Chargaff 规则:在双链分子中 A 与 T、G 与 C 严格相等;而在多数基因组的长单链中,A 与 T、G 与 C 也近似相等(Chargaff 第二法则)。长序列若明显偏离这种近似对称,通常反映真实现象,例如复制起点两侧的链特异 GC/AT 偏斜、编码链偏好,或者说明粘贴的文本并非你以为的那段序列。「其他」一行同样具有诊断价值,它汇集了 N 等 IUPAC 简并碱基、数字、空白字符以及各种非核苷酸字母。

演算示例

对 20 nt 序列 5'-ATGCGGATCCATGCTAAGGT-3',计数结果为 A = 5(25.0%)、T = 5(25.0%)、G = 6(30.0%)、C = 4(20.0%),总计 20 个碱基,「其他」为 0。此处 A 与 T 恰好相等,G 比 C 多 2 个,G + C = 10,即 GC 含量 50%。在如此短的寡核苷酸中,G 与 C 相差 2 个属正常波动;但若在数千碱基范围内持续存在同样的失衡,就值得作为真实的组成偏斜加以考察。

适用场景

从 PDF 或邮件里复制序列后,先看「其他」一行:数值不为零说明夹带了隐藏的行号、空格或简并碱基,会干扰后续所有计算。订购长寡核苷酸或基因片段前,查看各碱基占比可以发现极端组成,例如 G 高度富集的序列容易形成 G-四链体、合成难度大。教学实验中,碱基计数器让学生能在真实序列上用数字验证 Chargaff 规则,而不是被动接受结论。

常见问题

怎么统计 DNA 序列中 A、T、C、G 的数量?
把序列粘贴到输入框,各碱基的数量和占总数的百分比会立即显示。统计不区分大小写,混合大小写的输入没有问题;非 A、T、C、G 的字符会单独计入「其他」一行,而不是被悄悄丢弃。
序列中 A 的数量应该等于 T 吗?
在完整的双链分子中,由于碱基一一配对,A 与 T、G 与 C 严格相等。单链本身并不要求平衡,但实际上长的基因组单链往往接近平衡,这就是 Chargaff 第二法则。短寡核苷酸里出现小幅差异很正常;若在数千碱基范围内持续存在较大失衡,则提示真实的链不对称或序列本身有问题。
「其他」一行包含哪些字符?
所有非 A、T、C、G 的字符,最常见的是 N、R、Y 等 IUPAC 简并碱基,也包括复制粘贴残留的数字、空格、换行和标点,以及粘贴 RNA 时出现的 U。「其他」计数不为零,就意味着在进行要求纯 ACGT 的分析之前应先清洗序列。
碱基计数会区分大小写吗?
不会,统计不区分大小写,a 与 A 计入同一项。这一点在实际中有影响:某些流程会把重复序列屏蔽区或低质量区写成小写,而计数器把它们当作普通碱基处理,因此若需排除这些区域,必须在计数前先行删除。