比对 + 点图

本地比对与点阵图

用点阵图和 Smith-Waterman 局部比对比较两条 DNA 序列。

输入两条序列进行比较。

每个点代表一对匹配碱基;对角线揭示共享区域。

输入两条序列进行比较。

打分:匹配 +2,错配 −1,空位 −1。A/T/G/C/U 以外的字符按错配处理。

工具描述

比较两条 DNA 序列常从点阵图开始:每个匹配碱基对用一个点标记,共享区域呈现为对角线。本工具将点阵图与 Smith-Waterman 局部比对结合,报告得分最高的相似区域及一致性。

使用说明

输入或粘贴两条序列,点阵图即时渲染(每个点代表一个匹配碱基)。局部比对面板显示得分最高的区域,包括得分、一致性与比对连线。可用交换按钮反转两条输入。

了解更多

功能简介

本工具用两种互补方式比较两条 DNA 序列:点阵图标出一条序列中的碱基与另一条序列中碱基匹配的所有位置;Smith-Waterman 局部比对则找出得分最高的相似区域,并报告其得分与一致性。点阵图呈现共享结构、重复和倒位的整体图景,局部比对则给出精确匹配片段及比对连线。由于算法需要逐位两两比较,每条序列长度上限为 2000 bp。

原理与公式

点阵图在坐标 (i, j) 处打点,条件是序列 1 的第 i 个碱基等于序列 2 的第 j 个碱基;因此连续的共享片段表现为一条对角线,重复元件表现为多条平行对角线,倒位片段则表现为方向相反的对角线。随后 Smith-Waterman 填充打分矩阵 H(i, j) = max(0, H(i−1, j−1) + s, H(i−1, j) − gap, H(i, j−1) − gap),本工具取匹配 +2、错配 −1、空位 −1,再从矩阵中最高分单元回溯直至得分归零。以 0 为下界正是「局部」的关键:相似性差的区段会让得分重置而不是持续变负,因此算法能在两条整体差异很大的序列中找出保守片段,这也是它与全局 Needleman-Wunsch 比对的根本区别。A、T、G、C、U 以外的字符按错配处理。

演算示例

比较序列 1 ACGTACGTGG 与序列 2 TTACGTACGTAA。点阵图显示一条偏移两个位置的清晰对角线,Smith-Waterman 则还原出共享片段 ACGTACGT 与 ACGTACGT 的比对:8 个碱基全部匹配、无空位,得分为 8 × 2 = 16。两侧的碱基——序列 1 末端的 GG 以及序列 2 中的 TT 和 AA——被排除在局部比对之外,因为向这些区域延伸只会降低得分。

适用场景

当某条测序读长表现异常时,把它与引物或接头序列比对,可以判断读长中是否嵌入了接头以及接头从哪里开始。比较两个等位基因、旁系同源基因或近缘物种的同源序列时,得分最高的局部区域指出保守核心,点阵图则显示其余相似性是单一区块还是被插入片段打断。核对 Sanger 读长与预期构建体时,单一干净的对角线说明匹配良好,而平行或反向的对角线提示串联重复或反向插入。

常见问题

局部比对和全局比对有什么区别?
全局比对(如 Needleman-Wunsch)强制两条序列首尾对齐,适用于长度相近、整体上应当对应的序列。局部比对(如 Smith-Waterman)只找匹配最好的子区域而忽略其余部分,当一条序列明显更短,或者只有某个结构域、基序或外显子保守时,正需要这种做法。
点阵图能反映两条 DNA 序列的什么信息?
关键在于点的分布模式。一条长对角线表示两条序列在该区段相互对应;对角线断开表示存在插入或缺失;多条平行对角线表示重复元件;与主对角线垂直的对角线提示倒位或反向互补片段。零散孤立的点只是偶然匹配,因为只有四种碱基,随机情况下约四分之一的配对就会相同。
为什么匹配记 +2、错配记 −1?
这些是打分参数而非物理常数,它们决定一次比对能容忍多少错配和空位。相对错配与空位罚分而言,匹配奖励越大,就越倾向于产生更长但允许瑕疵的比对;罚分越重,则得到更短、近乎完全一致的区块。本工具采用的匹配 +2、错配 −1、空位 −1 是 DNA 比对中常用的通用方案。
局部比对支持多长的序列?
本工具每条序列最多 2000 bp。Smith-Waterman 为每一对位置建立一个矩阵单元,时间和内存随两条序列长度之积增长,两条 2000 bp 的序列就已经意味着四百万个单元。面对完整基因、染色体或数据库检索时,应使用 BLAST 等启发式工具——它先寻找种子匹配,而不是为每一对位置打分。