密码子优化与反向翻译
针对宿主优化编码序列,或将蛋白质反向翻译为契合宿主的 DNA。
了解更多
功能简介
本工具有两项相关功能。蛋白质模式下,它将氨基酸序列反向翻译为所选宿主的 DNA 编码序列,为每个残基挑选使用频率最高的同义密码子。DNA 模式下,它重写已有编码序列,使密码子用法匹配宿主偏好,同时保持蛋白质不变。两种模式都报告 GC 含量、发生变化的密码子占比,以及完整的逐密码子映射。合成生物学家、蛋白表达者和构建表达克隆的学生都会用到它。
原理与公式
反向翻译在宿主密码子表中查找每个氨基酸,并选择使用频率最高的同义密码子;对简并氨基酸而言,这把序列推向宿主偏好用法。对已有 CDS 的优化会把每个密码子改写为那些高频选择,还可对你列出的酶切位点进行静默突变去除,同样不改变氨基酸。输出的 GC 百分比是整段编码序列中 G 加 C 的占比,替换百分比是不同于输入的密码子数除以密码子总数。DNA 模式下可选的规避列表通过同义替换去除不想要的位点。
演算示例
将一段 73 个残基的蛋白质针对大肠杆菌反向翻译。亮氨酸由六个密码子编码,会被置为 CTG(大肠杆菌最爱,约占亮氨酸用法的 51%),而非 TTA(不足 2%)。精氨酸变为 CGT 而非 CGG 或 AGA。所得 CDS 偏向约 55% GC,若每个密码子都用稀有者则约为 45%,而一次全新反向翻译的替换百分比接近 100%。若改为优化已有 CDS,替换百分比只显示被改动的密码子,把人源基因移入大肠杆菌时常为 20-40%。
适用场景
当你有蛋白质、需要 DNA 下单时用反向翻译;当某基因在新宿主中表达差时用优化。主要陷阱是把密码子适应指数(CAI)当成全部:高 CAI 序列仍可能折叠不良、藏有隐藏酶切位点,或过度重复某一 tRNA 以致翻译停滞。避免把 GC 推到极端,因为极高 GC 的 DNA 难以克隆和扩增。对毒性或重复蛋白,保留一些稀有密码子以放慢翻译、改善折叠。务必检查优化后的 CDS 没有新的终止密码子或多余位点。
常见问题
- 什么是反向翻译?
- 反向翻译把蛋白质还原为 DNA,即用密码子替换每个氨基酸。由于多数氨基酸由多个同义密码子编码,工具会为所选宿主挑选使用频率最高的密码子,例如大肠杆菌偏好用 CTG 编码亮氨酸(约占亮氨酸用法的 51%),而非 TTA(不足 2%)。结果是一段偏向该宿主用法的编码序列,可直接用于基因合成下单。
- 密码子优化会改变什么?
- 优化会重写已有编码序列,使密码子匹配宿主偏好集,同时保持每个氨基酸不变。它会报告替换百分比(发生变化的密码子占比)以及编码序列最终的 GC 含量。在 DNA 模式下你还可列出要通过静默突变去除的酶切位点。蛋白质序列从不改变,改变的只是每个密码子的 DNA 拼写。
- 为什么不把密码子适应指数拉满?
- 过高的 CAI 会在每处都强行使用最常用密码子,可能耗尽单一 tRNA 而停滞翻译、使蛋白质错误折叠,或产生难以克隆的重复 DNA。真正高表达的基因为了 pacing 延伸会保留一些稀有密码子。目标是适度优化,在重复区保留零星稀有密码子,并确保 GC 含量维持在可克隆范围,而不是追求完美 CAI。
- 有哪些宿主密码子表?
- 宿主列表来自内置密码子表,以表达主力大肠杆菌为首,其后为酵母(酿酒酵母)、人及其他。每个表都带有该生物实测的密码子频率,因此同一蛋白质在不同宿主下会得到不同的优化 DNA。请选择你真正用于表达的物种;若优化成大肠杆菌再克隆进哺乳动物细胞,得到的偏好是错的。