人类与猪的基因相似度不能用一个脱离统计口径的百分比概括。比较“是否存在对应基因”时,得到的是同源基因或直系同源基因的共享比例;比较 dna 时,得到的是序列一致率;比较蛋白质时,得到的则是氨基酸序列一致率。三种结果的分子、分母和单位不同,不能直接互相替代。
因此,看到“人和猪的基因相似度很高”这类说法时,首先要确认它比较的是基因条目、dna 碱基、蛋白质氨基酸,还是能够对齐的整个基因组区域。只有明确这些条件,百分比才具有可比性。
基因相似度通常有哪几种统计口径
| 比较对象 | 常见统计量 | 主要回答的问题 |
|---|---|---|
| 基因条目 | 同源基因共享率 | 人类和猪是否拥有来源相近、功能可能相关的对应基因 |
| dna 序列 | 碱基一致率 | 两段可对齐的 dna 中,有多少位置的碱基相同 |
| 蛋白质序列 | 氨基酸一致率 | 对应基因编码的蛋白质在组成上有多接近 |
| 基因组结构 | 共线性、结构变异和可对齐区域 | 染色体上的基因排列和大片段结构是否相似 |
按基因统计:看的是“有没有对应基因”
基因层面的比较,通常先在人类和猪的基因组注释中寻找同源基因,尤其是来自共同祖先基因、分别保留在两个物种中的直系同源基因。最简单的计算方式可以写成:
共享基因比例 = 符合条件的同源基因数量 ÷ 参照物种的基因总数 × 100%
这里的关键不在公式,而在“符合条件”和“基因总数”如何定义。例如,研究者可以只统计蛋白编码基因,也可以把部分非编码基因纳入分析;可以只计算一对一的直系同源基因,也可以把一个人类基因对应的多个猪基因全部列入。不同数据库的基因注释和筛选阈值,也会改变最终结果。
所以,“人类和猪有多少基因相似”更准确的理解是:两种动物拥有大量演化上相关的基因,尤其是参与细胞基本活动、能量代谢、发育和组织维持的基因。它并不表示这些基因的 dna 序列完全相同,也不表示两个物种的基因数量可以逐项一一对应。
按 dna 序列统计:看的是对齐位置的碱基一致率
如果比较的是 dna 序列,常用计算方式是:
序列一致率 = 对齐后相同的碱基数 ÷ 纳入统计的对齐碱基总数 × 100%
这种计算必须先进行序列比对。研究者需要决定比较哪一部分:可以是某个基因的编码区,也可以包括内含子、启动子和其他调控区域,还可以比较两个基因组中能够可靠对齐的大片段。比较范围不同,结果自然不同。
编码区通常比一些快速变化的非编码区域更容易保持相似,但即使是同一个对应基因,蛋白编码区、内含子和调控区的变化程度也可能不同。基因组中还存在重复序列、插入缺失、倒位、拷贝数变化以及无法可靠对齐的区域。是否把缺口计入分母,如何处理低质量或重复区域,都会影响百分比。
因此,“dna 相似度”一般不是把人类和猪的两条完整 dna 简单并排后计算,而是先确定可比较区域,再说明这些区域中的碱基一致情况。它与“共享基因比例”属于不同层面的指标。
按蛋白质统计:氨基酸相似度可能高于 dna 一致率
基因的 dna 序列发生部分变化后,由于遗传密码具有一定冗余性,蛋白质中的氨基酸不一定随之改变。因此,某些人猪对应基因的蛋白质序列一致率,可能高于其 dna 序列一致率。
蛋白质比较的基本公式是:
氨基酸一致率 = 对齐后相同氨基酸数 ÷ 对齐氨基酸总数 × 100%
不过,“一致”与“相似”也不是完全相同的概念。两个氨基酸如果化学性质接近,可能会被算法计为相似但并非完全一致。不同软件、替换矩阵和缺口处理方式,可能给出不同的相似率。因此,蛋白质层面的数字同样需要配套说明统计方法。
为什么网上会出现不同的人猪基因相似度
不同资料中的数字看起来差距较大,通常不是简单的谁对谁错,而是比较对象发生了变化。常见差异主要来自以下几方面:
- 分母不同:有的统计以人类全部蛋白编码基因为分母,有的只统计一对一对应基因,结果不能直接比较。
- 单位不同:基因数量、dna 碱基和蛋白质氨基酸是三种不同单位,不能把共享基因比例当作 dna 相似度。
- 区域不同:只比较编码区、完整基因,或比较整个可对齐基因组,得到的结果会有明显差异。
- 参考版本不同:基因组组装版本、基因注释数据库和比对算法持续更新,统计结果也可能随之调整。
- “相似”定义不同:有些报告统计完全相同的位置,有些还会纳入性质接近的碱基或氨基酸。
如果一段材料只写“人类与猪的基因相似度为某个百分比”,却没有说明比较对象、参考物种、统计区域和数据库版本,就很难判断这个数字具体代表什么。更严谨的表达应当写成“在某一基因集或可对齐序列中,按某种方法计算出的共享率或一致率”。
共享基因多,不等于人和猪完全相同
人类和猪都属于哺乳动物,许多维持生命所必需的基因在长期演化中受到保留。这解释了为什么两者在部分细胞机制、器官发育过程和基础生理功能上能够找到对应关系,也说明猪可以作为某些生物医学研究中的动物模型。
但物种之间的差异并不只取决于“有没有这个基因”。同一个基因在不同物种中的 dna 序列、拷贝数量、调控方式、表达时间和表达组织都可能不同;基因之间的相互作用、染色体结构、免疫反应和代谢过程也会产生差异。即便两个物种拥有对应基因,也不能据此推断它们具有完全相同的器官功能或疾病表现。
如何准确理解这个问题
对“人类与猪的基因相似度”最稳妥的回答是:人类和猪共享大量演化上相关的基因,但不存在一个适用于所有场景的单一相似度百分比。若讨论的是基因层面,应说明同源基因的筛选方式;若讨论的是 dna 层面,应说明对齐区域和碱基统计方法;若讨论的是蛋白质层面,则应使用氨基酸一致率或相似率,并注明算法口径。
换句话说,真正需要先确定的不是“百分之多少”,而是“比较什么、以什么为分母、在哪一段序列上比较,以及统计结果对应哪一版基因组数据”。
图片新闻
新媒体实验室
举报邮箱:
pg游戏库最新版本 copyright © 1996-2026 sina corporation
all rights reserved 新浪公司