\setchapterstyle{kao}
\setchapterpreamble[u]{\margintoc}
\chapter{基因组与基因组学}
\section{遗传信息的分析总述}
\begin{enumerate}
    \item 基因组测序方法。结合分子生物学中基因工程重组DNA相关知识理解。初
步掌握基因组第一代测序方法-双脱氧链终止法Sanger测序。
    \item *\redbf{结构基因组/比较基因组}。基因组测序回答的问题[基因序列数量;组成元素;基因环境]:基因的
    \begin{itemize}
        \item 位置
        \item 数量
        \item 产物
        \item 调控序列特征
        \item 基因组组成结构特征(共线性synteny分析)。
    \end{itemize}
    基因组水平研究基因结构Findingthe
Genes inGenomes。如何预测基因组中的基因:ORFs。
    \item 基因组结构与演化(接合染色体重塑和基因突变内容)。为何通过种间和种内
比较基因组能够确定一些保守和/或变异基因序列特征,并说明其意义。
    \item 掌握和比较:Orthologue直系同源;Paralogue旁系同源;Homologue同源基因;Pseudogene假基因的概念。基因组信息与数据库InformationTechnology and Genomes。NCBl,RefSeq,Blast
    \item 功能基因组学functional genomics
种内个体间基因组水平差异比较Variation AmongGenomes。
什么是DNA多态性DNA polymorphisms:
    \begin{itemize}
    \item SNP: Single nucleotide substitutions
    \item DIPs: Deletion-Insertion polymorphisms
    \item SSR: Simple sequence repeats
\end{itemize}
    \item CNVs:Copy number variants以及匿名多态性anonymouspolymorphisms,结合其特点说说其研究意义和挑战,及其应用意义。通过PCR检测技术能够获取哪几方面的基因比较信息。基因组水平基因型分析Genotyping and SamplingDNA Variation in aGenome。全基因组测序时代,机遇与挑战TheEra of Whole-GenomeSequencing。开放问题。
\end{enumerate}
\section{基因组测序方法}
\subsection{第一代测序方法-双脱氧链终止法Sanger测序【重点】}
\begin{enumerate}
    \item \redbf{模板与引物杂交}。克隆的重组DNA变性(融解成单链),利用热量将连接两条链的氢键分开。其中一条链作为模板。重组DNA与一个寡核苷酸引物混合(提前由DNA合成仪产生),引物序列与模板链载体部分约20个互补碱基。随着温度的降低,模板和引物退火(杂交)在一起。
    \item \redbf{产生一套嵌套的聚合产物}。模板-引物杂交物现在与DNA聚合酶、大量的四种脱氧核苷三磷酸(dNTP)和少量的四种双脱氧核苷三磷酸
(ddNTP)混合。每个ddNTP都有不同颜色的荧光标记。DNA聚合酶通过在引物的3’端依次加人核苷酸,合成与模板互补的DNA新链。当一个双
脱氧核苷酸加人链中时,合成终止。该反应生成了一组嵌套的产物,每个产物都有相同的5’端和不同的3’端。3’端的双脱氧核苷酸的颜色编码了每
个产物。在将新合成的DNA从模板中融解下来后,这些产物在一种特殊的凝胶上进行电泳,这种凝胶可以通过一个核苷酸的差异分离大小不同的DNA。当每个片段经过激光束时,末端碱基的颜色就会被检测并记录下来。
    \item \redbf{双脱氧核苷酸的结构}。由于ddNTP在脱氧核糖的3’碳原子上缺少一个羟基基团,DNA聚合酶无法将任何核苷酸添加到3’端有双脱氧核苷酸的链上。
    \item \redbf{分析凝胶上嵌套的产物}。
    \item \redbf{测序凝胶图像}。每道显示了用不同的样本获得的序列。
    \item \redbf{一条凝胶道的DNA序列痕迹}。原始数据由四种不同颜色的峰值表示。碱基读取软件将新合成的DNA链生成一个文本序列。从一个反应中可以读出近1000个碱基。
\end{enumerate}
\subsection{直系同源和旁系同源}
直系同源基因存在于两
个\redbf{不同物种}中,它们来自两物种共同祖先的同一个基
因;(通常但并不总是)直系同源基因保持相同的功
能。人类和黑猩猩中的c珠蛋白基因是直系同源,因为
c基因已经存在于它们的最后共同祖先中。相反,旁系
同源基因是由复制产生的。

直系同源基因:\redbf{两个不同物种}的序列相似的基因,来自于两个物种共同祖先的相同基因。

旁系同源:在\redbf{同一物种}内,通常在同一染色体内,通过复制而产生的基因;旁系同源基因
通常构成一个基因家族。

同源性是所有进化相关序列的概括性术语,
因此,所有物种中的所有血红蛋白基因都是同源的,但
与肌红蛋白基因的同源性较弱。与红细胞中的血红蛋白
相比,肌红蛋白基因在肌肉组织中编码亲缘关系较远的
携氧蛋白。

\redbf{假基因}:无功能的基因;基因复制和分化的结果,在这种情况下,一个原本具有功能的
基因的拷贝发生了突变,以致不再起作用。

\subsection{通过种间和种内比较基因组确定保守和/或变异基因序列特征}
\subsubsection{方法}
\begin{enumerate}
    \item 种间比较
    \begin{itemize}
        \item 序列比对与同源性(Homology):使用BLAST或多序列比对工具(如Clustal)比较不同物种基因组,识别保守序列(conserved sequences)——如编码区(exons)相似度>80\%,反映净化选择保留的功能核心。书中描述人类-小鼠比较:基因序列保守性远高于整体基因组结构(~99\%蛋白编码基因有同源物)。
        \item 同源性块(SyntenyBlocks):分析基因顺序保留(conservedsynteny),如人类与果蝇共享~60\%基因核心。这些块通过重塑边界(breakpoints)区分保守vs.变异(如易位中断synteny)。
        \item 变异识别:计算分化率(divergence rate),如非编码区(introns/promoters)突变多,揭示重塑诱导的变异序列。
        \item 例子:书中用Hox基因簇(发育调控基因)举例,跨脊椎动物保守,突变少;但调控区变异驱动形态差异。
    \end{itemize}
    \item 种内比较
    \begin{itemize}
        \item 多态性分析(Polymorphism):比较同一物种个体基因组(如人类1000基因组项目),用SNP(单核苷酸多态)密度识别变异序列(高变异区如重复序列)。保守序列在种内也低变异,反映近期中性漂变。
        \item 群体遗传学:计算固定率(fixation rate)和Tajima's D统计,区分中性变异 vs. 选择驱动保守。书中讨论种内重复区(duplications)易变异,导致基因家族扩展。
        \item 例子:酵母种内比较显示,必需基因序列保守,突变率低;变异区多为非必需基因。
    \end{itemize}
\end{enumerate}
\subsubsection{意义}
\begin{enumerate}
    \item \redbf{演化洞见}:保守序列揭示祖先功能(如必需代谢基因),变异序列追踪重塑/突变事件,重建系统发育树(phylogeny)。例如,synteny块帮助推断分化时间(人类-小鼠~75百万年)。
    \item \redbf{功能预测}:保守序列提示基因重要性(如疾病相关基因CFTR保守高);变异区识别调控元件,促进基因注释。
    \item \redbf{医学与应用}:识别保守基因靶点用于药物设计(如癌症靶向保守通路);变异分析揭示疾病易感性(SNP关联研究)。种内比较指导个性化医学。
    \item \redbf{生物多样性}:理解重塑如何驱动适应(如植物染色体重塑增强耐逆性),支持保护遗传多样性。
\end{enumerate}

\section{ 基因组水平基因型分析、全基因组测序时代机遇与挑战及开放问题}

\subsection{基因组水平基因型分析 (Genotyping \& Sampling DNA Variation in a Genome)}

\textbf{定义}:系统鉴定个体基因组中所有变异位点的基因型(genotype),包括 SNPs、indels、CNVs、SVs。

\textbf{采样策略}:
\begin{itemize}
    \item \textbf{全基因组随机采样}:WGS 或高密度 SNP 芯片(>1M 位点)。
    \item \textbf{靶向富集}:外显子组测序(WES)聚焦编码区。
    \item \textbf{变异优先级}:高频常见变异 → 低频稀有变异 → 结构变异。
\end{itemize}

\textbf{关键发现}(1000 Genomes Project 示例):
\begin{itemize}
    \item 平均每人 ~3.6M SNPs,~400K indels,~1--2K CNVs。
    \item 变异密度:非编码区高,功能区低。
\end{itemize}
\subsection{全基因组测序时代 (The Era of Whole-Genome Sequencing)}

\textbf{机遇}:
\begin{itemize}
    \item \textbf{全面变异图谱}:捕获稀有变异与 SVs,填补 GWAS “缺失遗传力”。
    \item \textbf{精准医学}:个体化风险预测、肿瘤体细胞图谱、药物基因组学。
    \item \textbf{演化洞见}:跨物种 WGS 重建系统树,识别选择信号(dN/dS、iHS)。
    \item \textbf{非模式生物研究}:快速组装新物种基因组。
\end{itemize}

\textbf{挑战}:
\begin{itemize}
    \item \textbf{数据爆炸}:单样本 100--200 Gb,存储与计算成本高。
    \item \textbf{变异解释}:>95\% 变异为 VUS(意义不明),非编码区功能未知。
    \item \textbf{技术偏差}:短读长难解析重复区与 SVs;GC 偏好性。
    \item \textbf{伦理与公平}:数据隐私、 incidental findings、种群代表性偏差(>80\% 数据为欧洲祖先)。
\end{itemize}

\section{ 通过 PCR 检测技术能够获取哪几方面的基因比较信息}


\begin{enumerate}
    \item \textbf{序列水平变异比较}:
    \begin{itemize}
        \item 等位基因特异性 PCR (AS-PCR) 或 Sanger 测序扩增产物,识别 SNPs、点突变、indels。
        \item 例:比较疾病 vs. 正常等位基因序列。
    \end{itemize}
    
    \item \textbf{拷贝数变异 (CNV) 比较}:
    \begin{itemize}
        \item 定量 PCR (qPCR) 或数字 PCR (dPCR) 测定目标基因相对拷贝数。
        \item 例:检测基因重复/缺失(如 \textit{AMY1} 淀粉酶基因)。
    \end{itemize}
    
    \item \textbf{基因表达水平比较}:
    \begin{itemize}
        \item 逆转录 PCR (RT-PCR) 或 qRT-PCR 比较 mRNA 丰度。
        \item 揭示组织特异性或环境响应差异。
    \end{itemize}
    
    \item \textbf{长度多态性比较}:
    \begin{itemize}
        \item 扩增微卫星 (SSR) 或 VNTR,电泳比较片段长度。
        \item 用于个体识别或种群分化分析。
    \end{itemize}
    
    \item \textbf{进化与同源性比较}:
    \begin{itemize}
        \item 设计保守引物扩增跨物种同源基因(如 COI、rDNA),序列比对推断系统发育。
    \end{itemize}
\end{enumerate}