Files
dpb/doc/桃育种系统统计分析操作手册.md
T
34047007@qq.com 7e449b5c9d checkpoint: 统计分析文档化——操作手册与技术说明双文档
按用户澄清的「操作手册与技术说明分开」落地:操作手册面向育种团队(20 个核心分析
四段式:目的/数据准备/操作步骤/结果解读),技术说明面向方法学/开发者(模型公式、
输入依赖与降级、落库表、API 索引)。常用核心表型分析优先,分子类第二批。
2026-08-07 22:44:00 +08:00

318 lines
18 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 桃育种系统统计分析操作手册
> 版本:v1.02026-08-07
> 面向读者:**育种团队 / 试验管理人员**(无需编程背景)
> 配套文档:方法学与接口细节见《桃育种系统统计分析技术说明》;系统运行维护见《桃育种系统生产上线与运营手册》。
本手册按「目的 → 所需数据 → 操作步骤 → 结果解读」四段式讲解每个常用分析,帮助育种人员在系统里正确、完整地完成一次统计分析。
---
## 一、总体说明
### 1.1 入口
统计功能集中在左侧菜单 **统计计算** 模块,页面为「统计分析」主页(含 24 个分析页签):
- 顶部工具条:**运行 ABLUP / EBV**、**运行配合力 GCA/SCA**、**运行 ANOVA / H²** 三个主按钮;**刷新批次**;**组合得失漏斗**。
- 页签(按使用频度排序):模型批次 / EBV 排行 / 配合力 / 描述统计 / 相关性 / ANOVA·H² / 多环境 GxE / 决选预览 / 模型健康 / 无性系排行 / 交叉验证 / 公平性报告 / 选择指数 / 亲缘·近交 / 稳定性 AMMI·FW / 遗传相关 MT-BLUP / Type-B 多环境遗传相关 / UPGMA 聚类 / 基因组选择 GBLUP / 数据质量 / 遗传增益 ΔG / 选配推荐 / 回交 MABC。
基因组方向的分析(GWAS / QTL / MAS 面板 / QTL×E)在独立的「GWAS」页面,见第 4 节。
### 1.2 同步与异步任务
| 类型 | 分析 | 结果何时可见 |
|---|---|---|
| **异步任务** | ABLUP/EBV、配合力、交叉验证、稳定性、遗传相关、Type-B、基因组选择 GBLUP | 提交后到「模型批次 / 任务状态」查看进度,完成后自动刷新批次 |
| **同步直出** | 描述统计、相关性、ANOVA/H²、选择指数、聚类、数据质量、ΔG、选配、MABC、决选预览、公平性报告、模型健康 | 点击后直接出结果 |
异步任务结束后在「模型批次」页签的**任务状态**表里可见:`SUCCESS` / `FAILED`(含失败原因 `error_msg`)。
### 1.3 分析前请先确认(数据就绪门禁 G1)
多数建模分析带**数据就绪门禁**开关,勾选后若基础数据不达标会**拒绝运行**并给出原因:
- 每个 clone / 家系最少观测株数(`min_clone_n`,默认通常为 3);
- 系谱完整率(`min_pedigree_rate`);
- 缺失率上限(`max_missing_rate`)。
不勾选门禁也可运行,但结果可靠性无法保证。**强烈建议正式分析一律开启门禁。**
---
## 二、数据准备
### 2.1 表型分析的硬性前提(缺一不可)
| 数据 | 说明 | 未准备好时的表现 |
|---|---|---|
| **性状表** `bre_trait` | 分析对象(单果重、可溶性固形物等核心数值性状) | 性状下拉为空,无法选性状 |
| **观测表** `bre_trait_observation` | 逐株性状观测值 | 提示"该性状无观测数据" |
| **树表** `bre_tree` | 每株树的身份信息 | 无法关联单株、克隆、家系 |
### 2.2 增强数据(有则分析更强,缺则自动降级,不影响运行)
| 数据 | 增强什么 |
|---|---|
| **系谱**parent_of 亲子关系) | ABLUP 的系谱 A 矩阵、近交系数、亲缘分析、ΔG 的 σ_A |
| **种质**germplasm) | 种质编号/名称回显、配合力亲本、S-等位选配过滤 |
| **克隆**clone) | 无性系级 EBV 排行、克隆作为随机效应 |
| **砧木**rootstock) | G×R 砧木×接穗互作随机效应 |
| **研究点**trial_study | G×E 环境维度(site)、稳定性分析的环境均值表 |
> 结论:**表型分析只依赖「性状 + 观测 + 树」三张核心表**;空的研究点、缺系谱等都不阻断分析,只是对应的高级功能(G×E、近交、亲缘)不可用或降级。
### 2.3 分子分析的硬性前提
基因组选择(GBLUP/ssGBLUP/rrBLUP/BayesB)、GWAS、QTL、MAS 都要求先创建**基因型数据集**并导入**基因型调用记录**,否则会提示"基因型数据集不存在"或"该数据集无基因型调用记录"。分子分析见第 4 节。
---
## 三、常用核心分析操作说明
### 3.1 描述性统计
**目的**:快速体检一批观测数据——均值、标准差、变异系数、极值、缺失率,判断数据是否可用、是否异常。
**所需数据**:性状 + 观测(即可运行)。
**操作**
1. 顶部工具条左侧勾选 1 个或多个性状;
2. 「描述统计」页签直接展示均值/标准差/变异系数/极值/缺失统计。
**结果解读**
- 变异系数(CV)过高 → 该性状田间差异大,检查是否有测定误差或环境不均;
- 缺失率过高 → 影响建模,考虑补测或剔除。
### 3.2 相关性矩阵
**目的**:性状间表型相关或**遗传相关**,辅助选育目标取舍(如两性状强正相关可只选其一)。
**所需数据**:性状 + 观测;`genetic` 模式另需系谱或足够数据支撑成对双性状 BLUP。
**操作**:「相关性」页签选性状 → 模式 `pheno`(皮尔逊表型相关)或 `genetic`(遗传相关)→ 查看矩阵。
### 3.3 ABLUP / EBV 育种值估计(核心)
**目的**:从表型观测中剔除非遗传因素(环境、区组、协变量等),估计每株树的**育种值 EBV** 与**遗传力 h²**,这是单株/无性系入选和排名的依据。
**所需数据**
- 硬性:性状 + 观测 + 树;
- 增强:系谱(A 矩阵,缺则按单株独立建模降级)、克隆、研究点(G×E)、砧木(G×R)。
**操作**
1. 顶部「**运行 ABLUP / EBV**」→ 对话框:
- 性状(自动带出 trait_id)、年份(可空,空=全部年份);
- 固定效应:trial_study(多环境)/ rootstock
- 协变量:crop_load(负载量)等,用于 BLUP 校正;
- **阶段拆分**juvenile(童期)/ evaluation(成株),给定则只取该阶段观测建模;
- **数据就绪门禁**:勾选;
2. 提交 → 异步任务,到「模型批次」看状态;
3. 完成后「EBV 排行」页签选批次 → 逐树 EBV 表;「无性系排行」页签 → 无性系级均值。
**结果解读**
- **h²(遗传力)**0.1~0.3 低、0.3~0.5 中、0.5+ 高;越低越依赖加大观测量与系谱信息;
- **EBV**:相对值,正负无绝对意义,**只在同批次内比大小**;
- **可靠性(Reliability)**:越高越可信,入选决策时建议设门槛(如 ≥0.5)。
### 3.4 多环境 G×E / G×R / 空间 / 区组模型(MET 扩展)
**目的**:当同一批材料跨研究点/年份观测时,评估**基因型×环境互作**,识别"平均好但某地不稳"的材料;或加入空间(AR1×AR1)、砧木互作、区组效应提高精度。
**所需数据**
- G×E:研究点(site)或年份(year)维度;
- G×R:砧木信息;
- 空间:观测株均需 `row_no` / `col_no`
- 区组:树表 `block_no`(≥2 区组)。
**操作**:「多环境 GxE」页签 → 性状/年份/固定效应 → 勾选 G×E(选环境维度)或 G×R 或 AR1×AR1 空间或区组随机效应(**四者互斥**)→ 运行,结果写「模型批次」。
**结果解读**:互作显著时,注意看 G×E 模式(配合「公平性报告」按 site 看 EBV 偏差)。
### 3.5 配合力 GCA / SCA
**目的**:对交配组合亲本评估**一般配合力 GCA**(亲本平均表现)与**特殊配合力 SCA**(特定组合偏离亲本平均的部分),指导亲本选配与杂交组合决策。
**所需数据**:性状 + 观测 + 杂交组合(亲本可识别)+ **交配设计信息**(在参数里声明)。
**操作**
1. 顶部「**运行配合力 GCA/SCA**」→ 对话框选**交配设计**:完全双列(full_diallel/ 部分双列(partial_diallel/ line×tester NCII / NCIII 测交;
2. 提交 → 异步;「配合力」页签查看:GCA 亲本表 + SCA 组合表 + ANOVA 摘要。
**结果解读**
- GCA 高的亲本 → 可作核心亲本推广;
- SCA 高而 GCA 一般的组合 → 特定互补,可重点观察;
- 结合 ANOVA 摘要看各效应显著性。
### 3.6 ANOVA / 广义遗传力 H²
**目的**:方差分解,检验性状在遗传型/区组间是否显著差异,估计**广义遗传力 H²**。
**所需数据**:性状 + 观测 + 试验设计(建议先做试验设计生成)。
**操作**
1. 「ANOVA/H²」页签:选研究点 + 设计类型 → **生成试验设计**(RCBD 随机完全区组 / 增广 augmented / α-格子,见 3.7);
2. 再选性状、年份;若 RCBD 可勾「区组校正」(从残差析出区组效应);
3. 「**运行 ANOVA / H²**」(同步)→ 结果含 H²、F、p、σ²g、σ²e、家系均值。
**结果解读**:p<0.05 说明遗传型间差异显著;H² 高说明表型差异主要来自遗传。
### 3.7 试验设计生成
**目的**:为研究点内参试条目生成**区组随机分派**,保证田间布局可分析。
**操作**:「ANOVA/H²」页签 → 研究点 + 设计类型 → 生成:
- **RCBD**:随机完全区组;
- **增广 augmented**:对照种质每区组重复、新品系不重复(需勾选对照种质列表);
- **α-格子**:区组大小 k、重复数 r(block_no 复合编码 重复×100+区组)。
**结果**:落库 `entry.block_no`,作为后续 ANOVA/区组模型的数据基础。
### 3.8 遗传相关(MT-BLUP 成对双性状)
**目的**:估计两两性状间的**遗传相关 r_g**(剔除环境协方差后的遗传层面相关),用于指数构建、间接选择、童期-成株相关评估。
**所需数据**:≥2 个核心性状 + 观测。
**操作**:「遗传相关 MT-BLUP」页签 → 选 ≥2 性状 → 运行(异步)→ r_g 矩阵表(含每对的遗传方差、环境方差、共同个体数、收敛标记)。
**结果解读**
- |r_g| 接近 1 的性状 → 遗传上高度关联,可合并或作间接选择;
- `converged=false` 或样本不足的对 → 谨慎采信。
### 3.9 Type-B 多环境遗传相关
**目的**:把**环境当"性状"**,估计同一性状在不同环境/阶段间的遗传相关 r_B:
- `site`:跨研究点一致性(越接近 1 说明基因型×环境互作越弱,越可多点合并分析);
- `year`:跨年份稳定性;
- `stage`:**童期-成株遗传相关**(幼年选择是否有效)。
**操作**:「Type-B 多环境遗传相关」页签 → 性状 + 环境维度 site/year/stage + 方法(REML / calo)→ 运行 → r_B 热图(ECharts)。
### 3.10 选择指数
**目的**:把**多性状 EBV 综合成一个指数**,按综合值排名选优(比单一性状更符合育种目标)。
**所需数据**:参与指数的性状 + 观测(或指定 ABLUP 批次用 EBV);遗传相关模式需 `g_method` 来源。
**操作**:「选择指数」页签 → 方法(见下)→ 性状权重/经济权重 → 聚合层级(clone/tree)→ TopN → 计算(同步)→ 结果列表;可「**写入决选**」(前 N 名写入决选结果 `bre_selection_result`,可靠性低于门槛自动跳过)。
**方法**
- `zsum`:加权标准分(Z 值加权求和),快速直观;
- `smith_hazel`**真 Smith-Hazel 指数**,按遗传-表型协方差结构最优组合权重;
- `restricted`:**受限指数**,指定性状遗传增益约束为 0(其余性状自由响应),如"果重不降低的前提下提高糖度";
- `auto_weights`:按实测遗传力自动生成权重。
**结果解读**:看综合指数排名 + 各性状对指数的贡献;入选前结合 EBV 可靠性门槛。
### 3.11 交叉验证(k-fold
**目的**:评估**预测准确度**——用部分个体建模、预测其余个体,看 EBV 与实测的相关(cv_accuracy/pearson)与误差(RMSE),防止模型过拟合。
**所需数据**:性状 + 观测;GS 模式还需基因型数据集。
**操作**:「交叉验证」页签 → 性状 → 模式:
- **ABLUP**:表型模型 k-foldk=2~10,掩蔽留出);
- **GS**:选基因型数据集 + 方法(GBLUP/ssGBLUP/rrBLUP/BayesB+ MAF + 折划分(random 固定种子随机分层 / family 家系阻塞折,**防亲缘泄漏**)+ seed(固定可复现)。
运行(异步)→ 列表 + 折明细(每折 n_train/n_test、pearson、RMSE)。
**结果解读**
- `cv_accuracy` / 平均 pearson 越高越好(0.5+ 实用、0.7+ 良好);
- family 折比 random 折通常低一些属正常(随机折可能泄漏同亲缘个体)。
### 3.12 稳定性 AMMI / Finlay-Wilkinson
**目的**:评估材料跨环境的**稳定性**——高产且稳定 vs 高产但波动大,指导区域推广。
**所需数据**:性状 + 观测 + 环境维度(site/year)两因素均值表。
**操作**:「稳定性 AMMI/FW」页签 → 性状 + 环境维度(site/year+ 方法(AMMI 和/或 Finlay-Wilkinson)→ 运行(异步)→:
- **AMMI**ASV 稳定性值、ecovalence(互作方差)、IPC1/IPC2、ASV 排名;
- **FW**:回归斜率 b、决定系数 r²(b≈1 且 r² 高 → 平均稳定型)。
**结果解读**ASV/ecovalence 越小越稳定;FW 的 b 偏离 1 越多 → 对环境越敏感(b>1 在高产环境优势明显,b<1 在低产环境抗逆)。
### 3.13 UPGMA 聚类
**目的**:按多性状相似度把单株/无性系分层聚类(树状图),看群体结构、划分类群。
**操作**:「UPGMA 聚类」页签 → ≥2 性状 → 实体类型(tree/clone)→ 模式(pheno 表型 / genetic EBV)→ 距离(corr/euclidean)→ k 类数(空=按合并距离跳变自动选)→ 树状图。
### 3.14 数据质量检查
**目的**:定位**离群观测株**(缺失率 + IQR 超界 + MAD 稳健 z 双通道),按方向区分——**同向偏离 = 可能的精英**,**反向偏离 = 疑似记录错误**。
**操作**:「数据质量」页签 → 性状(+年份/研究点)→ 运行 → 离群株列表与标记。
**建议**:正式建模前先跑此分析,把"疑似错误"方向的数据核实后再建模。
### 3.15 遗传增益 ΔG
**目的**:估算**选择后遗传增益**——ΔG = k·r_g·σ_A(截断选择强度 × 预测准确性 × 遗传标准差),用于设定选择强度与周期预期。
**操作**:「遗传增益 ΔG」页签 → 性状 → 指定 ABLUP 批次(取 PA 与 σ_A)→ 入选比例 top_p 或人数 top_n → 世代间隔 → 逐批次投影。
**注意**:ΔG 是**期望值/投影**,前提是模型正确、无近交负效应累积。
### 3.16 亲缘 / 近交分析
**目的**:系谱 A 矩阵估计**近交系数 F**、个体间**亲缘关系**,预警近交风险;**近交衰退**端点把 F 对表型做回归,量化近交代价。
**操作**:「亲缘·近交」页签 → 阈值 → 运行 → 近交预警 / F 系数 / A 矩阵;「近交衰退」另端点输入性状运行。
### 3.17 主动选配推荐 / OCS
**目的**:在满足**S-等位不相容硬过滤**的前提下,按 **EBV 互补 − 近交惩罚**推荐亲本配对(含花期软警示:重叠/错开/库存/未知),避免近交、保证可配;**OCS** 做群体级配种贡献优化(max Σc·ebv − λ·c'Ac)。
**操作**:「选配推荐」页签 → 候选种质 → 预测批次(EBV)→ 亲缘阈值/权重/最大配对数 → 推荐表;OCS 在「OCS」分块输入候选 + 选配数 n_select + 惩罚 λ。
### 3.18 决选预览
**目的**:把**选择规则**应用到表型/EBV 上,逐树预览命中/淘汰,EBV 可靠性低于门槛视为"证据不足"。
**操作**:「决选预览」页签 → 选择规则(可空)→ 预测批次/年份 → 预览逐树结果。
### 3.19 模型健康监控 / MLOps
**目的**:相邻两轮 ABLUP 对比,监控 **h² 跌幅 / EBV 排名翻转 / 可靠性变化**——数据或流程若有异常会在此暴露。
**操作**:「模型健康」页签选批次(可指定上一批对比)→ 漂移检测 / 手动重训 / 版本回滚 / 设当前版本。
### 3.20 组合得失漏斗
**目的**:花 → 果 → 种 → 苗 → 定植 → 树 → 入选的**逐环节数量漏斗**,看哪个环节损耗最大、投入产出比。
**操作**:顶部「组合得失漏斗」→ 只读视图。
---
## 四、分子类分析(第二批,本手册从略)
- **基因组选择**:「基因组选择 GBLUP」页签内直接运行 GBLUP / ssGBLUP / rrBLUP / BayesB(需基因型数据集 + 基因型调用记录);也可在交叉验证选 GS 模式评估其预测准确度。
- **GWAS / QTL / MAS / QTL×E**:独立「GWAS」页面(曼哈顿图/QQ 图、QTL 定位、MAS 面板、QTL×E 分层),MAS 面板可在本页「回交 MABC」里做前景/背景选择。
分子分析各功能的目的、数据准备、操作与解读,将在后续专门文档补全。
---
## 五、常见问题 FAQ
**Q1:提交后一直 pending / FAILED**
→ 「模型批次」页签任务状态看 `error_msg`。最常见:数据就绪门禁不通过(样本量不足/系谱缺失率高)、该性状无观测、分子分析未建基因型数据集。
**Q2:为什么有些分析(G×E、亲缘、近交)提示不可用?**
→ 缺增强数据(研究点/系谱/砧木)。补录后即可用;不影响其他表型分析。
**Q3:EBV 为什么有时是负的?**
→ EBV 是**相对值**(群体均值为参考),正负无绝对好坏,只看同批次内排名。
**Q4:选择指数写入决选时个别树被跳过?**
→ EBV 可靠性低于设定的 `min_reliability` 门槛,系统视为证据不足自动跳过。
**Q5:刷新后批次/结果还在吗?**
→ 在。异步结果落库(预测批次、配合力、CV、稳定性、遗传相关、Type-B、GWAS 等),重启系统不丢,任务存储也已持久化到数据库。
**Q6:列显示设置保存了但刷新失效?**
→ 已修复(2026-08-07`useTableColumns` 深度监听)。若仍异常请反馈:哪个列表页 + 浏览器控制台报错。