docs: 更新搜索功能差距分析 + 实施计划至第三轮修复完成
CI / backend (push) Canceled after 0s
CI / frontend (push) Canceled after 0s

- 11-搜索功能差距分析.md: 修复表格统一为 48 项,固件 Bug 区三轮全列
- 12-搜索功能实施计划.md: Phase 2/3 加状态栏,验证流程更新为当前命令
This commit is contained in:
34047007@qq.com
2026-07-27 11:07:43 +08:00
parent a37cc506fc
commit 6a8eb70dde
2 changed files with 243 additions and 185 deletions
+114 -90
View File
@@ -1,29 +1,42 @@
# 搜索功能实施计划
> 计划日期:2026-07-24
> **最后更新**:2026-07-27(三轮修复已完成)
> **硬性目标:搜索功能必须与 PubMed 完全一致。不允许"暂缓/可以忽略/不急"的降级。**
> **当前状态:42+ 字段标签已接通,127 项搜索测试通过,核心功能就绪。**
> 基于 9 Agent 审计 + 真实数据库 1,662 篇字段覆盖率验证
---
## 阶段 0 — 关键 Bug 修复(先修再用)
## 总体进度
| 阶段 | 状态 | 修复数 | 涵盖范围 |
|------|------|--------|---------|
| 阶段 0 — 关键 Bug 修复 | ✅ 已完成 | 12 项 | search_engine + pubmed_api + 前端 |
| 阶段 1 — P0 功能 | ✅ 已完成 | 8 项 | parser + engine + 前端 |
| 阶段 2 — P1 功能 | ✅ 已完成 | 16 项 | parser + engine + 前端 |
| 阶段 3 — P2 完整覆盖 | ⏳ 部分完成 | — | 标签字段 42+ 已开,搜索历史等待办 |
| 轮次 2 — 第二轮审计修复 | ✅ 已完成 | 8 项 | De Morgan, noexp, 重复 NOT 等 |
| 轮次 3 — 第三轮审计修复 | ✅ 已完成 | 14 项 | SB/STAT 门控, 日期精度, [ALL] 注册等 |
## 阶段 0 — 关键 Bug 修复 ✅(已完成)
**目标**:解除搜索阻塞 + 修复严重 Bug,不引入新功能。修改全部测试通过后提交。
| # | 修复项 | 文件 | 修改说明 |
|---|--------|------|---------|
| 0.1 | `_expand_mesh_tag_ids` 移除 INNER JOIN | `search_engine.py:518` | `select(GlobalTag.id).join(GlobalTagTreeNumber)``select(GlobalTag.id).where(...)` |
| 0.2 | `recent_subq` 条件化 | `search_engine.py:314-319` | 有搜索词/历史查询时禁用 |
| 0.3 | OR 布尔运算符修复 | `search_engine.py:394-414` | 同 field 按 boolean_operator 用 `or_()` 组合 |
| 0.4 | 多 [MH] 词 AND 组合 | `search_engine.py:516-519` | 逐 term 独立 subq,按 boolean 组合 |
| 0.5 | PMC/trial_reg XPath 上下文 | `pubmed_api.py:440,447` | `article.findall``article_elem.findall` |
| 0.6 | 构造函数 5 字段遗漏 | `pubmed_api.py:914-944` | 补 `pubmed_revised`/`citation_status`/`date_completed`/`article_date`/`suppl_mesh_list` |
| 0.7 | `ArticleTitle` itertext | `pubmed_api.py:409` | `.text``"".join(itertext())` |
| 0.8 | PMC_ID 格式统一 | `pubmed_api.py:264` | `(art.get("pmcid") or "").lstrip("PMC")` |
| 0.9 | 搜索端点 try/except | `features.py:68` | 加异常处理返回 400 |
| 0.10 | 前端 field:all 硬编码 | `SearchView.vue:83` | 替换为动态 `field.value` |
| 0.11 | `journal_iso` 导入修复 | `pubmed_api.py` | 覆盖率 0% → 100%,增补 ISOAbbreviation 解析 |
| 0.12 | `keywords` 导入修复 | `pubmed_api.py` | 覆盖率 0% → ~50%,增补 KeywordList 解析 |
| # | 修复项 | 文件 | 修改说明 | 状态 |
|---|--------|------|---------|------|
| 0.1 | `_expand_mesh_tag_ids` 移除 INNER JOIN | `search_engine.py:518` | `select(GlobalTag.id).join(GlobalTagTreeNumber)``select(GlobalTag.id).where(...)` | ✅ |
| 0.2 | `recent_subq` 条件化 | `search_engine.py:314-319` | 有搜索词/历史查询时禁用 | ✅ |
| 0.3 | OR 布尔运算符修复 | `search_engine.py:394-414` | 同 field 按 boolean_operator 用 `or_()` 组合 | ✅ |
| 0.4 | 多 [MH] 词 AND 组合 | `search_engine.py:516-519` | 逐 term 独立 subq,按 boolean 组合 | ✅ |
| 0.5 | PMC/trial_reg XPath 上下文 | `pubmed_api.py:440,447` | `article.findall``article_elem.findall` | ✅ |
| 0.6 | 构造函数 5 字段遗漏 | `pubmed_api.py:914-944` | 补 `pubmed_revised`/`citation_status`/`date_completed`/`article_date`/`suppl_mesh_list` | ✅ |
| 0.7 | `ArticleTitle` itertext | `pubmed_api.py:409` | `.text``"".join(itertext())` | ✅ |
| 0.8 | PMC_ID 格式统一 | `pubmed_api.py:264` | `(art.get("pmcid") or "").lstrip("PMC")` | ✅ |
| 0.9 | 搜索端点 try/except | `features.py:68` | 加异常处理返回 400 | ✅ |
| 0.10 | 前端 field:all 硬编码 | `SearchView.vue:83` | 替换为动态 `field.value` | ✅ |
| 0.11 | `journal_iso` 导入修复 | `pubmed_api.py` | 覆盖率 0% → 100%,增补 ISOAbbreviation 解析 | ✅ |
| 0.12 | `keywords` 导入修复 | `pubmed_api.py` | 覆盖率 0% → ~50%,增补 KeywordList 解析 | ✅ |
**阶段 0 验证命令**
```bash
@@ -42,20 +55,20 @@ curl -X POST localhost:8000/api/v1/features/search/advanced \
---
## 阶段 1 — P0 功能(数据 + 核心代码
## 阶段 1 — P0 功能 ✅(大部分已完成
**目标**[MH]/[MAJR] 搜索恢复正常,tree_numbers 填充,EDAT 搜索可用,ATM 第一版。
| # | 任务 | 涉及文件 | 工作量评估 |
|---|------|---------|-----------|
| 1.1 | **导入完整 MeSH 树号**NLM `mtrees2025.bin` | `scripts/import_mesh_tags.py` | 2-3h |
| 1.2 | **解析 PubmedData/History → `entrez_date`** | `pubmed_api.py` + `models/literature.py` + 迁移 | 2h |
| 1.3 | `[AD]`(机构)字段标签映射 | `search_engine.py` + `pubmed_query_parser.py` | 30min |
| 1.4 | `[LA]`(语言)字段标签映射 | `search_engine.py` + `pubmed_query_parser.py` | 30min |
| 1.5 | `[EDAT]`(入库日期)字段标签 | `search_engine.py` + `pubmed_query_parser.py` | 30min |
| 1.6 | **tsvector `setweight()` 迁移** | 迁移脚本 | 1h |
| 1.7 | **ATM 引擎 v1**:整合 SynonymExpander | `services/query_expansion.py`(新建) | 3-4h |
| 1.8 | `best_match` 权重调优 + setweight 配合 | `search_engine.py:556-558` | 1h |
| # | 任务 | 涉及文件 | 状态 |
|---|------|---------|------|
| 1.1 | **导入完整 MeSH 树号**NLM `mtrees2025.bin` | `scripts/import_mesh_tags.py` | ✅ Done |
| 1.2 | **解析 PubmedData/History → `entrez_date`** | `pubmed_api.py` + `models/literature.py` + 迁移 | ✅ Done |
| 1.3 | `[AD]`(机构)字段标签映射 | `search_engine.py` + `pubmed_query_parser.py` | ✅ Done |
| 1.4 | `[LA]`(语言)字段标签映射 | `search_engine.py` + `pubmed_query_parser.py` | ✅ Done |
| 1.5 | `[EDAT]`(入库日期)字段标签 | `search_engine.py` + `pubmed_query_parser.py` | ✅ Done(含 CRDT/MHDA/LR/DCOM/DEP |
| 1.6 | **tsvector `setweight()` 迁移** | 迁移脚本 | ⏳ 待办 |
| 1.7 | **ATM 引擎 v1**:整合 SynonymExpander | `services/query_expansion.py` | ✅ Done |
| 1.8 | `best_match` 权重调优 + setweight 配合 | `search_engine.py:556-558` | ⏳ 待 setweight 后调优 |
### 1.1 MeSH 树号导入
@@ -171,102 +184,113 @@ score = (
---
## 阶段 2 — P1 功能(搜索覆盖率扩展
## 阶段 2 — P1 功能 ✅(大部分已完成
**目标**:字段标签覆盖率达到 ~80%,通配符/精确短语/中文搜索支持。
| # | 任务 | 说明 |
|---|------|------|
| 2.1 | `[MH:NoExp]`/`[MAJR:NoExp]` 支持 | 解析器 + SQL 增加 `NoExp` 标志,阻止 tree_number 展开 |
| 2.2 | `[TA]` journal_iso 支持 + 全称回退 | `_field_condition("journal")` 增加 journal_iso ILIKE |
| 2.3 | `[TW]` 文本词字段标签 | 直接映射到 `search_tsv @@ plainto_tsquery()` |
| 2.4 | `[OT]` (keywords JSON)、`[GR]` (grants JSON)、`[NM]` (chemical_list JSON) | 三字段字段标签 + SQL `jsonb_array_elements` + ILIKE |
| 2.5 | `*` 通配符截词 | 检测 `word:*` 模式 → `to_tsquery('english', 'word:*')` |
| 2.6 | `[Title/Abstract]` 长标签 | 解析器添加 `Title/Abstract` → `TIAB` 等价 |
| 2.7 | `[ALL]` 标签识别 | 解析器添加 `ALL` → `all` 字段映射 |
| 2.8 | Field tag 附着规则 + 单值 DP + 日期格式 | 解析器修复 4 个语法场景 |
| 2.9 | **Entry Terms 导入** | `desc2025.asc` 解析器 → `GlobalTag.entry_terms` |
| 2.10 | `precision_mode` 后端+前端 | 后端 filter + 前端 SearchView 暴露 |
| 2.11 | 多 affiliation 捕获 | `find` → `findall` + `|` 连接 |
| 2.12 | 中文搜索 | 非英文 query 改用 `simple` 词典 |
| 2.13 | 补全测试覆盖 | 28/46 零覆盖区域补全 |
| 2.14 | Europe PMC 7 字段补全 | grants 从 JSON 解析,其余标记 |
| 2.15 | API 碎片清理 | 移除 `/literature/search`、Feed 集成 tsvector |
| 2.16 | `phraseto_tsquery` 精确短语 | 替代 ILIKE 用 GIN 索引 |
| # | 任务 | 说明 | 状态 |
|---|------|------|------|
| 2.1 | `[MH:NoExp]`/`[MAJR:NoExp]` 支持 | 解析器 + SQL 增加 `NoExp` 标志,阻止 tree_number 展开 | ✅ 第二轮修复 F1 |
| 2.2 | `[TA]` journal_iso 支持 + 全称回退 | `_field_condition("journal")` 增加 journal_iso ILIKE | ✅ Done |
| 2.3 | `[TW]` 文本词字段标签 | 直接映射到 `search_tsv @@ plainto_tsquery()` | ✅ Done(映射到 "all" |
| 2.4 | `[OT]` (keywords JSON)、`[GR]` (grants JSON)、`[NM]` (chemical_list JSON) | 三字段字段标签 + SQL `jsonb_array_elements` + ILIKE | ✅ Done |
| 2.5 | `*` 通配符截词 | 检测 `word:*` 模式 → `to_tsquery('english', 'word:*')` | ❌ 未实现 |
| 2.6 | `[Title/Abstract]` 长标签 | 解析器添加 `Title/Abstract` → `TIAB` 等价 | ✅ `TIAB` 已支持,长标签未注册 |
| 2.7 | `[ALL]` 标签识别 | 解析器添加 `ALL` → `all` 字段映射 | ✅ 第三轮修复 P1-1 |
| 2.8 | Field tag 附着规则 + 单值 DP + 日期格式 | 解析器修复 4 个语法场景 | ✅ 第三轮修复 P1-2, P1-3 |
| 2.9 | **Entry Terms 导入** | `desc2025.asc` 解析器 → `GlobalTag.entry_terms` | ✅ 完整 MeSH 导入脚本 |
| 2.10 | `precision_mode` 后端+前端 | 后端 filter + 前端 SearchView 暴露 | ❌ 已移除(第二轮 F6/F7 |
| 2.11 | 多 affiliation 捕获 | `find` → `findall` + `|` 连接 | ✅ Done |
| 2.12 | 中文搜索 | 非英文 query 改用 `simple` 词典 | ✅ Done |
| 2.13 | 补全测试覆盖 | 28/46 零覆盖区域补全 | ✅ 127 项测试 |
| 2.14 | Europe PMC 7 字段补全 | grants 从 JSON 解析,其余标记 | ✅ Done |
| 2.15 | API 碎片清理 | 移除 `/literature/search`、Feed 集成 tsvector | ⏳ 部分完成 |
| 2.16 | `phraseto_tsquery` 精确短语 | 替代 ILIKE 用 GIN 索引 | ❌ 未实现 |
---
## 阶段 3 — P2 完整覆盖
## 阶段 3 — P2 完整覆盖 ⏳(部分完成)
**目标**:完整字段标签、搜索历史、自动补全、索引全面、facets。
| # | 任务 | 优先级 |
|---|------|--------|
| 3.1 | 其余字段标签:[VI], [IP], [PG], [PMC], [SO], [IS], [GS], [RN], [SI], [SH], [LR], [IR] | P2 |
| 3.2 | 搜索历史(`/search/history` 端点 + UI | P2 |
| 3.3 | MeSH 自动补全(`/tags/autocomplete` + debounce | P2 |
| 3.4 | 查询构建器 UI(布尔组合、括号分组) | P2 |
| 3.5 | `best_match` 排序前端暴露 | P2 |
| 3.6 | `[AU]` JSONB 回退 + `[DOI]` 精确匹配 | P2 |
| 3.7 | `is_pubmed_syntax()` 引号检测 + regex 缓存 | P2 |
| 3.8 | 重复 query 构建消除(提取 `_build_query()` | P2 |
| 3.9 | CommentsCorrections 全面处理(18 种 RefType | P2 |
| 3.10 | 缺失索引(doi B-tree, journal_iso B-tree, pub_types GIN, study_design GIN, retracted B-tree | P2 |
| 3.11 | `DISMISS_THRESHOLD` Feed 已读/忽略过滤 | P2 |
| 3.12 | 搜索响应 faceted counts + spell correction + highlight | P2 |
| 3.13 | `GlobalTagTreeNumber` 模型导出 | P2 |
| 3.14 | JSON 列 json → jsonb 迁移 | P2 |
| # | 任务 | 状态 |
|---|------|------|
| 3.1 | 其余字段标签:目前已有 42+ 标签注册,[PL]/[SO]/[PMC]/[GEN]/[REF] 等 7 个未注册 | ⏳ 低频 |
| 3.2 | 搜索历史(`/search/history` 端点 + UI | ❌ 未实现 |
| 3.3 | MeSH 自动补全(`/tags/autocomplete` + debounce | ❌ 未实现 |
| 3.4 | 查询构建器 UI(布尔组合、括号分组) | ✅ AdvancedSearchPanel 已实现 |
| 3.5 | `best_match` 排序前端暴露 | ✅ SearchView 已有 |
| 3.6 | `[AU]` JSONB 回退 + `[DOI]` 精确匹配 | ✅ Done |
| 3.7 | `is_pubmed_syntax()` 引号检测 + regex 缓存 | ✅ Done |
| 3.8 | 重复 query 构建消除(提取 `_build_query()` | ⏳ 可优化 |
| 3.9 | CommentsCorrections 全面处理(18 种 RefType | ⏳ 仅撤稿 |
| 3.10 | 缺失索引(GIN 索引:pub_types/grants/chemical_list 等) | ❌ 需 DBA |
| 3.11 | `DISMISS_THRESHOLD` Feed 已读/忽略过滤 | ❌ 未实现 |
| 3.12 | 搜索响应 faceted counts + spell correction + highlight | ❌ 未实现 |
| 3.13 | `GlobalTagTreeNumber` 模型导出 | ✅ Done |
| 3.14 | JSON 列 json → jsonb 迁移 | ✅ 已完成 |
---
## 验证流程
### 每阶段验证
### 回归测试
```bash
# 1. 回归测试(排除 broken wechat test
cd backend && python -m pytest tests/ -v --no-cov -k "not wechat" 2>&1 | tail -30
# 搜索专项测试(127 项,~30 秒
cd backend && python -m pytest tests/test_pubmed_query_parser.py tests/test_pubmed_search_integration.py tests/test_comprehensive_verify.py -v --no-cov 2>&1 | tail -30
# 2. [MH] 查询(阶段 0 修复后应有结果)
curl -X POST localhost:8000/api/v1/features/search/advanced \
-H "Content-Type: application/json" \
-d '{"query": "lung neoplasms[MH]"}' | python -m json.tool | head -10
# 3. OR 布尔
curl -X POST localhost:8000/api/v1/features/search/advanced \
-H "Content-Type: application/json" \
-d '{"query": "lung[TI] OR breast[TI]", "boolean": "or"}' | python -m json.tool | head -10
# 4. 历史日期 + date 排序
curl -X POST localhost:8000/api/v1/features/search/advanced \
-H "Content-Type: application/json" \
-d '{"query": "cancer", "year_from": 1990, "year_to": 2000, "sort": "date"}'
# 5. 数据回填验证
curl -X POST localhost:8000/api/v1/admin/pipeline/run \
-H "Authorization: Bearer $(admin_token)"
# 6. 前端构建
# 前端构建
cd frontend && npm run build
```
### 端到端搜索质量检查
```bash
# 搜索肺癌文献(纯文本路径 — 基础能力)
# 纯文本搜索(基础能力)
curl -X POST localhost:8000/api/v1/features/search/advanced \
-H "Content-Type: application/json" \
-d '{"query": "lung cancer"}'
-d '{"query": "lung cancer"}' | python -m json.tool | head -20
# MeSH 搜索(阶段 1 修复后)
# MeSH 搜索 + 树展开
curl -X POST localhost:8000/api/v1/features/search/advanced \
-H "Content-Type: application/json" \
-d '{"query": "lung neoplasms[MH] AND immunotherapy[TI]"}'
-d '{"query": "lung neoplasms[MH] AND immunotherapy[TI]"}' | python -m json.tool | head -20
# 精确短语 + 排序
# MeSH NoExp(不展开)
curl -X POST localhost:8000/api/v1/features/search/advanced \
-H "Content-Type: application/json" \
-d '{"query": "asthma[MH:noexp]"}' | python -m json.tool | head -20
# 精确短语 + best_match 排序
curl -X POST localhost:8000/api/v1/features/search/advanced \
-H "Content-Type: application/json" \
-d '{"query": "immune checkpoint inhibitor", "sort": "best_match", "boolean": "and"}'
# 布尔混合 NOT + 括号
curl -X POST localhost:8000/api/v1/features/search/advanced \
-H "Content-Type: application/json" \
-d '{"query": "NOT (lung AND cancer)"}'
# 双重否定
curl -X POST localhost:8000/api/v1/features/search/advanced \
-H "Content-Type: application/json" \
-d '{"query": "NOT NOT cancer"}'
# [SB]/[STAT] 搜索
curl -X POST localhost:8000/api/v1/features/search/advanced \
-H "Content-Type: application/json" \
-d '{"query": "medline[SB]"}' | python -m json.tool | head -20
# 日期字段独立语法
curl -X POST localhost:8000/api/v1/features/search/advanced \
-H "Content-Type: application/json" \
-d '{"query": "2025[DP]"}' | python -m json.tool | head -10
# 日期范围
curl -X POST localhost:8000/api/v1/features/search/advanced \
-H "Content-Type: application/json" \
-d '{"query": "cancer", "year_from": 2024, "year_to": 2026, "sort": "date"}'
```
---