Files
deep_research/scripts/lib/search_client.py
T
kai c444007f04 v0.8: Serper 集成 + H1 章节标题双行居中 + 反方证据观点化 + 术语核查命令
新增:Google 系检索(SerpAPI → Serper.dev)

- scripts/lib/serper_client.py:封装 serper.dev 的 Google Search / Scholar / News / Patents
- 专利检索用 site:patents.google.com 技巧,serper.dev 没专用 endpoint 但效果很好
- Scholar 带引用数、年份、期刊信息,便于权威信源识别
- News 支持 time_range(d/w/m/y)时效性过滤

- scripts/lib/search_client.py 扩展为多路由门面:
  - search() 通用:Exa → Tavily
  - patents() 专利:Serper(Google Patents)→ 通用搜索 + site: 兜底
  - scholar() 论文:Serper Scholar → 通用搜索兜底
  - news() 新闻:Serper News → 通用搜索兜底
- 所有 httpx 客户端 trust_env=False,绕过系统 socks5 代理(v0.6 修过的 TLS EOF)

- .opencode/skills/search-strategy/SKILL.md §三重写:按查询类型路由,明确何时用哪个 API

H1 章节标题:两行居中 + 装饰横线

- 新增 ParagraphStyle: h1-chapter-num / h1-chapter-title
- 新增 parse_chapter_title() 支持中文/阿拉伯/混合空格章号:
  "第一章" / "第 9 章" / "第6章" / "Chapter 1" 全覆盖
- 分隔符支持: em dash — / en dash – / - / : / :
- 新增 build_chapter_header():章号小字居中 + 章名大字深蓝居中 + HRFlowable 3cm 装饰线
- 只对正文章节(_title_kind == "chapter")启用;前置件(免责声明/执行摘要/术语表/目录)
  仍用单行 h1 样式

反方证据段规范化(用户反馈 v0.7 问题 #5)

- skill:evidence-table 新增 §"正文中反方证据段落的写作规范":
  - 禁止机械标题"反驳证据" / "Counter-Evidence" / "反方观点"
  - 必须观点化,包含具体判断(如"另一种声音:管线虚胖还是真实进展?")
  - 用 H2 或 H3,禁止加粗段冒充标题
  - 给出段落结构模板(1-2 句过渡 → 列表型反方论点 → 整合判断)
- dr-analyst.md Hard Rules #3 改为引用该规范

术语表事实核查前置(新 command /dr-glossary)

- 新增 .opencode/commands/dr-glossary.md,支持 --from phase1|phase2|phase4 三个时机
- Phase 1 末 / Phase 2 初:从 framework.md 抽取专有名词种子表,在 dr-analyst 起草前
  预先核查公司名/产品名/技术名拼写,避免编造错误(Mabwell → Maywavee 这类)
- Phase 4:维持当前用法,对 glossary.json 全量核查

实测:dual-target-rnai-pipeline-2026 重生 PDF 55 页,所有 10 章标题双行居中正确渲染
(第一章/第二章/... 第十章 / 第 6 章 / 第 9 章 多种形式都识别)。
2026-04-22 17:04:05 +08:00

263 lines
8.7 KiB
Python
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
"""通用搜索客户端(Exa 优先,Tavily fallback)。
为 build_glossary.py 这类术语核查场景服务。
关键设计:
- `trust_env=False` 绕开系统 socks 代理(Clash on macOS 配 socks5 时 httpx 会 TLS EOF
- Exa 优先:LinkedIn / 官网 / 百度百科返回质量最高
- 遇到配额问题自动降级到 Tavily 或返回 empty
- 不做深度 crawl,只要摘要
"""
from __future__ import annotations
import os
from dataclasses import dataclass
from typing import Any
import httpx
@dataclass
class SearchHit:
title: str
url: str
snippet: str
class SearchError(RuntimeError):
pass
class ExaClient:
def __init__(self, api_key: str | None = None, timeout: float = 30.0) -> None:
self.api_key = api_key or os.environ.get("EXA_API_KEY")
if not self.api_key:
raise SearchError("EXA_API_KEY not set")
# trust_env=False 关键:不吃系统代理,避免 TLS EOF
self._client = httpx.Client(trust_env=False, timeout=timeout)
def close(self) -> None:
self._client.close()
def __enter__(self) -> "ExaClient":
return self
def __exit__(self, *_args: Any) -> None:
self.close()
def search(self, query: str, *, num_results: int = 5) -> list[SearchHit]:
body = {
"query": query,
"numResults": num_results,
"type": "auto",
"contents": {"text": {"maxCharacters": 800}},
}
r = self._client.post(
"https://api.exa.ai/search",
json=body,
headers={"x-api-key": self.api_key, "Content-Type": "application/json"},
)
if r.status_code != 200:
raise SearchError(f"Exa HTTP {r.status_code}: {r.text[:200]}")
data = r.json()
out: list[SearchHit] = []
for item in data.get("results", [])[:num_results]:
out.append(
SearchHit(
title=(item.get("title") or "")[:200],
url=item.get("url") or "",
snippet=(item.get("text") or item.get("snippet") or "")[:600],
)
)
return out
class TavilyClient:
def __init__(self, api_key: str | None = None, timeout: float = 30.0) -> None:
self.api_key = api_key or os.environ.get("TAVILY_API_KEY")
if not self.api_key:
raise SearchError("TAVILY_API_KEY not set")
self._client = httpx.Client(trust_env=False, timeout=timeout)
def close(self) -> None:
self._client.close()
def __enter__(self) -> "TavilyClient":
return self
def __exit__(self, *_args: Any) -> None:
self.close()
def search(self, query: str, *, num_results: int = 5) -> list[SearchHit]:
body = {
"api_key": self.api_key,
"query": query,
"search_depth": "basic",
"max_results": num_results,
"include_answer": False,
"include_raw_content": False,
}
r = self._client.post("https://api.tavily.com/search", json=body)
if r.status_code != 200:
raise SearchError(f"Tavily HTTP {r.status_code}: {r.text[:200]}")
data = r.json()
out: list[SearchHit] = []
for item in data.get("results", [])[:num_results]:
out.append(
SearchHit(
title=(item.get("title") or "")[:200],
url=item.get("url") or "",
snippet=(item.get("content") or "")[:600],
)
)
return out
class SearchClient:
"""统一搜索门面,支持多路由:
- `search(query)`:通用网页搜索,优先 Exa → 降级 Tavily
- `patents(query)`:专利检索,走 SerperGoogle Patents);失败则通用搜索补刀
- `scholar(query)`:学术论文,走 Serper Scholar;失败则通用搜索补刀
- `news(query)`:新闻检索,走 Serper News;失败则通用搜索补刀
所有客户端都延迟导入 serper_client,避免没装 SERPAPI_KEY 时 import 炸。
"""
def __init__(self) -> None:
self._exa: ExaClient | None = None
self._tavily: TavilyClient | None = None
self._serper = None # 惰性实例化
try:
self._exa = ExaClient()
except SearchError:
pass
try:
self._tavily = TavilyClient()
except SearchError:
pass
if not (self._exa or self._tavily):
raise SearchError(
"neither EXA_API_KEY nor TAVILY_API_KEY available"
)
def _get_serper(self):
"""惰性创建 SerperClient。没 key 时返回 None。"""
if self._serper is False:
return None
if self._serper is None:
try:
from scripts.lib.serper_client import SerperClient
self._serper = SerperClient()
except Exception:
self._serper = False
return None
return self._serper
def close(self) -> None:
if self._exa:
self._exa.close()
if self._tavily:
self._tavily.close()
if self._serper and self._serper is not False:
self._serper.close()
def __enter__(self) -> "SearchClient":
return self
def __exit__(self, *_args: Any) -> None:
self.close()
def search(self, query: str, *, num_results: int = 5) -> list[SearchHit]:
"""通用网页搜索。Exa 首选,Tavily 备选。"""
if self._exa:
try:
return self._exa.search(query, num_results=num_results)
except SearchError:
pass
if self._tavily:
try:
return self._tavily.search(query, num_results=num_results)
except SearchError:
pass
return []
def patents(self, query: str, *, num_results: int = 10) -> list[SearchHit]:
"""专利检索:Serper 走 Google Patents 最准。降级到通用搜索 + site 限定。"""
serper = self._get_serper()
if serper:
try:
hits = serper.patents(query, num_results=num_results)
return [SearchHit(h.title, h.url, h.snippet) for h in hits]
except Exception:
pass
# 降级:通用搜索加 site 限定
return self.search(f"site:patents.google.com {query}", num_results=num_results)
def scholar(
self,
query: str,
*,
num_results: int = 10,
year_low: int | None = None,
) -> list[SearchHit]:
"""学术论文:Serper Scholar 带引用数。降级到通用搜索。"""
serper = self._get_serper()
if serper:
try:
hits = serper.scholar(query, num_results=num_results, year_low=year_low)
return [
SearchHit(
title=h.title,
url=h.url,
snippet=f"{h.snippet} | {h.source} | 引用 {h.cited_by}" if h.cited_by else h.snippet,
)
for h in hits
]
except Exception:
pass
return self.search(query, num_results=num_results)
def news(
self,
query: str,
*,
num_results: int = 10,
time_range: str | None = None,
) -> list[SearchHit]:
"""新闻检索:Serper News。降级到通用搜索。"""
serper = self._get_serper()
if serper:
try:
hits = serper.news(query, num_results=num_results, time_range=time_range)
return [
SearchHit(
title=h.title,
url=h.url,
snippet=f"{h.snippet} | {h.source} | {h.date}" if h.date else h.snippet,
)
for h in hits
]
except Exception:
pass
return self.search(query, num_results=num_results)
if __name__ == "__main__":
from scripts.lib.zenmux_client import load_secrets
load_secrets()
with SearchClient() as c:
print("--- 通用: Mabwell 迈威生物 ---")
for h in c.search("Mabwell 迈威生物 biopharmaceutical", num_results=3):
print(f" {h.title[:80]}")
print(f" {h.url}")
print("\n--- 专利: dual-target siRNA ---")
for h in c.patents("dual-target siRNA GalNAc", num_results=3):
print(f" {h.title[:80]}")
print(f" {h.url}")
print("\n--- Scholar: dual-target RNAi 2024 ---")
for h in c.scholar("dual-target RNAi drug", num_results=3, year_low=2023):
print(f" {h.title[:80]}")
print(f" {h.url}")