feature-separate-batch-eval-mcp
# feature-separate-batch-eval-mcp
独立读取 `feature-separate-eval-mcp` 已落盘的单篇专利评测,发现单篇报告无法建立的跨专利问题。它不会修改现有 MCP、ledger 或单篇评测 JSON。
## 判定边界
- 只分析 `input_kind=patent` 且包含完整专利号、claims、Judge 规则版本和 `claim_text_source=patsnap-clms-original` 的记录。旧版强制 `lang=cn` 生成的评测不参与聚合,避免把外国专利译文误当中文原文。
- 同一 cohort、同一专利只计一次,默认保留最新有效评测。
- 每个候选问题至少需要 10 篇支持专利和 10 篇对照专利。
- 只发现语言差异、技术领域差异、输入结构敏感性和语言×结构交互。
- “已有单篇错误出现很多次”不算新问题;候选必须增加跨样本条件、对照或交互关系。
- 不生成 Prompt 修改、后处理或其他修复建议。
## 安装
需要 Python 3.10+:
```bash
python3.10 -m venv .venv
.venv/bin/pip install -e ".[test]"
cp .env.example .env
```
让 `CC_EVAL_DATA_DIR` 指向单篇评测使用的同一目录。批量产物默认写入其 `batch_analysis/` 子目录,也可用 `FEATURE_SEPARATE_BATCH_DATA_DIR` 指定独立路径。
连接 Claude Code:
```bash
claude mcp add --scope local --transport stdio feature-separate-batch-eval -- \
/absolute/path/.feature-separate-batch-eval-mcp/.venv/bin/feature-separate-batch-eval-mcp
```
## Tools
- `feature_separate_batch_eval_status`:扫描专利评测与 cohort,零网络调用。
- `feature_separate_batch_eval_tag`:写独立 sidecar,为记录登记 cohort、服务版本和实验标签,零网络调用。
- `feature_separate_batch_eval_check`:检查样本门槛、对照组与规则版本,零网络调用。
- `feature_separate_batch_eval_run`:补充 IPC/CPC,生成确定性统计候选并让 Judge 做语义新颖性审查。
- `feature_separate_batch_eval_insights`:读取已确认的新问题,零网络调用。
`run` 的 `allow_network` 默认为 `false`。开启前必须告知用户:PatSnap 只接收未缓存记录的专利号并仅请求 IPC/CPC;IPC/CPC 不可用时 Judge 接收 claim 摘要用于领域分类;Judge 还接收确定性候选统计和单篇问题池用于语义去重。
Judge HTTP 请求默认超时为 300 秒;`.env.example` 显式设置
`CLAIM_DECOMPOSITION_JUDGE_TIMEOUT=300`。真实 token 只保存在未跟踪的本地 `.env`
或进程环境中,不进入模型输入、日志或批量产物。
## 测试
```bash
.venv/bin/pytest
```
TDQS
Scored across 5 tools
Each tool targets a distinct action: status (list cohorts), tag (assign records), check (validate one cohort), run (execute network eval), insights (list persisted results). Status and check both touch 'readiness' and status/insights both list things, which introduces mild overlap, but descriptions keep them separable.
Every tool shares the consistent 'feature_separate_batch_eval_' prefix followed by a short suffix, forming a predictable pattern. Minor deviation in that tag/check/run are verbs while status/insights are nouns, but overall highly consistent.
Five tools is a reasonable, well-scoped set for a batch-evaluation workflow (readiness, tagging, validation, execution, insights). Slightly lean but each tool has a clear role without redundancy.
The core lifecycle (list readiness, assign cohorts, validate, run, retrieve insights) is covered, but there is no way to modify/remove cohort assignments or clear/export persisted insights, leaving some dead ends.