scienceON_collect_groups
Combine multiple search groups into one deduplicated corpus with per-group fields and filters, enabling corpora that single queries cannot produce.
Instructions
여러 검색 그룹을 한 코퍼스로 합쳐 수집(CN 중복제거). config 파일 없이 대화형으로.
그룹마다 다른 필드·후처리 필터를 걸 수 있어, 단일 검색어로는 못 만드는 코퍼스를 만든다.
각 group = {"field": "BI", "terms": [...], "contains": [...], "lang": [...], "max": N}
field : BI(전체)·TI(제목)·AB(초록)·AU(저자)·KW(키워드)
terms : 그 필드로 개별 검색할 용어들(와일드카드 * 가능)
contains: 원본 전체필드 substring 후처리 필터(노이즈 제거, 대소문자 무시)
lang : 허용 언어(예: ["한국어"]) — 국문 논문 한정 등
max : 그 그룹만의 상한(미지정 시 max_records)
예) 변별력 있는 단어는 BI 로 그대로, 색인 안 되는 토큰은 TI 와일드카드 + contains 로 정밀화: [{"field":"BI","terms":["경계선지능","경계선 지능"]}, {"field":"TI","terms":["느린*"],"contains":["느린학습자","느린 학습자"]}]
save=true(기본) 면 파일로 저장하고 경로를 반환한다. save=false 면 레코드를 직접 반환하되 응답 폭주를 막기 위해 앞 100건만 싣는다(meta 는 전량 기준).
⚠️ meta.truncated=true 면 상한에 걸려 잘린 것이다 — meta.union_upper_bound(그룹별 total 합) 위로 max_records 를 올려 재수집해야 코퍼스가 완결된다.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| name | No | ||
| save | No | ||
| groups | Yes | ||
| target | No | ARTI | |
| formats | No | ||
| out_dir | No | ||
| year_to | No | ||
| year_from | No | ||
| max_records | No | ||
| retry_incomplete | No |