cluster_analysis
Perform KMeans clustering on numeric data from CSV, TSV, XLSX, JSON, or inline records. Returns standardized clusters with centroids, sample sizes, and silhouette scores for validation.
Instructions
cluster_analysis —— 建模组 · KMeans 聚类(工具 14,核心实现)。
docstring = agent 使用说明书,与 statlab_mcp/docs/design/05_modeling.md 同步维护。
参数: file_path (str): 本地数据文件(csv/tsv/xlsx/json) k (int): 簇数,2 <= k <= 样本数-1(非法中文报错)
口径: 仅数值列(非数值列自动排除并列出);StandardScaler z-score 标准化后 KMeans(n_clusters=k, random_state=42, n_init="auto");质心反标准化回原始单位 (标准化空间质心即簇内均值,反标准化后 = 原空间簇均值,可手算核对); 质心解读强制附簇内样本量;轮廓系数(标准化空间)+ k-1/k+1 同 seed 对照。
示例: cluster_analysis("samples/clean.csv", k=3) inline 数据: 本工具支持可选 inline_data 参数(v1.2.0 起):与 file_path 二选一, 支持 records 数组或 {"header": [...], "rows": [[...], ...]} 对象两种形态; 规模上限/类型域/data_source 来源标注见 statlab_mcp/docs/SPEC.md 第 12 节。
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| k | No | ||
| file_path | No | ||
| inline_data | No |