find_similar_columns
Find duplicate or related columns across datasets by comparing name, type, value overlap, and cardinality. Detect naming drift and parallel definitions to consolidate data.
Instructions
Multi-signal cross-dataset column consolidation. Fuses name (token Jaccard), type, top-value overlap, cardinality similarity, and (when present) embedding cosine into a composite score. Clusters via union-find and classifies each cluster: near_duplicate, naming_drift, parallel_definition, or overlapping_topic. Use to find duplicate columns across datasets, surface naming drift (email vs email_address), or detect the same conceptual column spread across multiple datasets. Mirrors jcm's find_similar_symbols.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| top_n | No | Max clusters returned. Default 50, capped at 200. | |
| datasets | No | Datasets to scan. Omit to scan every indexed dataset. | |
| min_score | No | Composite-score floor for surfacing pairs. | |
| same_type_only | No | Drop pairs where types don't match. |