deduplicate_data
Removes duplicate rows from an Excel sheet, optionally considering selected columns, and lets you keep the first, last, or no duplicates.
Instructions
Remove duplicate rows from a sheet, optionally using a subset of columns.
Args: file_path: Workbook path. sheet_name: Worksheet name. columns: Optional list of columns to consider for duplicates. keep: Which duplicate to keep: 'first', 'last', or False (drop all duplicates).
Returns: str: Summary message and number of rows removed.
Notes:
- Destructive: modifies the workbook unless an output_file variant is implemented upstream.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| keep | No | first | |
| columns | No | ||
| file_path | Yes | ||
| sheet_name | Yes |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
| result | Yes |