spark-sense-ai
spark-sense-ai
Un servidor MCP (Model Context Protocol) que ofrece a los agentes de IA — Claude Desktop, Claude Code, Devin, o cualquier cliente compatible con MCP — dos capacidades para trabajar con trabajos de Apache Spark:
🔴
diagnose_spark_failure— un trabajo de Spark ha fallado; obtén una causa raíz y una solución concreta, basada en el registro de error real y en el código específico que falló.🟢
optimize_spark_performance— un trabajo de Spark se ha completado pero es lento o costoso; obtén recomendaciones de ajuste específicas y basadas en evidencia.
Creado por un ingeniero de datos con más de 12 años de experiencia práctica con Apache Spark, para llevar ese mismo instinto de depuración — «¿de qué archivo trata realmente este error y por qué?» — a un flujo de trabajo asistido por IA.
Por qué existe esto
Los fallos de Spark suelen poder diagnosticarse solo con el registro, pero leer un stack trace de 200 líneas, hacerlo coincidir con el archivo correcto en un repositorio grande con múltiples trabajos, y saber cuál de una docena de causas posibles es realmente, requiere experiencia real con Spark. Esta herramienta automatiza esa primera pasada: encuentra el código relevante (no todo el repositorio), lo entrega a un LLM junto con el registro, y obtiene un diagnóstico estructurado que puedes verificar y en el que puedes actuar.
Qué lo hace diferente
Decisión de diseño | Por qué importa |
Independiente del origen — EMR (ID de clúster y de paso) o una carpeta local | Funciona tanto si tu trabajo se ejecuta en AWS como on-premises/localmente |
Independiente del proveedor — Bedrock, Anthropic, OpenAI, o ninguno | Sin dependencia de proveedor; |
Selección inteligente de archivos | Los proyectos grandes ejecutan muchos trabajos: esta herramienta analiza el stack trace del registro de error (Python y Scala/Java, incluidos los traces mixtos de PySpark) para incorporar solo los archivos específicos implicados en el fallo, con un máximo de 10 archivos, en lugar de volcar todo el código en el prompt |
Nunca se incluyen credenciales | Cada usuario aporta sus propias credenciales de AWS y/o LLM. Aquí nada comparte facturación ni acceso entre usuarios |
Ejemplo de salida
Dados este registro de error Scala de ejemplo y sus archivos de proyecto correspondientes, diagnose_spark_failure (con un proveedor configurado) devuelve:
ROOT CAUSE:
CustomerHelper.validate() calls .trim() on the "email" field without
checking for null first. Records with a missing email cause a
NullPointerException, which aborts the job after 4 failed task retries.
EVIDENCE:
- Caused by: java.lang.NullPointerException: Cannot invoke "String.trim()"
because "email" is null
- at com.company.jobs.CustomerHelper$.validate(CustomerHelper.scala:22)
- Source shows: email.trim().nonEmpty with no null check beforehand
SUGGESTED FIX:
def validate(row: Row): Boolean = {
val email = Option(row.getAs[String]("email"))
email.exists(_.trim.nonEmpty)
}
CONFIDENCE: HighObserva que la herramienta incorporó automáticamente CustomerHelper.scala (el archivo al que apunta realmente el Caused by del trace), no todo el proyecto ni siquiera el archivo de entrada de nivel superior CustomerOrderJoin.scala, porque el analizador de stack traces resolvió el marco relevante más profundo.
Instalación
pip install spark-sense-aiInstala solo los extras que vayas a usar realmente:
pip install spark-sense-ai[aws] # for EMR source or Bedrock provider
pip install spark-sense-ai[anthropic] # for provider="anthropic"
pip install spark-sense-ai[openai] # for provider="openai"
pip install spark-sense-ai[all] # everythingprovider="none" con source_type="local" no necesita ningún extra — solo la dependencia base mcp.
Las cuatro formas de usarlo
# | Origen del registro/código | Proveedor de LLM | Extras necesarios | ¿Se necesitan credenciales de AWS? |
1 | Clúster EMR + paso | Bedrock |
| Sí — para la obtención y el diagnóstico |
2 | Clúster EMR + paso | Anthropic / OpenAI |
| Sí — solo para la obtención |
3 | Carpeta local | Ninguno (el agente razona, p. ej. dentro de Devin) | ninguno | No |
4 | Carpeta local | Anthropic / OpenAI |
| No |
Las credenciales de AWS, cuando son necesarias, se toman automáticamente de tu configuración existente (aws configure, un rol IAM adjunto o las variables de entorno AWS_* estándar) — nunca se pasan como parámetro de la herramienta.
Configuración
Claude Desktop
Edita claude_desktop_config.json:
{
"mcpServers": {
"sparksense": {
"command": "sparksense-mcp",
"env": {
"SPARKSENSE_AWS_REGION": "ap-south-1"
}
}
}
}Claude Code
claude mcp add sparksense -- sparksense-mcpDevin
Consulta la documentación de MCP de Devin para conocer el método de configuración actual según tu modo de agente de Devin (Cascade y Devin Local usan ubicaciones de configuración ligeramente diferentes). Configúralo para que use el comando sparksense-mcp de la misma manera que arriba.
Ejemplos de uso
"Mi trabajo de Spark ha fallado — clúster EMR j-ABC123, paso s-XYZ789. Usa sparksense para diagnosticarlo con Bedrock."
"Aquí está el registro de mi trabajo local en
./logs/error.logy el código en./src— diagnostica el fallo."
"Sé que es
jobs/customer_order_join.pyel que ha fallado — usa sparksense con eso como punto de entrada."
"Usa sparksense para obtener el registro en
./logs/job.log— lo revisaré yo mismo." (provider="none"— la herramienta solo obtiene; el agente que llama hace el razonamiento)
"Mi trabajo se completó, pero tardó 40 minutos. Usa sparksense para revisar las estadísticas de ejecución en busca de oportunidades de optimización."
Referencia de la herramienta
diagnose_spark_failure
Parámetro | Obligatorio | Notas |
| Sí |
|
| Si | |
| Si | |
| No | URI S3 del código fuente |
| Si | Archivo o carpeta |
| No | Carpeta local del código fuente |
| No | Nombre de archivo/ruta relativa específica para usar directamente, omitiendo la extracción automática — mejor cuando ya sabes qué trabajo falló |
| No (por defecto |
|
| No | Para anthropic/openai; de lo contrario, lee |
optimize_spark_performance
Mismos parámetros que arriba, más:
Parámetro | Obligatorio | Notas |
| No | Memoria del executor, núcleos, particiones de shuffle, etc. |
Lógica de selección de archivos (ambas herramientas)
1. job_entry_point given?
→ use ONLY that file. No auto-extraction.
2. Else, parse the error log for:
→ Python: File "<path>", line <N>
→ Scala/Java: at <package>.<Class>.<method>(<Filename>:<N>)
(handles mixed PySpark traces — Python frames bottoming into JVM
frames — by scanning for both patterns in the same log)
→ filters out framework/library internals (site-packages, pyspark,
org.apache.spark, scala.*, java.*, etc.)
→ fetches up to 10 matched files
3. Else, fallback: broad scan of the project folder, capped at 10 filesVariables de entorno
Variable | Valor por defecto | Propósito |
|
| Región para las llamadas a EMR/S3/Bedrock |
|
| Modelo de Bedrock a usar |
| — | Se usa si |
| — | Se usa si |
Pruebas
git clone https://github.com/YOUR_GITHUB_USERNAME/spark-sense-ai.git
cd spark-sense-ai
pip install -e ".[all]"
# Local source + Anthropic provider, includes Python and Scala samples
export ANTHROPIC_API_KEY="sk-ant-..."
python tests/test_local_anthropic.py
# EMR source + Bedrock provider (needs a real EMR cluster/step)
aws configure
python tests/test_emr_bedrock.py --cluster-id j-XXXXXXX --step-id s-XXXXXXXAmbos scripts ejecutan primero una comprobación de cordura gratuita, sin llamadas a API (provider="none"), antes de realizar cualquier llamada facturable a un LLM.
Hoja de ruta
Disparo automático mediante Lambda/EventBridge al completarse trabajos de EMR/Glue
Databricks como tercer
source_typeIntegración estructurada con la API de Spark History Server
Detección de sesgo (skew) con estadísticas a nivel de partición
Licencia
MIT — consulta LICENSE.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Connectors
MCP server providing access to the Scorecard API to evaluate and optimize LLM systems.
MCP server for AI dialogue using various LLM models via AceDataCloud
Cloud-hosted MCP server for durable AI memory
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/sun7singh/spark-sense-ai'
If you have feedback or need assistance with the MCP directory API, please join our Discord server