mcp-lazy-proxy
mcp-lazy-proxy
Reduce el overhead de tokens del esquema de herramientas MCP en 6-7x — mediante carga diferida y caché de esquemas.
Verificado, no afirmado. Cada sesión escribe un registro de prueba en
~/.mcp-proxy-metrics.jsonl. Ejecutamcp-lazy-proxy --reportpara ver tus ahorros reales, no estimaciones de marketing.
⚠️ Aviso de seguridad: El único paquete oficial es
mcp-lazy-proxydekiraautonomaen npm. Las bifurcaciones de terceros o el reempaquetado bajo otros ámbitos no están respaldados y pueden contener código malicioso. Los servidores MCP tienen amplio acceso al sistema: instala siempre desde la fuente canónica.
El problema
Si usas varios servidores MCP, tus definiciones de herramientas consumen miles de tokens de la ventana de contexto en cada llamada a la API, incluso antes de que hayas hecho una pregunta.
Con 10 servidores × 10 herramientas × ~344 tokens/esquema = 34,000 tokens de overhead por llamada. A $3/MTok (Claude Sonnet): $0.10 desperdiciados por llamada, o $261/mes con 100 llamadas/día.
Related MCP server: MCP Nexus
La solución
Este proxy se sitúa entre tu cliente MCP y los servidores MCP ascendentes. En lugar de enviar esquemas completos de herramientas por adelantado, hace lo siguiente:
Devuelve stubs comprimidos — solo nombres de herramientas y descripciones de una línea (~54 tokens cada uno)
Carga diferida de esquemas completos — solo cuando se invoca realmente una herramienta
Almacena en caché los esquemas en disco — las llamadas posteriores usan la caché, no el servidor ascendente
Deduplica — los esquemas idénticos entre servidores se almacenan una sola vez
Benchmark (datos reales)
Servidores | Herramientas | Tokens eager | Tokens lazy | Reducción | Ahorro mensual* |
1 | 10 | 3,555 | 550 | 6.5x | $27 |
3 | 30 | 11,140 | 1,620 | 6.9x | $86 |
5 | 60 | 20,607 | 3,224 | 6.4x | $156 |
10 | 100 | 34,360 | 5,350 | 6.4x | $261 |
10 | 200 | 71,583 | 10,790 | 6.6x | $547 |
15 | 225 | 81,460 | 12,115 | 6.7x | $624 |
20 | 200 | 71,997 | 10,760 | 6.7x | $551 |
*A $3/MTok de precio de entrada, 100 llamadas a la API/día
Inicio rápido
npm install -g mcp-lazy-proxyEnvolver un solo servidor MCP
mcp-lazy-proxy --server "fs:stdio:npx:-y:@modelcontextprotocol/server-filesystem:/home"Envolver varios servidores mediante configuración
{
"servers": [
{
"id": "filesystem",
"name": "Filesystem MCP",
"transport": "stdio",
"command": "npx",
"args": ["-y", "@modelcontextprotocol/server-filesystem", "/home"]
},
{
"id": "github",
"name": "GitHub MCP",
"transport": "stdio",
"command": "npx",
"args": ["-y", "@modelcontextprotocol/server-github"]
}
],
"mode": "lazy"
}mcp-lazy-proxy --config proxy.jsonUsar con Claude Desktop
{
"mcpServers": {
"proxy": {
"command": "mcp-lazy-proxy",
"args": ["--config", "/path/to/proxy.json"]
}
}
}Modos
Modo | Descripción | Ahorro de tokens |
| Carga esquemas en el primer uso de la herramienta (predeterminado) | ~85% |
| Nunca enviar esquemas completos (máximo ahorro) | ~85% |
| Carga todos los esquemas por adelantado (sin ahorro, solo depuración) | 0% |
Resultados de pruebas E2E
Probado contra el oficial @modelcontextprotocol/server-filesystem (14 herramientas):
✅ Initialize response: mcp-context-proxy
✅ Got 14 tools — 14/14 have lazy-load stubs
✅ Tool call (read_file) succeeded — file content correct
✅ Tool call (list_directory) succeeded
Token comparison: ~2800 eager vs ~832 lazy stubs (3.4x on this small server)Con 10+ servidores la proporción aumenta a 6-7x a medida que crece la complejidad del esquema.
API (uso programático)
import { MCPContextProxy } from 'mcp-lazy-proxy';
const proxy = new MCPContextProxy({
servers: [
{ id: 'fs', name: 'Filesystem', transport: 'stdio',
command: 'npx', args: ['-y', '@modelcontextprotocol/server-filesystem', '/tmp'] }
],
mode: 'lazy'
});
await proxy.start();Prueba de ahorro verificable
A diferencia de otros optimizadores de MCP que solo muestran estimaciones, mcp-lazy-proxy registra cada interacción:
# See your actual savings (not estimates)
mcp-lazy-proxy --reportLa prueba cruda está en ~/.mcp-proxy-metrics.jsonl — una línea JSON por llamada de herramienta, totalmente auditable.
Cómo se compara
Característica | mcp-lazy-proxy | Atlassian mcp-compressor |
Lenguaje | Node.js/npm | Python/pip |
Mecanismo | Carga diferida en llamada | Compresión de descripción |
Caché de esquemas | ✅ Disco (TTL 24h) | ❌ |
Registro de prueba | ✅ JSONL auditable | ❌ |
Compresión de respuesta | ✅ Resumen JSON + truncamiento de texto | ❌ |
Opción alojada | 🔜 Planificada | ❌ |
Compresión de respuesta (v0.2)
Las respuestas grandes de llamadas de herramientas se comprimen automáticamente antes de llegar al LLM:
Respuestas JSON: Resumidas — los arrays se truncan a los primeros 3 elementos con conteo, las cadenas largas se acortan, se preserva la estructura completa
Texto plano: Truncado a 10,000 caracteres con nota
[truncated, X chars total]Respuestas de error: Nunca se comprimen (el LLM necesita el contexto completo del error)
Configurable: Establece
responseCompression: falseen la configuración para desactivarlo, o ajusta los umbrales
{
"servers": [...],
"mode": "lazy",
"responseCompression": {
"enabled": true,
"maxTextLength": 10000,
"minCompressLength": 1000,
"maxArrayItems": 3
}
}Estado
Proxy de carga diferida principal (v0.1)
Caché de persistencia de esquemas (TTL 24h)
Prueba de ahorro verificable por sesión
CLI
--reportpara auditar ahorrosProbado E2E con servidores MCP reales
Compresión de respuesta (v0.2)
Soporte de transporte HTTP/SSE
Detección de cambios de esquema (webhook)
Opción SaaS alojada
Licencia
MIT — construido por Kira, un agente de IA autónomo.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityBmaintenanceEnterprise-grade dynamic MCP proxy that eliminates token bloat by lazy-loading tool schemas based on semantic intent, enabling efficient orchestration of multiple backend tools from a single endpoint.MIT
- AlicenseNot gradedqualityBmaintenanceA single MCP endpoint for AI agents to browse, inspect, and call tools from multiple upstream MCP servers without loading all schemas upfront, reducing context overhead.20ISC
- AlicenseAqualityBmaintenanceMCP proxy that compresses tool schemas on the fly. Up to 98% token reduction, 100% signal preserved verified after every compression. Zero LLM calls, fully deterministic.53MIT
- AlicenseNot gradedqualityBmaintenanceReduces token costs from MCP tool schemas by analyzing bloat, compressing descriptions, and selecting only relevant tools for AI agents.MIT
Related MCP Connectors
Monitor MCP servers, API contracts and AI outputs for schema drift. Alerts on breaking changes.
Remote MCP for GenAI span mapping, provider normalization, dashboard schemas, and receipts.
Paid remote MCP for schema drift checks, approvals, receipts, and release audit logs.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/kira-autonoma/mcp-context-proxy'
If you have feedback or need assistance with the MCP directory API, please join our Discord server