Systems Intelligence Performative Commercial Benchmarking
MO§ES™ Enterprise — Plataforma de Evaluación de Operadores de IA
En vivo: mos2es.org — Inteligencia de sistemas para el sistema operativo humano-IA. El nuevo estándar en métricas y benchmarks para operadores de IA. Establece la inteligencia de sistemas de referencia para operaciones cotidianas y flujos de trabajo de IA. Telemetría de tokens sin contenido. Nunca tus prompts.
Evaluación empresarial de operadores de IA. Mide cómo operan las personas la IA — no el modelo de IA en sí.
MO§ES™ selecciona la inteligencia de sistemas de una empresa — cómo de efectivamente las personas manejan sistemas de IA a través de herramientas, tareas, flujos de trabajo y condiciones. De la misma manera que BI ve el negocio, MO§ES™ ve cómo el negocio opera la IA.
Tabla de contenido
Related MCP server: scan-your-ai-toolkit
¿Qué es MO§ES™?
MO§ES™ es una plataforma empresarial de evaluación de operadores de IA. Mide cómo las personas operan sistemas de IA — no los modelos de IA en sí, no el volumen de uso, no la competencia autodeclarada. Usando telemetría de tokens sin contenido (entrada, salida, lectura de caché, escritura de caché — sin texto de prompts, sin texto de respuestas), MO§ES™ establece la inteligencia de sistemas de referencia en:
Operadores — cómo de efectivamente impulsan los individuos la IA
Equipos — distribuciones de cohortes y topología de capacidades
Flujos de trabajo — dónde encaja la IA en el trabajo, no solo si se usa
Organizaciones — benchmarking entre equipos y mapeo de capacidades
La plataforma construye evaluaciones a medida alrededor de tus flujos de trabajo, roles y sistemas de IA, compara el rendimiento contra poblaciones de referencia internas y externas, diagnostica brechas de capacidad y patrones de divergencia, prueba intervenciones específicas y vuelve a medir lo que cambia.
El posicionamiento
BI ve el negocio. MO§ES™ ve cómo el negocio opera la IA.
LMSYS evalúa modelos. Braintrust evalúa resultados de productos. Langfuse rastrea llamadas de LLM. WakaTime rastrea tiempo. CostHawk rastrea gasto. Ninguno de ellos ve la inteligencia de sistemas de las operaciones cotidianas y los flujos de trabajo de IA. MO§ES™ es la capa que faltaba.
El ecosistema MO§ES™
Repo / Sitio | Qué es | URL |
MO§ES™ Enterprise (este repo) | La plataforma — motor de evaluación Python, CLI, servidor MCP, demo, promo, demo empresarial, workers | |
SigRank SignalAF | El ranking público — clasificación de operadores por eficiencia de cascada de tokens | |
SigRank MCP | El instrumento — extrae pilares de tokens, calcula cascada, envía al ranking |
|
SIGNOMY | Marketplace gobernado de agentes de IA — agentes clasificados forman equipos, ejecutan misiones, generan ingresos | |
SigEconomy | Evaluaciones públicas de operadores de LLM — ranking de solo lectura, superficie SEO/AEO |
Superficies en vivo
Superficie | URL | Qué |
Sitio promo | Marketing, metodología, demo, comparativas, reservas | |
Demo empresarial | Recorrido interactivo del producto (evaluar → diagnosticar → flujo de trabajo → comparar) | |
Servidor MCP | Servidor MCP de 27 herramientas (22 de lectura + 5 de escritura), HTTP de transmisión | |
Info del servidor MCP | JSON de información del servidor (versión, número de herramientas, transporte) | |
Tarjeta del servidor MCP | Tarjeta completa del servidor con todos los esquemas de herramientas | |
Especificación OpenAPI | Especificación de la API REST | |
Guía para LLM | llms.txt para agentes de IA y rastreadores | |
Sitemap | Sitemap XML | |
Reserva una demo | Reserva de demo B2B con formulario estructurado de captación |
Inicio rápido
Ejecuta la demo (una línea, sin necesidad de clonar)
curl -sL https://mos2es.org/demo/run.py | python3 -Esto clona el repositorio a un directorio temporal, instala rich y ejecuta el pipeline completo de demo de 11 pasos. Requiere Python 3.10+ y git.
Clonar y ejecutar
git clone https://github.com/SunrisesIllneverSee/Moses_Enterprise_B2BPilot_.git
cd Moses_Enterprise_B2BPilot_/_01_platform
pip install rich
python3 -m src.cli.main demo fullEjecutar la suite de pruebas
cd _01_platform
python3 -m pytest tests/ -q
# 527 tests passEjecutar el servidor MCP localmente
cd _01_platform
pip install mcp
python3 -m src.mcp_server.serverUsar el servidor MCP remoto
Añádelo a tu configuración de Claude Desktop (~/Library/Application Support/Claude/claude_desktop_config.json en macOS):
{
"mcpServers": {
"moses": {
"url": "https://mcp.mos2es.org/mcp",
"transport": "http"
}
}
}O llama a las herramientas directamente:
curl -s -D /tmp/h -X POST https://mcp.mos2es.org/mcp \
-H "Content-Type: application/json" \
-d '{"jsonrpc":"2.0","id":1,"method":"initialize","params":{}}' > /dev/null
SID=$(grep -i "^mcp-session-id:" /tmp/h | tr -d '\r\n' | sed 's/.*: //')
curl -s -X POST https://mcp.mos2es.org/mcp \
-H "Content-Type: application/json" -H "MCP-Session-Id: $SID" \
-d '{"jsonrpc":"2.0","id":2,"method":"tools/list"}' | python3 -m json.toolEl pipeline de demo de 11 pasos
Paso | Nombre | Qué hace |
1 | LOAD | Cargar cohorte sintética de 50 operadores |
2 | EVALUATE | Calcular métricas por observación |
3 | BENCHMARK | Calcular posiciones percentiles |
4 | DIAGNOSE | Ejecutar detectores de patrones |
5 | OPERATOR×SYSTEM | Descomponer efectos del operador vs del sistema |
6 | INTERVENE | Asignar intervenciones específicas |
7 | RE-EVALUATE | Volver a medir después de la intervención |
8 | OUTCOME LINEAGE | Rastrear observaciones → transformaciones → artefactos → resultados |
9 | REPORT | Generar informe piloto en markdown + PDF |
10 | VISUALIZE | Generar 9 diagramas de arquitectura |
11 | DASHBOARD | Exportar dashboard HTML ejecutivo |
La demo se ejecuta con datos completamente sintéticos. Sin operadores reales, sin texto de prompts real, sin llamadas API reales. Determinista — ejecutarla dos veces produce resultados idénticos.
Las 5 métricas canónicas
Métrica | Qué mide |
Yield | Fracción de la salida de IA que sobrevive al estado confirmado |
Leverage | Valor de salida por token consumido |
Token SNR | Relación señal-ruido en el uso de tokens |
Construction | Fracción de salida construida incrementalmente vs reemplazada |
Divergence | Brecha entre patrones de uso y patrones operativos |
15 familias de evaluación. 13 clases de benchmark. 4 niveles de medición (Operador, Equipo, Flujo de trabajo, Organización).
Estructura del repositorio
_01_platform/ Python platform (the product)
src/ Source code (domain, metrics, analysis, diagnostics, CLI, MCP server)
tests/ 527 tests
demo_data/ Synthetic demo cohort (50 operators, 1,668 observations)
scripts/ Utility scripts
schemas/ JSON schemas
_02_demo-website/ Enterprise demo site (enterprise.mos2es.org)
_03_promo-site/ Promo site (mos2es.org)
vs/ 16 competitor comparison pages
alternatives/ 8 alternatives listicle pages
concepts/ 10 concept explainer pages
guides/ 4 how-to guides
demo/run.py One-liner demo runner
.well-known/mcp.json MCP server discovery
_04_onepager/ One-pager site
_workers/ Cloudflare Workers
promo-worker/ mos2es.org worker (static assets + AEO/SEO/GEO headers)
moses-worker/ enterprise.mos2es.org worker (static assets)
onepager-worker/ One-pager worker (static assets)
mcp-worker/ MCP server worker (computes live from raw data, 27 tools)Servidor MCP
El servidor MCP expone 27 herramientas (22 de lectura + 5 de escritura) sobre HTTP de transmisión en https://mcp.mos2es.org/mcp. No se requiere autenticación para el servidor público.
Las herramientas de lectura incluyen: estadísticas de cohortes, perfiles de operadores, distribuciones de métricas, posiciones de benchmark, hallazgos de divergencia, resultados de intervenciones, linaje de resultados, ajuste del flujo de trabajo, topología organizativa y más.
Las herramientas de escritura incluyen: crear intervención, asignar intervención, registrar resultado, crear configuración de evaluación, crear configuración piloto.
El servidor calcula en vivo a partir de datos brutos de observación — sin resultados precalculados. Cada llamada ejecuta los motores reales de puntuación, benchmarking y diagnóstico.
Tarjeta del servidor
curl -s https://mcp.mos2es.org/.well-known/mcp/server-card.json | python3 -m json.toolDevuelve la tarjeta completa del servidor con los 27 esquemas de herramientas, información de transporte y metadatos.
Cloudflare Workers
Cuatro Workers se despliegan desde este repositorio:
Worker | Dominio | Qué |
| mos2es.org | Sitio promo + cabeceras AEO/SEO/GEO + detectabilidad para agentes (llms.txt, sitemap, OpenAPI, enlaces MCP) |
| enterprise.mos2es.org | Sitio de demo empresarial |
| (workers.dev) | One-pager |
| mcp.mos2es.org | Servidor MCP (27 herramientas, cálculo en vivo) |
Despliegue
npm install -g wrangler
cd _workers/promo-worker && wrangler deploy
cd _workers/moses-worker && wrangler deploy
cd _workers/onepager-worker && wrangler deploy
cd _workers/mcp-worker && wrangler deploySincronización de datos del worker MCP
El worker MCP calcula en vivo a partir de archivos de datos brutos (observations.js, lineages.js) generados automáticamente a partir de los datos demo de la plataforma. Para regenerarlos después de actualizar los datos demo:
cd _workers/mcp-worker/src
python3 -c "
import json
with open('../../../_01_platform/demo_data/observations.jsonl') as f:
data = [json.loads(l) for l in f if l.strip()]
with open('observations.js', 'w') as f:
f.write('export default '); json.dump(data, f); f.write(';\n')
with open('../../../_01_platform/demo_data/lineages.jsonl') as f:
data = [json.loads(l) for l in f if l.strip()]
with open('lineages.js', 'w') as f:
f.write('export default '); json.dump(data, f); f.write(';\n')
"Convenciones clave
Marca: MO§ES™ (usa el signo de sección §)
Todas las afirmaciones de resultados son ASSOCIATION, nunca CAUSATION, salvo que estén respaldadas por un experimento controlado
La puntuación compuesta es DEVELOPMENTAL, nunca PERSONNEL — sin uso punitivo, sin ranking de empleados
La similitud de operador es similitud métrica, NO coincidencia de personalidad
Telemetría sin contenido — sin texto de prompt, sin cuerpos de salida, sin contenido de código en las observaciones
Sin vigilancia del contenido de los prompts — el rendimiento del operador es observable solo a partir de la estructura de tokens
Listo para gobernanza — etiquetas de evidencia (DEVELOPMENTAL, HYPOTHESIS, ASSOCIATION) en cada salida
Complementar, no reemplazar
MO§ES™ funciona junto con tus herramientas existentes de BI, suites de evaluación, herramientas de observabilidad y análisis de productividad. Mide la capa de inteligencia de sistemas que no pueden ver. No es un reemplazo: la pieza que falta.
Cinco pilares
# | Pilar | Descripción |
1 | Inteligencia de Sistemas | MO§ES™ ve el sistema operativo humano-IA de la misma manera que la BI ve el negocio. Rendimiento del operador, ajuste del flujo de trabajo, selección de herramientas, distribución de capacidades, resultados de intervención: todo medido a partir de la estructura, no del contenido. |
2 | Métricas Operativas Performativas Estándar | 5 métricas canónicas. 15 familias de evaluación. 13 clases de benchmark. 4 niveles de medición. Una especificación abierta y documentada para medir cómo los humanos operan la IA. La implementación de referencia es MO§ES™. |
3 | Evaluaciones Empresariales a Medida | Tu empresa no debería heredar la definición de competencia en IA de otra persona. Evaluaciones construidas en torno a tus flujos de trabajo, roles, modelos y preguntas de rendimiento. |
4 | Complementar, No Reemplazar | Funciona junto con tus herramientas existentes de BI, suites de evaluación, herramientas de observabilidad y análisis de productividad. La pieza que falta, no un reemplazo. |
5 | Privacidad Primero / Gobernanza | Telemetría de tokens sin contenido. Sin texto de prompt. Sin vigilancia. Etiquetas de evidencia DEVELOPMENTAL / HYPOTHESIS / ASSOCIATION en cada salida. Listo para gobernanza desde el primer momento. |
Licencia
PolyForm Noncommercial 1.0.0 — consulta LICENSE. Se permiten el uso personal, la investigación y el uso no comercial. El uso comercial requiere una licencia. Patente en trámite.
mos2es.org · Reservar una demo · Ejecutar la demo · Servidor MCP
Creado por Deric J. McHenry — Ello Cello LLC
Related MCP Servers
- FlicenseNot gradedqualityCmaintenanceEnterprise-grade MCP server with multi-agent system for business AI transformation across finance, healthcare, retail, and other domains. Provides specialized AI agents for data analysis, API execution, business validation, and report generation with real-time monitoring and observability.
- FlicenseNot gradedqualityNot gradedmaintenanceOpen-source AI governance toolkit. MCP servers & CLIs for scanning, auditing, and managing your AI environment
- AlicenseAqualityAmaintenanceDescription Governed agent city-state. Register as an agent, browse open mission slots, earn revenue under constitutional protocol. Every action creates a SHA-256 provenance seed. Powered by MO§ES™.6231MIT
- AlicenseNot gradedqualityDmaintenanceA production-grade MCP server designed for multi-tenant, authenticated, and observable AI agent systems, enabling secure tool execution across heterogeneous data sources.57MIT
Related MCP Connectors
MCP server providing access to the Scorecard API to evaluate and optimize LLM systems.
AI Reasoning Cache & Consensus Layer with 11 MCP tools via Streamable HTTP.
MCP server for AI agents to plan, verify, and deploy Cloudflare-native apps.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/SunrisesIllNeverSee/Moses_Enterprise_B2BPilot_'
If you have feedback or need assistance with the MCP directory API, please join our Discord server