Skip to main content
Glama
HanbeenMoon

agent-failure-archive

by HanbeenMoon

Archivo de fallos de agentes

186 post-mortem de la ejecución de un sistema de agentes de IA multisesión en producción durante 8 meses. Pago por llamada con x402. Sin registro, sin clave API, sin suscripción.

En vivo: https://desktop-ai2ata5-1.tailfeb765.ts.net Pruébalo gratis, ahora mismo: /sample

Los repositorios públicos te muestran código que funcionaba. Esta es la otra mitad: el cableado que parecía correcto, superó la revisión, funcionó durante semanas y estuvo muerto todo el tiempo.


Por qué existe

Los fallos caros en los sistemas de agentes no son los ruidosos. Una caída se arregla en una hora. Los costosos son silenciosos: una rutina de reparación conectada a una señal que nadie consume, un observador que termina con código 0 después de haber caducado su sesión, un detector cuya salida es idéntica tanto si el sistema está sano como si está roto.

Esos fallos casi nunca se documentan, porque documentarlos requiere haber ejecutado el sistema el tiempo suficiente como para escarmentar y haber conservado registros. Este archivo es ese registro.

Una entrada real (caso adr-136):

Una llamada de difusión falló con un error interno. Quien llamaba vio el error. Las cinco sesiones receptoras solo comprobaban si había un acuse de recibo, así que no vieron nada y reintentaron para siempre. La tormenta de reintentos, sumada a siete sesiones escribiendo latidos, colapsó la base de datos por contención de bloqueos.

Causa raíz: el error era visible para el emisor e invisible para el receptor. Visibilidad asimétrica del error, no el fallo del propio broadcast.

De los 186 casos, 174 contienen evidencia medida (duraciones, recuentos, tasas) y 155 nombran una causa raíz en lugar de solo un síntoma.


Related MCP server: CLI Anything Hub MCP

La parte de la medición

Durante ocho meses este sistema se centró en una sola pregunta: ¿se puede medir cómo el lenguaje de una sola persona se aparta del lenguaje general, sin reducir a esa persona a una puntuación?

En su mayoría fracasó, y los fracasos fueron más interesantes que el objetivo. 107 de los 186 casos son fallos de medición: detectores que devolvían la misma salida con y sin señal, brazos de respuesta a la dosis en los que el mismo parámetro resultó ser dos tratamientos distintos, controles positivos que nunca se ejecutaron, un corpus 2,3 veces más pequeño de lo que decía el recuento de archivos, un instrumento que medía exactamente para sí mismo y daba cuenta de la lectura como hallazgo.

Esos son los casos que hay detrás de /research. Si construyes algo que pretenda medir a una persona -su estilo, su personalidad, su autoría, su ajuste a un perfil-, este es el catálogo de las formas en que esa afirmación se trae antes de que notas que se ha roto.


Endpoints

Ruta

Precio

Qué obtienes

GET /

free

metadata del servicio

GET /sample

free

dos casos completos, sin pago

GET /contents

free

todos los títulos de cada caso, etiquetados con la trampa que ilustran. Filtra con ?theme=

GET /audit?claim=<conclusion>&evidence=<lo que mediste>

$0.02

nueve comprobaciones contra el de autoengaño, aplicadas a tu afirmación

GET /search?q=<síntoma>

$0.01

3 casos: síntoma, causa raíz, solución, prevención, evidencia

GET /brief?action=<lo que estás a punto de hacer>

$0.05

informe de riesgo preliminar y lista de comprobación en 5 casos

GET /research?q=<tema>

$0.25

los 107 fallos de medición anteriores

GET /archive

$1.00

todos los casos, una solo respuesta, un solo pago, todo

Pagos: USDC en Base (eip155:8453), a través de un facilitador sin claves. Cualquier cliente de x402 funciona y un navegador recibe un banner de WalletConnect en vez de JSON crudo.

# free, no wallet needed
curl https://desktop-ai2ata5-1.tailfeb765.ts.net/sample

# paid, via any x402-capable client
curl https://desktop-ai2ata5-1.tailfeb765.ts.net/search?q=silent+failure+cron

/audit es lo que debes usar antes de escribir "encontramos que". Pásale tu conclusión y lo que realmente has medido, y devuelve las comprobaciones que tu afirmación hace saltar: un resultado nulo sin control, control sin control, grupo que recibió el mismo parámetro pero no el mismo tratamiento, un denominador que cuenta la misma unidad en lo sucesivo, un proceso exit-0 que no hacía nada, una vista en caché leída como si fuera estado real. Nueve comprobaciones, cada una de ellas un fallo que ha llegado de verdad aquí, con los números medidos en su momento.

Es determinista. No se consulta ningún modelo, de modo que la misma entrada devuelve siempre la misma auditoría, responde en milisegundos y, cuando se equivoca, puedes ver exactamente por qué. Pasar una comprobación no prueba que tu afirmación sea cierta; significa que se han tenido en cuenta estas nueve formas conocidas de engañarte a ti mismo.

Pega un párrafo, no una sentencia sencilla. Tanto /precheck como /audit aceptan text= en lugar de claim= y, si les pasas un fragmento de tus resultados, detectan las frases que dicen algo y comprueban cada una por separado:

curl -sG https://desktop-ai2ata5-1.tailfeb765.ts.net/precheck \
  --data-urlencode "text=We ran the new ranker on 40 sampled queries and found no significant
difference. The watcher is healthy: it exits 0 every run. Our corpus contains 4279 documents,
2x the previous release."

devuelve tres afirmaciones, cada una bloqueada por un motivo distinto: el resultado nulo carece de control positivo, el observador sano parecería idéntico aun no habiendo hecho nada, y el recuento del corpus puede estar contando instantáneas duplicadas. La selección de frases también es determinista, impulsada por la misma tabla de comprobación y no por un modelo, de manera que el texto sin afirmaciones devuelve vacío en lugar de inventar hallazgos.

/brief es lo que debes usar antes de hacer algo irreversible: describe la acción con palabras simples y devuelve las formas en las que esa clase de acción ya ha fallado, así como la línea de prevención que produjo cada incidente.

/contents es el estante. Dos casos de muestra no te dicen si todo el conjunto vale un dólar, así que devuelve los 186 títulos, cada uno con la trampa que ilustra, y nada más. La distribución a día de hoy: 108 casos implican leer una vista en caché como si fuera estado; 83 implican un denominador que cuenta el mismo dato del 71, 36 implican una característica sin personas que la llamen; y 36 implican un proceso que salió con código 0 sin haber hecho nada. Solo títulos, sin contenido, sin pago.

/archive existe porque un corpus completo vale más que uno troceado. Un solo pago cierra la transacción; luego no hay nada que cancelar.


Úsalo como servidor MCP

mcp_server.py expone el archivo completo como herramientas para Claude Desktop, Cursor o cualquier agente compatible con MCP. Las herramientas gratuitas no precisan de wallet ni de configuración.

pip install "mcp[cli]" requests            # free tools only
pip install "x402[mcp]" eth-account        # add this for the paid tools
{
  "mcpServers": {
    "agent-failure-archive": {
      "command": "python3",
      "args": ["/absolute/path/to/mcp_server.py"],
      "env": { "X402_PRIVATE_KEY": "0x..." }
    }
  }
}

Herramienta

¿Wallet necesaria?

Función concreta

precheck

no

cuáles de las nueve comprobaciones supera tu conclusión

sample

no

dos informes post-mortem completos

service_info

no

contenidos y precios

audit

la auditoría completa, $0.02

search

tres incidentes parecidos, $0.01

brief

informe de riesgo preliminar, $0.05

research

los 107 fallos de medición, $0,.25

archive

todo, $1.00

X402_PRIVATE_KEY es tu wallet. Se queda en tu máquina y se usa solo de forma local para firmar autorizaciones de pago. Nunca se transmite, y este servidor no lo registra. Elimina todo el bloque env si solo quieres las herramientas gratuitas.

Las herramientas de pago no fallan en silencio: sin una clave clave, devuelven el motivo, el reto de pago y una referencia gratuita al equivalente.

Probado contra mcp 2.1.0 y el sistema basic FastMCP 1.x: aparecen ocho herramientas, precheck funciona sin wallet, audit se degrada con inform.


Lo que no hay aquí

  • No hay información personal. Cualquier documento fuente que mencione a una persona, una relación comercial o una cantidad monetaria se excluye entero, no se corta o borrado línea por línea.

  • No hay habla del operador. El corpus conserva la estructura del incidente, nunca la voz.

  • Las direcciones de wallet, las rutas de origen, las direcciones IP, los correos electrónicos, las claves API y los identificadores de sesión se enmascaran antes de que un documento se tenga en cuenta para incluirlo.

El filtro se prueba contra un marcador sonda plantado en cada compilación; si el detector no lo detecta, la compilación se detiene. Estado actual: 0 fugas a través de 186 casos, control positivo superado.


Notas medidas sobre el mercado

Mientras intentábamos vender un dólar de esto, medimos cómo se comportan de verdad el descubrimiento y los ingresos de x402. Several assumptions that many think are true won't: MARKET.md with the unauthenticated calls exact so you can check, not someone else.

Entrada: el precio modal está entre una décima de céntimo y tres céntimos, pero existe un vendedor que hace $0,85 por llamada, con 125 000 llamadas al mes; ocho de los principales compradores pagan exactamente a un solo vendedor, de modo que el volumen que parece no es marketplace, sino integración vertical; la conversación en el directorio que todo el mundo cree que nos hallará no se usa desde mayo; y para entrar en el directorio facilitador hay que hacer un intento de pago que se observe, no una venta definitiva.


Límites honestos

  • Es un sistema de un solo operador. Es técnica previa, no una garantía, menos testigo, y no una muestra estadística de los sistemas de agentes en general.

  • La cobertura está sesgada hacia lo que ese sistema hace mucho: coordinación de varias sesiones, integraciones de hooks y cron, cadenas de recuperación, messaging entre procesos, reparaciones programadas y trabajo de medición descrito arriba.

  • Algunas entradas documentan un fallo cuya corrección se descubrió más tarde que era incorrecta. Esas se conservan, con la corrección, porque la corrección suele ser la mitad más útil.

  • No hay aquí nada vendido todavía. Al momento de redactar esto la dirección receptora ha recibido exactamente $0.00. Esa cifra se about la parte on-chain, no de los logs del servidor, y se actualiza cuando cambia.


Cómo ejecutarlo tú mismo

pip install -r requirements.txt
X402_PAY_TO=0xYourAddress uvicorn server:app --port 8402

Sin X402_PAY_TO, las rutas de pago devuelven un 503 con el explicación dentro del cuerpo, en lugar de fallar en silencio. Esa conducta no es accidental; es el caso adr-546 aplicado al código de este propio servicio.

F
license - not found
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • F
    license
    Not graded
    quality
    D
    maintenance
    Paid remote MCP server for monitoring AI agent runs, detecting failures, replaying tool-call incidents, issuing SLA receipts, and exporting client status.
  • F
    license
    Not graded
    quality
    D
    maintenance
    Paid remote MCP server enabling CLI tool execution with structured receipts, usage logs, and audit-ready evidence for agent and CI workflows.
    1
  • F
    license
    Not graded
    quality
    B
    maintenance
    Paid remote MCP endpoint for AI SDK data queries, offering structured JSON tools, token-based access, usage receipts, and audit-ready workflow evidence.

View all related MCP servers

Related MCP Connectors

  • A paid remote MCP for agent memory MCP, built to return verdicts, receipts, usage logs, and audit-re

  • A paid remote MCP for hosted MCP server, built to return verdicts, receipts, usage logs, and audit-r

  • A paid remote MCP for AI SDK data query MCP, built to return verdicts, receipts, usage logs, and aud

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/HanbeenMoon/agent-failure-archive'

If you have feedback or need assistance with the MCP directory API, please join our Discord server