agent-failure-archive
Archiv der Agentenfehler
186 Post-Mortems aus achtmonatigem Produktionsbetrieb eines Multi-Session-KI-Agentensystems. Zahlung pro Aufruf über x402. Keine Anmeldung, kein API-Schlüssel, kein Abonnement.
Live: https://desktop-ai2ata5-1.tailfeb765.ts.net
Probier es jetzt kostenlos aus: /sample
Öffentliche Repositories zeigen Code, der funktioniert hat. Das hier ist die andere Hälfte: die Verdrahtung, die korrekt aussah, das Review bestand, wochenlang lief und die ganze Zeit tot war.
Warum das hier existiert
Die teuren Fehler in Agentensystemen sind nicht die lauten. Ein Absturz wird in einer Stunde behoben. Die teuren sind leise: ein Reparatur-Routine, die an ein Signal angeschlossen ist, das niemand nutzt; ein Watcher, der nach Ablauf seiner Sitzung mit Exit-Code 0 beendet; ein Detektor, dessen Ausgabe identisch ist, egal ob das System gesund oder kaputt ist.
Diese Fehler werden fast nie aufgeschrieben, denn sie aufschreiben zu können bedeutet, das System lange genug betrieben zu haben, um gebissen zu werden, und Aufzeichnungen geführt zu haben. Dieses Archiv ist diese Aufzeichnung.
Ein echter Eintrag (Fall adr-136):
Ein Broadcast-Aufruf schlug mit einem internen Fehler fehl. Der Aufrufer sah den Fehler. Die fünf Empfänger vier nur auf eine Bestätigung, also sahen sie nichts und versuchten es endlos erneut. Sieben Sitzungen, die Heartbeats schrieben, plus der Retry-Sturm, ließen die Datenbank in Sperr- Konflikte (Lock Contention) kollabieren.
Grundursache: Der Fehler war für den Absender sichtbar und für den Empfänger unsichtbar. Asymmetrische Fehlersichtbarkeit, nicht der im Broadcast selbst.
Of den 186 Fällen tragen 174 messbare Belege (Dauern, Zählwerte, Raten) und 155 benennen eine Ursache und nicht nur ein Symptom.
Related MCP server: CLI Anything Hub MCP
Der Messungsschaft
Acht Monate lang war dieses System auf eine Frage gerichtet: Kann man messen, wie stark sich die Sprache einer einzelnen Person von der allgemeinen Sprache entfernt, ohne diese Person auf eine einzige Kennzahl pausen zu müssen?
Es schlug meist fehl, und die Fehler waren interessanter als das Ziel. 107 der 186 Fällen sind Messfehler: Detektoren, die dieselbe Ausgabe lieferten, ob das Signal vorhanden war oder nicht; Dosis-Wirkungs-Armgruppe, bei denen sich derselbe Parameter als zwei verschiedene Behandlungen entpuppte; Positivkontrollen, die nie liefen; ein Korpus, das 2,3-mal kleiner war als vorgab, 2,3x kleiner als die Dateireihe; ein Instrument, das ständig sich selbst maß, and seine Messung als Befund meldete.
Das sind die Fälle hinter /research. Wenn du irgendetwas baust, das vorgibt, einen Menschen zu messen – Stil,
Persönlichkeit, Autorschaft, Passung zu einem profile verfügbar – ist dies die Katalog der Methoden, mit denen diesen
Anspruch bricht, bevor du merken, dass er built.
Endpunkte
Route | Preis | Was du bekommst |
| kostenlos | Dienst-Metadaten |
| kostenlos | zwei vollständige Fälle, keine Zahlung |
| kostenlos | alle Falltitel, mit der Falle getaggt, die sie verdeutlichen. Filter mit |
| $0.02 | neun Checks gegen Selbsttäuschung, angewendet auf deine eigene Behauptung |
| $0.01 | 3 Fälle: Symptom, Grundursache, Fix, Gegenmaßnahme, Beleg |
| $0.05 | Pre-Flight-Risk-Brief + Checkliste über 5 Fälle |
| $0.25 | die oben genannten 107 Messfehler |
| $1.00 | jeder Fall, eine Antwort, eine Zahlung, dein |
Zahlung: USDC auf Base (eip155:8453), abgewickelt über einen ohne Schlüssel Faciliterender. Jeder
x402-Client funktioniert; im Browser bekommt man eine Wallet-Connect-Paywall statt rohem JSON.
# free, no wallet needed
curl https://desktop-ai2ata5-1.tailfeb765.ts.net/sample
# paid, via any x402-capable client
curl https://desktop-ai2ata5-1.tailfeb765.ts.net/search?q=silent+failure+cron/audit ist das Werkzeug, zu dem du greifen solltest, bevor du „wir haben herausgefunden“ schreibst. Gib
ihr deine These und das, was du wirklich gemessen hast, und sie liefert die Prüfungen, an denen deine These
scheitern kann: ein Nullbefund ohne Positivkontrolle, Behandlungsgruppen, die denselben Parameter, aber nicht
dieselbe Behandlung hängen, ehadken ein Nenner, der dieselbe Einheit wieder und wieder zählt, einen Exit-0-Prozess,
der nichts getan hat, eine gecachte Ansicht, die als Zustand gelesen wurde. Neun Prüfungen – jede einzelne davon ein
Fehler, der hier weiterhin vorkommen, mit den damals gemessenen Zahlen.
Das ging in deterministisch. Es wird kein Modell beigefügt, daher liefert dieselbe Eingabe immer dieselbe Prüfung. Sie antwortet in Millisekunden. Und wenn sie falsch liegt, sieht du genau, warum. Einen Fehler, der bestanden wird, ist kein Beweis, dass du These stimmt; er bedeutet nur, dass diese neun bekannten Arten der Selbsttäuschung berücksichtigt wurden.
Füge einen Textabschnitt ein, keine saubere These. /precheck and /audit akzeptieren beide text= Statt
claim=. Gib ihnen einen Ausschnitt deiner Ergebnisse, und sie picken die Sätze heraus, die etwas But
then jede einzeln prüfen:
curl -sG https://desktop-ai2ata5-1.tailfeb765.ts.net/precheck \
--data-urlencode "text=We ran the new ranker on 40 sampled queries and found no significant
difference. The watcher is healthy: it exits 0 every run. Our corpus contains 4279 documents,
2x the previous release."liefert drei Behauptungen zurück, jede aus einem anderen Grund: Das Nullergebnis hat keine Positivkontrolle, der gesunde Watcher würde nach dem execution of nothing identischer aussehen, und der Korpus-Zähler zählt vielleicht erneut gespeicherte Snapshots. Die Satzauswahl ist ebenfalls deterministisch, gesteuert von derselben Prüftabelle und nicht von einem Modell. So liefert ein Text ohne Behauptungen eine leere Antwort, statt sich Befunde auszudenken.
/brief ist das Element, das du vor etwas Unwiderruflichem in die Hände nehmen solltest: Beschreibe die
Handlung in einfachen Worten, und du erhältst die Art, wie diese Handlungsklasse tatsächlich schiefgegangen ist,
sowie die vorbeugende Anmerkung, die jeder Vorfall hervorgebracht hat.
/contents ist das Regal. Zwei Beispielfälle können dir nicht sagen, ob der gesamten Korpus einen Dollar wert ist,
also gibt es alle 186 Titel zurück, jeder markiert mit der Falle, von den neun aus drei, die er erläutert – and
nothing else. Die Verteilung stand heute: 108 Fälle betreffen das Lesen einer gecachten Ansicht als Zustand, 83
betreffen einen Nenner, der auf die gleiche Einheit zählt, 71 betreffen etwas, das ohne Aufrufer gebaut wurde,
36 betreffen einen Prozess, der mit 0 endete, ohne etwas getan zu haben. Nur Titel, keine Körper, keine
Zahlung.
/archive existiert, weil ein Korpus gefährlicher ist als ganze Stücke. Eine Zahlung beendet die
Transaktion; danach gibt es nichts mehr zu stornieren.
Nutzung als MCP-Server
mcp_server.py stellt das gesamte Archiv als Tools für Claude Desktop, Cursor oder jeden passendes
MCP-kompatiblen Agenten bereit. Die kostenlosen Tools benötigen keine Wallet und keine Konfiguration.
pip install "mcp[cli]" requests # free tools only
pip install "x402[mcp]" eth-account # add this for the paid tools{
"mcpServers": {
"agent-failure-archive": {
"command": "python3",
"args": ["/absolute/path/to/mcp_server.py"],
"env": { "X402_PRIVATE_KEY": "0x..." }
}
}
}Tool | Wallet erforderlich | Funktion |
| nein | bei welchen der neun Prüfungen deine Behauptung scheitert |
| nein | zwei vollständige Post-Mortems |
| nein | Inhalt und Preise aktion |
| ja | vollständige Audit, $0.02 |
| ja | drei passende Vorfälle, $0.01 |
| ja | Vorab-Risikobrief, $0.05 |
| ja | die 107 Messungsfehler, $0.25 |
| ja | alles, $1.00 |
X402_PRIVATE_KEY ist deine Wallet. Sie bleibt auf deinem Rechner und wird nur lokal zum Outsectben von
Zahlungsberechtigungen genutzt. Sie wird niemals übertragen, und dieser Server protokolisiert sie nie. Entferne
the env-Block komplett, wenn du nur die kostenlogen Tools brauchst.
Ohne Schlüssel schlagen diekostenkonsumierenden Tools nicht still fehl: Sie liefern den Grund, die Zahlungsaufforderung und einen Verweis auf das kostenfreie Äquivalent.
Getestet mit mcp 2.1.0 und dem 1.x FastMCP-Layout: acht Tools fast, precheck antwortet ohne Wallet, audit
ist mit einem genannten Grund eingeschränkt.
Was nicht darin steckt
Keine personenbezogenen Daten. Jedes Quelldokument, das eine Person, eine Geschäftsbeziehung oder einen Geldbetrag erwähnt, ist vollständig ausgeschlossen und nicht zeilenweise geschwärzt.
Keine Betreiberäußerungen. Der Korpus behält die Struktur jedes Vorfalls, niemals die Stimme.
Wallet-Adressen, Heimatpfade, IP-Adressen, E-Mail-Adressen, API-Schlüssel und Sitzungs-IDs werden maskiert, das ein Dokument überhaupt für die Aufnahme in Erwägung gezogen wird.
Der Filter wird bei jedem Build gegen eine aussichtlich gepflanzte Testsonde geprüft; wenn der Detector sie nicht erfasst, bricht der Build ab. Aktueller Stand: 0 Ausschreibungen in 186 Fällen, Positivkontrolle bestanden.
Gemessene Bemerkungen zum Markt
Während wir versuchten, einen Dollar davon zu verkaufen, haben wir gemessen, wie x402-Discovery und Umsatz wirklich funktionieren – und mehrere weit verbreitete Annahmen waren falsch. written with the exact ballad anonymisierung-checks so du prüfen statt vertrauen kannst: MARKET.md.
Short version: Die häufigste aber liegt zwischen Zehntelcent and drei Cent, es gibt aber einen Anbieter, der $0.85 pro Aufruf bei 125.000 Kundenanrufen im Monat erzielt; acht der zehn größten Abnehmer zahlen genau für einen Anbieter, das das „Volumen“ in der Schlagzeile ist vertikale Integration kein Marktplatz; der Verzeichnis-Chat, von dem alle annehmen, er würde euren Dienst finden, wurde seit Mai nicht mehr benutzt; und unter reicht ein einziges beobachteter Zahlungsversuch, ein vollständiger Verkaufstellt.
Ehrliche Einschränkungen
Dies ist ein System eines Betreibers. Es ist eine Vorarbeit, keine Garantie, and keine statistische Stichprobe über Agentensysteme im Allgemeinen.
Die Abdeckung ist hin zu dem verzerrt, womit dieses System viel zu tun hat: Multi-Session-Koordination, Hook- und Cron-Verdrahtung, Retrieval-Pipelines, Inter-Prozess-Kommunikation, geplante Reparaturungen und die oben genannte Messarbeit.
Einige Einträge beschreiben einen Fehler, dessen Behebung später als falsch erkannt wurde. Sie werden mit der Korrektur behalten, weil die Korrektur meist die nützlicheren Hälfte ist.
Bisher heißt sells noch nichts. Zum Zeitpunkt der Schreibung hat die Empfangsadresse exakt $0.00 eingenommen. Diese Zahl wird on-chain geprüft, nicht aus Server-Logs, und diese Zeile wird aktualisiert, wenn sie sich ändert.
Selbst ausführen
pip install -r requirements.txt
X402_PAY_TO=0xYourAddress uvicorn server:app --port 8402Ohne X402_PAY_TO liefern die kostenpflichtigen Routen daher 503 aus dem Grund im Textkörper, statt nicht leise
to fail. Das ist in nichtscheue Gewohnheit. Es ist Fall adr-546, angewendet auf den eigenen Code dieses Dienstes.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityDmaintenancePaid remote MCP server for monitoring AI agent runs, detecting failures, replaying tool-call incidents, issuing SLA receipts, and exporting client status.
- FlicenseNot gradedqualityDmaintenancePaid remote MCP server enabling CLI tool execution with structured receipts, usage logs, and audit-ready evidence for agent and CI workflows.1
- FlicenseNot gradedqualityDmaintenancePaid remote MCP for hosted MCP server providing structured receipts, usage logs, and audit-ready evidence for agent and CI workflows.
- FlicenseNot gradedqualityBmaintenancePaid remote MCP endpoint for AI SDK data queries, offering structured JSON tools, token-based access, usage receipts, and audit-ready workflow evidence.
Related MCP Connectors
A paid remote MCP for agent memory MCP, built to return verdicts, receipts, usage logs, and audit-re
A paid remote MCP for hosted MCP server, built to return verdicts, receipts, usage logs, and audit-r
A paid remote MCP for AI SDK data query MCP, built to return verdicts, receipts, usage logs, and aud
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/HanbeenMoon/agent-failure-archive'
If you have feedback or need assistance with the MCP directory API, please join our Discord server