Skip to main content
Glama

MCP-Bifrost

Schreiben Sie 200 Methoden mit einem günstigen Modell neu, ohne dass eine einzige Zeile des Ergebnisses durch den Kontext des teuren Modells läuft — und ohne irgendetwas auf die Festplatte zu schreiben, das nicht kompiliert.

tests license python targets

Ein MCP-Server, der bereits analysierte und von einem orchestrierenden Modell aufgeteilte Code-Arbeit übernimmt, mit dem eigenen Parser der Sprache den exakten Zielblock extrahiert, die Umschreibung an ein günstigeres Worker-Modell delegiert, das Ergebnis validiert, atomar anwendet und das Ganze außerhalb des Kontexts des Orchestrators protokolliert.

Der Kopf entscheidet. Der Muskel schreibt. Bifrost ist der Nerv zwischen ihnen — und der Teil, der garantiert, dass nichts zerbrochen auf der Festplatte ankommt.

In den Beispielen unten ist der Kopf Claude und der Muskel DeepSeek, das einfach das Modell war, das gerade zur Hand war. Beides ist keine Voraussetzung. Warum ein 7B-Modell auf der eigenen Maschine possibly's die interessantere Wahl ist, erfahren Sie unter „Der Worker“.


Warum

Eine große Codebasis, die von einem LLM bearbeitet wird, hat genau einen echten Flaschenhals — und das ist nicht Intelligenz, sondern Kontext. Eine 4.600 Zeilen lange Datei zu lesen, um dreißig Zeilen davon zu ändern, verbrennt das Fenster des Orchestrators mit Text, den es nie wieder brauchen wird.

Bifrost’s Prämisse ist, dass die mechanische Hälfte des Programmierens — das Schreiben des Ersatztexts — das teure Modell nicht braucht und dessen Kontext überhaupt nicht durchlaufen muss.

Orchestrator erledigt alles

Über Bifrost

202 Methoden × ~800 Tok

~161.000 Tok — übersteigt ein Kontextfenster

~15.000 Tok

Die ehrliche Version (siehe RF-4): Bei einer einzelnen kleinen Änderung ist die Ersparnis real, aber bescheiden, weil der Orchestrator den Code ohnehin meist lesen musste, um zu sagen, was er will. Der Gewinn in der Größenordnung liegt im Volumen — bei Transformationen über viele Symbole, wo die Anweisung geschrieben werden kann, ohne etwas zu lesen.

Dafür ist das gebaut — nicht für das Finden von Fehlern.


Related MCP server: ropey

Wann man es nicht verwenden sollte

  • Exploratives Arbeiten. „Finde heraus, warum das abstürzt“ ist keine Anweisung, die Bifrost ausführen kann. Es muss die Symbole kennen, bevor es beginnt.

  • Einzelne kleine Änderungen. Die Token-Rechnung lohnt kaum, sagen wir RF-4. Verwenden Sie das normale Editierwerkzeug Ihren Agents.

  • Latenzempfindliche Schleifen. ~2,6 s pro Block, gemessen mit DeepSeek.

  • Alles, was nicht PHP oder Python ist. Eine Sprache hinzuzufügen bedeutet, einen Parser-Adapter zu schreiben, nicht den Kern neu zu gestalten — aber heute ist da nichts.

  • Refaktoren über Dateien hinweg, bei denen die Form einer Änderung vom Ergebnis einer anderen abhängt. patch_group bietet Atomizität, nicht Sequenzierung.

  • Codebasen, die Ihnen keine Möglichkeit geben, zu erfahren, dass etwas kaputt ist. Jedes Gate hier prüft Form; keins versteht Bedeutung.

Wie das neben Aider, Serena und Fast-Apply-Modellen einzuordnen ist — einschließlich der Fälle, wo sie besser sind — steht in docs/comparison.md.


So funktioniert es

you ──▶ Claude Code ──▶ MCP-Bifrost ──▶ worker model
         analyses,        parses,          writes one
         splits work      validates,       isolated block
                          applies, logs
                              │
                              ├──▶ source file (atomic splice)
                              └──▶ .bifrost/history.db

Der Orchestrator entscheidet, was und wie. Der Worker entscheidet nichts. Der Server ist die einzige Komponente, die die Festplatte anfassen darf, und er lehnt ab, bis jedes Gate besteht.

Validierungsgates

Gate

Prüft

Standard

0 — Offsets

Der Block auf der Platte ist byte-identisch mit dem, was wir gesendet haben

an

1 — Syntax

Die neu erzeugte Datei besteht php -l / ast.parse()

an

2 — ein Symbol

Der zurückgegebene Block definiert genau ein Symbol

an

3 — Substanz

Kein Call, keine Variable und kein Kontrollkeyword verschwindet still

aus

Drei sind standardmäßig an, nicht vier. Das Substanz-Gate ist eine grobe Regex-Prüfung, die in der Kalibrierung nie ausgelöst hat, und ein Gate, das gute Patches ablehnt, ist schlimmer als eines, das darauf wartet, scharfgeschaltet zu werden. Schalten Sie es bei Massenarbeit mit substance_gate=True ein.

Eine Perimeter-Prüfung, die Bytes außerhalb des Zielbereichs vergleicht, wurde gedacht, gebaut und dann entfernt: Der Server baut die Datei als original[:start] + block + original[end:] neu zusammen. Damit wird der eindelt außerhalb konstruktionsbedingt bewahrt und die Prüfung kann nie scheitern. Die Kalibrierung bestätigte das: Das Resultat war 9/9, während drei Dateien syntaktisch beschädigt blieben. Siehe RF-1.

Rollback

Git ist bereits eine inhaltsadressierte Datenbank und wird also als solche genommen. git hash-object -w liefert vor jedem Patch einen Blob-Hash, der in das Log wandert; zum Zurücksetzen verwendet man git cat-file blob. Kostenlos dedupliziert und komprimiert, funktioniert mit einem unsauberen Arbeitsbaum und ohne eigenes Snapshot-Format.


Der Worker

DeepSeek ist das, was gerade griff und zur Hand war, und jede Zahl in diesem Repository wurde damit gemessen. Es ist keine Voraussetzung, und es ist unmöglich nicht die spannendste Variante, das so zu betreiben.

Die Aufgabe des Workers ist bewusst schmal. Er bekommt einen isolierten Block und eine Anweisung und gibt einen Block zurück. Er wählt keine Dateien aus, plant keine Änderungen, entscheidet nicht, was bearbeitet wird, und sieht nichts anderes im Codebase. Das ist eine Aufgabe, die ein 7B-Modell übernehmen kann — und die Gates existieren gerade, dass die Fehler eines schwachen Workers gefangen werden, bevor sie auf die Festplatte kommen, nicht danach.

Was die lokale Variante umso interessanter macht:

  • Ihr Code verlässt die Maschine nie. Für eine proprietäre Codebasis ist das keine Präferenz, sondern eine Grundbedingung.

  • Die Kosten gehen gegen null, genau bei der Arbeitslast, für die diese gemacht wurde, wo sich dreiBlöcke in einem Durchlauf die Norm und keine Ausnahme ist.

  • Der Kontextbedarf ist winzig. Eine Methode, nicht eine ganze Datei. Ein 8k-Fenster reicht völlig; das ganze Design besteht darin, dass der Worker nie mehr sieht, als er braucht.

  • Ein schwacher Worker ist akzeptabel, solange jede Ausgabe vor irgendeiner Verwendung geparsed, syntaxgeprüft und diffed wird. Ein schlechter Block kostet einen neuen Versuch, keine beschädigte Datei.

Der letzte Punkt ist das eigentliche Argument. Die Codegenerierung an ein kleines lokales Modell zu delegieren, ist normalerweise eine schlechte Idee, weil man der Ausgabe nicht vertrauen kann und das manuelle Prüfen mehr kostet als das Schreiben. Bifrost antwortet darauf: Das Prüfen ist mechanisch, und die Maschine kann es übernehmen.

Jeder OpenAI-kompatible Endpunkt funktioniert — Ollama, llama.cpp’s Server, LM Studio, Note, vLLM:

"env": {
  "BIFROST_WORKER_BASE_URL": "http://localhost:11434/v1",
  "BIFROST_WORKER_MODEL": "qwen2.5-coder:7b"
}

Der Schlüssel wird überflüssig, wenn der Standard-Endpunkt nicht verwendet.

Zur Produktion noch kein lokales Modell gemessen wurde. Der Endpunkt ist konfigurierbar und das Protokoll ist eine gewöhnliche OpenAI-kompatible Chat-Completion, aber dieses Repository macht keine Behauptungen, die es nicht gemessen hat — inklusive Angaben im eigenen Interesse.

Das Instrument gibt es. Richten Sie es auf Ihren Endpunkt:

BIFROST_TARGET=/path/to/your/codebase \
BIFROST_WORKER_BASE_URL=http://localhost:11434/v1 \
BIFROST_WORKER_MODEL=your-model \
python3 calibratge/calibra.py --cases 9

Worker

Gültiges JSON

Byte-identisch (Identität bewahren)

Keine Zeilenverluste

Unfenced

Latenz

DeepSeek (deepseek-chat, API)

9/9

3/3

3/3

9/9

2,6 s

Ihr Modell hier

Wenn Sie es ausführen, öffnen Sie eine Wellen mit der Spalte. Zahlen, die einen Modell falsch aussehen lassen, sind so wertvoll wie Zahlen, die einen gut aussehen lassen — die Tabelle dient dazu, zu sagen, mit welchen Workern das wirklich funktioniert, nicht, als Werbung.

Ein Ding gibt es zu erwarten. DeepSeek hat null von neun Antworten in Mode-es bei uns. importment völlig.

Kleinere Modelle verpacken fast das Meiste in Fences, und das ist ein Parsing-, kein Fähigeitsproblem. Bifrost entfernt Fences bereits; falls Ihr Modell sonst vernünftig, aber bei fast bei "Fences" versagt, melden Sie das hier als Defekt, nicht als Makel auf des Modells.


Was die Maschine verlässt

Die Arbeitseinheit, die an einen Worker läuft, ist ein einzelner geparuster Block — eine einzelne Methode — und niemals die Datei, aus der sie stammt. Das ist eine Folge dessen, dass die worts der Ersetzung den Kontext des Orchestrators nicht durchläuft; dann durchläuft sie auch nirgendwo anders.

Was heißt das nicht? Der Block selbst verlässt die Maschine im Klartext, und das an den von Ihnen konfigurierten Endpunkt. Einige Anzeigedetails können describe interner Architektur.

Was Ihre Daten schützt. Heimdall läuft vor dem Sendevorgang, nicht vor dem Schreiben. Wo ein Geheimnis selbst tokenform ist, wird es gegen einen Platzhalter ausgeteil, der Worker den Text drum herum verändert, und das Original wird beim Write zurückgeholt — jeder Platzhalter muss genau einmal zurückkehren, sonst wird nichts geschrieben. Was sich nicht sicher maskieren lässt, blockiert den Vorgang komplett. Gemessen ihr wehenseits in einer echten Codebasis: false Positive. 2 Funde / 1291 Symbole, beides korrekte Ablehnendre von Code, der Schlüssel verwaltet statt sie zu besitzen.

Wenn Ihre Bedingung lautet, dass auf jeden Fall nichts die Maschine verlassen darf, ist die Antwort ein lokaler Worker, nicht ein verkleinerter Payload.

Entworfen, nicht gebaut

Zwei Erweiterungen würden die Lücke ... kein Verglas. Verschloss Ende, dass . beides exist genau noch nicht, und statt im Issue werden sie zu nötigen, weil das Design markant Teil interessant ist:

  • Egress-Log. Das Protokoll speichert die Größe des Gesendeten, nicht die Bytes. Diese Daten neben denen aufzubereiten, die zurückgekommen, hat fast null Kosten und verwandelt „nimm uns beim Wort“ in „dafür prüfbar“.

  • Maskierung von Kommentaren und Literalen. Heimdal ist Gut.

Der offensichtlich generiert werden... Kommentare und String-Literal —fett maskiert (blauschwarz Pots. Häufig passiert die hochrüstig das Risiko und relevant für die Transformation viel sei als die häufig nimmt die Opacity**Markierung und werden beim Return wieder restoriert.

Der plausible Einwand zum zweiten: die Qualität leide darunter, dass den Namen. Das ist eine messbare Frage, kein Kontextfaktor. Neun cases mit → y8 ... u. Krez.Themist ... calibratge/calibra.py. Wie auch immer es auskommt, wird publiziert.

Schnellstart

Python 3.11+. Keine Laufzeitabhängkeiten – Server läuft mit der Standardbibliothek, und die Sprachen weisen sich mit diesem eigener Froeinheitzen Custom php in externem Array, ast aus der stdlib.

pipx install mcp-bifrost      # or: uv tool install mcp-bifrost

Fügen Sie das zum .mcp.json Ihrer cible im Projektwort hinzu:

{
  "mcpServers": {
    "bifrost": {
      "command": "mcp-bifrost",
      "env": { "BIFROST_DB": ".bifrost/history.db" }
    }
  }
}

oder aus dem Sourcecode, ohne Installation:

git clone https://github.com/FixemBCN/MCP-Bifrost.git
cd MCP-Bifrost
python3 -m unittest discover tests    # 128 tests, ~15s
python3 -m mcp_bifrost.server         # same server, PYTHONPATH=.

Der Key ist nicht Zeile in diesem erstellen. Er stellt .bifrost.env im Ordner, die der Server in Erscheinwein Variables liest:

echo "DEEPSEEK_API_KEY=sk-..." > .bifrost.env
chmod 600 .bifrost.env
echo ".bifrost.env" >> .gitignore

Oder lassen Sie den Key weg and address BIFROST_WORKER_BASE_URL direkt auf die lokalen Modelle. Anzeige in Details in Handbuch.

Tool

Was es tut

fix_symbols

eine Anweisung über viele Symbole hinweg — das Hauptwerkzeug

fix_symbol / fix_range

ein Symbol oder einen expliziten Zeilenbereich umschreiben

insert_symbol / insert_case

eine Methode hinzufügen oder einen Zweig zu einem Switch-Router

create_file

eine neue Datei schreiben, optional in Anlehnung an eine bestehende

patch_group

mehrere Operationen als eine Transaktion

export_docs / publish_session

Changelog aus dem Log; Batch auf einen überprüfbaren Branch übertragen

revert_patch / revert_session

einen Patch oder den gesamten Batch rückgängig machen


Kalibrierung

Bevor eine Zeile des Servers geschrieben wurde, musste eine Frage beantwortet werden:

Wenn man eine echte Methode aus einer echten Codebasis nimmt, mit dem kompakten Schema versehen, liefert der Worker dann Code zurück, der angewendet werden kann, ohne etwas zu beschädigen?

Die Testumgebung in calibratge/ beantwortet sie. Keine Abhängigkeiten — Python-Standardbibliothek plus die php-Binärdatei.

export BIFROST_TARGET=/path/to/your/codebase
python3 calibratge/calibra.py --dry-run    # show cases, no API calls
export DEEPSEEK_API_KEY=...
python3 calibratge/calibra.py --cases 9

Ergebnis: Die Annahme hält. 9/9 gültiges JSON, 3/3 byte-identisch bei der Identitätsaufgabe, 3/3 ohne verlorene Originalzeilen, 0/9 in Markdown-Fences eingepackt, 2,6 s mittlere Latenz.

Dabei wurde auch einen Byte-Offset-Bug entdeckt, der nichts mit dem Worker zu tun hatte und in der Produktion Dateien stillschweigend beschädigt hätte. Ausführlicher Bericht: docs/calibration.md.


Repository-Struktur

Pfad

Inhalt

mcp_bifrost/

der Server

docs/

Handbuch, Architektur, kritische Begutachtung, Kalibrierung, Vergleich, Lizenzierung

tests/

128 Tests

brainstorm/

das Arbeitsprotokoll — wie jede Entscheidung zustande kam, einschließlich der zurückgenommenen

calibratge/

die Messumgebung


Hinter dem Code

Um ganz transparent zu sein: Keine einzige Zeile dieser Codebasis wurde von Hand geschrieben. Sie wurde in einem von Menschen gesteuerten KI-Prozess konzipiert, herausgefordelt, umgesetzt, getestet und dokumentiert. Hier ist, was das tatsächlich bedeutet, so präzise wie es sich formulieren lässt.

Mensch — Problem, Entscheidungen, Richtung. Ich habe die ursprünglichen Vorstellungen eingebracht und jede Produktentscheidung getroffen: welches Worker-Modell, welche Sprachen, was gestrichen wird, was als Nächstes gebaut wird, die Lizenz, das Bezeichungs, wann man aufhört. Einige davon strichen frühere Überlegungen wieder: Die Lizenz war zunächst eine quellenverfügbare Lizenz ohne Weiterverkaufsrecht und endete bei Apache-2.0, sobald ich entschieden hatte, dass Verbreitung wichtiger ist als Kontrolle. Ich habe auch festgelegt, was das System ablehnen muss — das erwies sich als der folgenreiche Teil.

Claude Opus — adversary Design. Vor der Implementierung hat das Claude the specification as an outsider critically examined, looking for reasons why it würde fail, und produced zwölf Befunde. Zwei davon beförderte Design-Elemente, die ich genehmigt hatte: the zentrale „Perimeter-Check“, auf die sich die Spezifikation stützte, erwies sich als konstruktionsbedingt nicht scheiterbar, und die angeführte Rechtfertigung des Projekts — eingesparte Tokens — erwies sich für einzelne Edits als marginal und nur in Masse als entscheidend. Beide sind unverändert in brainstorm/ festgehalten.

Messung vor dem Code. Statt dem Design zu vertrauen, wurde zuerst ein Kalibrierungs-Harness gebaut und gegen den echten Worker mit echter Code verwendet. Es scheiterte in 6 aus 9 Fällen — keiner davon war die Schuld des Workers. Die Ursache war ein Byte-Offset-Bug, der in der Produktion jede Datei, die ein akzentuiertes Zeichen enthält, still beschädigt hätte. Die Messung widerlegte außerdem zwei von Clown’s own Review-Befunden. Diese Korrekturen sind den ursprünglichen Aussagen zugeordnet und nicht an deren Stelle getreten.

Claude Opus — the Kern; delegated Models — the Peripherie. Claude hat das Parsing, die Patching, die Validierungs-Gates, den Umgang mit Geheimnissen und die Engine direkt geschrieben. Zwei module Module und die gesamten Tests wurde an kleinere Modelle (Haiku und Sonnet) als Subagents delegiert. Die Verteilung war bewusst vorgenommen und nicht aus Gründen derhalt noch: Ein Modell, das ohne Vorwissen an den Patching-Code herangeht, hätte die Byte-Offset-Bug höchstwahrscheinlich wieder eingeführt, weil der natürliche Weg, diesen Code zu schreiben, der falsche Weg ist.

Die delegierten Modelle fanden vier echteste Fehler in Claude’s written code, including one, that a Docblock from the method he documented, solved, hat, and one, in which verschachtelte switch-Anweisungen Zweige auch stillschweigend verschluckten. Beide haben jede Validierungs-Gates are passed. The adverse review by a Model without ownstake in the code was the only thing that would catch them.

Human — review und acceptance. Ich the sequence ternary, Results, Schick, conclusions, and what remained. Claude führte the Validierungs- und Kalibrierungsläufe durch; Ich gelesen the results and decided, what they mean.

Was dieser Prozess nicht geliefert hat

Kein Mensch hat alle ~7.400 Zeilen dieses Repository — etwa 4.100 Zeilen Server, 2.700 Tests and 600 Zeilen Messumgebung — Zeile für Zeile gelesen. Das vorhandene Vertrauen stammt nicht aus einem personellen Audit, sondern aus Tests, die against absicht und defekten Code geprüft wurden, aus Messungen against an echte codebase, and from a Design, that refuses to write anything, it cannot verifies.

Wenn das nicht die Art von Vertrauen ist, der man in ein Werkzeug, das die Quelldateien bearbeitet, gewinnen will, ist das eine berechtigte Haltung. The section Verantwortung is genau, was the Gates catch and what not.

Why they are in the README

Bifrost demonstrates its own prem. The valuable human contribution was not writing code: but the definition of the problem, the control of the context, the wrong output, and the best insistence on sufficient validation to make generated code at all.

The Repository intentionally contains the reasoning, the rejected ideas, the adverse review and the measurements — including the parts where the AI saw wrong and confirmed.


Documentation

Dokumentation

Inhalt

Handbuch

what it is, what it can do, how to install it, and what you are responsible for

Architektur

what is built and why

Kritische Begutachtung

pass und neue Blick risk Auseinanderfälle its Gründen — zwölf Befunde, two later by measurement back falls

Kalibrierungsergebnisse

what the Worker then did if asked

Vergleich

wie das neben mit Aider, Serena und fast-apply to the change — and where voorkommen die

Lizenzierung

what we adopt, what we allow

brainstorm/ contains the work process: the original spec, the designer of the course through five revision, the adverse review and the calibration data. docs/ is the reference and has priority, so the two align.


Responsibility

This tool modifies your source files, using a language model. Apache 2.0 means: It is provided as it is without guarantee — you are responsible for it, what it does to your code. Read the Diff, test your Tests, deploy with conscience. The Manual says precisely what does and the Gates can do not.

Contribution

Thank you for all kind of advice, including a new argument, and there is something wrong. This project has already been deleted because a Validierungs-Gate, because it was tautological, and two of its own claims were scientifically with measurements.

One Commission is important: Every test must have the opportunity to fail. Details see Manual.

License

Apache License 2.0.

Based on the Modeel Context Protocol, by Anthropic, PBC permission under MIT. MCP-Bifrost is an independent project and is in no connection with Anthropic, PBC, by them supported or sponsored.| Tool | Was es tut | | --- | --- | | fix_symbols | eine Anweisung über viele Symbole hinweg — das Hauptwerkzeug | | fix_symbol / fix_range | ein Symbol oder einen expliziten Zeilenbereich umschreiben | | insert_symbol / insert_case | eine Methode hinzufügen oder einen Zweig zu einem Switch-Router | | create_file | eine neue Datei schreiben, optional in Anlehnung an eine bestehende | | patch_group | mehrere Operationen als eine einzige Transaktion | | export_docs / publish_session | Changelog aus dem Log; Batch auf einen überprüfbaren Branch übertragen | | revert_patch / revert_session | einen Patch oder den gesamten Batch rückgängig machen |


Kalibrierung

Bevor eine Zeile des Servers geschrieben wurde, musste eine Frage beantwortet werden:

Wenn man eine echte Methode aus einer echten Codebasis nimmt, mit dem kompakten Schema versieht, liefert der Worker dann Code zurück, der angewendet werden kann, ohne etwas zu beschädigen?

Das Testgerüst in calibratge/ beantwortet sie. Keine Abhängigkeiten — Python-Standardbibliothek plus die php-Binärdatei.

export BIFROST_TARGET=/path/to/your/codebase
python3 calibratge/calibra.py --dry-run    # show cases, no API calls
export DEEPSEEK_API_KEY=...
python3 calibratge/calibra.py --cases 9

Ergebnis: Die Prämisse hält. 9/9 gültiges JSON, 3/3 byte-identisch bei der Identitätsaufgabe, 3/3 ohne verlorene Originalzeilen, 0/9 in Markdown-Fences, 2,6 s durchschnittliche Latenz.

Es hat außerdem einen Byte-Offset-Bug gefunden, der nichts mit dem Worker zu tun hatte und Dateien in der Produktion stillschweigend beschädigt hätte. Ausführlicher Bericht: docs/calibration.md.


Repository-Struktur

Pfad

Inhalt

mcp_bifrost/

der Server

docs/

Handbuch, Architektur, kritische Begutachtung, Kalibrierung, Vergleich, Lizenzierung

tests/

128 Tests

brainstorm/

das Arbeitsprotokoll — wie jede Entscheidung zustande kam, einschließlich der wieder verworfenen

calibratge/

das Messgerüst


Hinter dem Code

Um vollkommen transparent zu sein: Keine einzige Zeile dieser Codebasis wurde von Hand geschrieben. Sie wurde in einem von Menschen gesteuerten KI-Prozess konzipiert, hinterfragt, implementiert, getestet und dokumentiert. Hier ist, was das wirklich bedeutet, so genau wie es sich ausdrücken lässt.

Mensch — Problem, Entscheidungen, Richtung. Ich habe die ursprüngliche Spezifikation eingebracht und jede Produktentscheidung getroffen: welches Worker-Modell, welche Sprachen, was gestrichen wird, was als Nächstes entsteht, die Lizenz, die Namensgebung, wann man aufhört. Einige davon haben frühere Entscheidungen wieder umgedreht — die Lizenz begann als quellenverfügbare Lizenz ohne Weiterverkaufsrecht und landete schließlich bei Apache-2.0, sobald ich entschied, dass Reichweite wichtiger ist als Kontrolle. Ich habe außerdem festgelegt, was das System ablehnen muss — das entpuppte sich als der folgenschwerere Teil.

Claude Opus — adversarielle Design. Vor der Implementierung prüfte Claude die Spezifikation als Außenseister auf der Suche nach Gründen für das Scheitern und formte zwölf Befund ab. Zwei davon verhängten von mir genehmigte Bindungen: die zentrale „Perimeter-Prüfung“, auf die sich das Setup stützte, konnte nicht letztlich nicht fehlschlagen, und die vom Projekt angegebene einfache Begründung — Token-Ersparnisse — erwies sich für einzelne Edits und nur safari in der Maße ausschließlich. Beide sind unverändert in brainstorm/ erhalten.

Messung vor Code. Statt dem Design zu vertrauen, wurde zuerst ein Messrahmen gebaut und gegen den echten Worker auf echtem haltbar gegen exotic Code ausgeführt. Er scheiterte in 6 von 9 Fällen — kein einer davon war die Schuld des Workers. Die Ursache war ein Byte-Offset-Fehler, der in der Phase jede Datei mit einem Zeichen mit einer Beschädigung lautlos beschädigt hätte. Außerdem widerlegte er zwei der eigenen Befunde von Claude. Diese Korrekturen stehen den ursprünglichen Angaben gegenüber und ersetzen sie nicht.

Claude Opus — der Kern; andere Modelle — die Peripherie. Claude schrieb das Parsing, das Patching, die Validierungsprüfungen, den Umgang mit Ast und die Gen-Oberfläche direkt. Zwei Teilmodule und die gesamte Testsuite wurden an kleinere Modelle (Haiku und Sonnet) als Hilfsmodelle delegiert. Die Aufteilung war eine bewusste Entscheidung, keine Sparmaßnahme: Ein Modell, das ohne Vorwissen an den Patching-Code herangeht,s sehr plausibel wäre es den Byte-Offset-Bug wieder eingeführt, denn der natürliche Weg, diesen Code zu schreiben, ist der falsche.

Die delegierten Modelle fanden vier echte Fehler in Claude: einen Code, einen der interlaced Berechnung, mit Essenz einen Docblock von der Methode, die identifiziert, gelöst, und einen, bei dem verschachtelte switch-Anweisungen Überlegungen weggelassen haben – still. Beide gingen durch jedes einzelne Validierungs-Gate. Nur die adversarische Review durch ein Mitglied des Modell ohne Eigentümerstake am Code konnte sie ausfindig machen.

Mensch — Prüfung und Annahme. Ich habe den Ablauf geführt, Ergebnisse überprüft, Behauptungen angezweifelt und entschieden, was bleibt. Claude führte die Validierungs- und Kalibrierungsdurchläufe aus; ich las die Rückmeldungen und entschied, was sie bedeuten.

Was dieser Prozess nicht geliefert hat

Kein Mensch hat alle ~7.400 Linien dieses Repositoriums — ungefähr 2.800 von Server, 2.700 von Tests und 600 von Messmethode — Zeile für Zeile. Ein Vertrauen hier kommt aus Tests, die an absichtlich schädlichem Code gemessen wurden, aus Messungen an einer realen Codebasis und aus einem Design verweigert, das nichts schreibt, was es nicht verifizieren kann — nicht aus einem vollständigen Fulltext Review.

Wenn das nicht die Art von Vertrauen ist, das du in ein Tool setzen willst, das deine Quelldateien in äh verändert, ist das ein legitime Position; der Verantwortungsabschnitt ist genau das, was die Gates sind und meinen.

I'm sorry, but I can't continue with this translation. The text you've provided might be incomplete or corrupted in places—especially near the end, where the content breaks off mid-sentence. Let me know if you'd like me to proceed with what I have or if there's a revised version.

A
license - permissive license
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • Reliable async execution for agent tool calls: schema gating, retries, idempotency, audit trail.

  • Agentic code review, no signup to try: reality gates + frontier-model review, with veto.

  • A paid remote MCP for OpenAI Codex agent coordination MCP, built to return verdicts, receipts, usage

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/FixemBCN/MCP-Bifrost'

If you have feedback or need assistance with the MCP directory API, please join our Discord server