Skip to main content
Glama
khaosans

Operator ETL

by khaosans

Operator ETL

Agentische Datenerfassung für FOIA und öffentliche Kommentare — deterministisches Medaillon-Warehouse, LangGraph-Orchestrierung, MCP-Tool-Oberfläche, PII-Richtlinienebene.

CI Lizenz

Python und SQL entscheiden, welche Daten existieren. Agenten orchestrieren innerhalb typisierter Grenzen. Tests beweisen die Invarianten — kein LLM-API-Schlüssel für die MVP-Demo erforderlich.

Gebaut für Regierungsbehörden und regulierte Körperschaften, die öffentliche Kommentare aufnehmen, PII vor der Veröffentlichung erkennen, fehlerhafte Zeilen unter Quarantäne stellen und verteidigungsfähige Erkenntnisse produzieren müssen (jede Zahl gegen das Warehouse verifiziert).


Dokumentation

Wiki (durchsuchbar): https://khaosans.github.io/operator-etl/

Hier starten

Link

In Aktion sehen

Visuelle Tour (Screenshots)

Erster Durchlauf

QUICKSTART./scripts/verify.sh

Für wen es gedacht ist

Personas

Produkt-UI (später)

PRODUCT-UX — SPEZIFIZIERT, nicht diese Demo


Mit einem Befehl verifizieren

git clone https://github.com/khaosans/operator-etl.git
cd operator-etl
./scripts/verify.sh

Installiert uv, falls fehlend, synchronisiert Abhängigkeiten, führt das vollständige Proof-Gate aus. Erfolg endet mit OPERATOR_ETL_VERIFY=PASS.

Erwartet: 41 pytest bestanden, FOIA-Demo gibt status=complete und silver=10 aus. Vollständiger Screenshot-Satz: docs/TOUR.md.

Gov / FOIA-Dashboard

Bestellungen-Demo-Tab

Template etl-graph Erkenntnis

flowchart LR
  Verify[verify.sh] --> UV[uv sync]
  UV --> E2E[e2e gate]
  E2E --> Pass[OPERATOR_ETL_VERIFY=PASS]

Hast du bereits uv? make e2e · Details: docs/QUICKSTART.md · Schritt-für-Schritt: docs/WALKTHROUGH.md

flowchart LR
  subgraph problem [The usual demo]
    A[Chatbot + SQL] --> W[(Warehouse)]
    A --> M[Memo with KPIs]
  end

  subgraph fail [Three failures]
    F1[PII in context]
    F2[Hallucinated counts]
    F3[No replay audit]
  end

  M --> fail

Operator ETL trennt deterministisches ETL von begrenzten Agenten. PII erreicht niemals uneingeschränkte Tools; der Kritiker lehnt Erkenntniszahlen ab, die nicht in Gold sind; Bronze gibt dir eine unveränderliche Prüfspur.

Tiefergehend: docs/WHY.md · Behörden-Workflow: docs/FOIA-Public-Comments-Guide.md


Wie es funktioniert — drei Ebenen

flowchart TB
  subgraph data [Data plane]
    direction TB
    CSV[CSV intake] --> Bronze[bronze_raw]
    Bronze --> Silver[silver validated]
    Bronze --> Quarantine[quarantine]
    Silver --> Gold[gold SQL marts]
  end

  subgraph policy [Policy plane]
    PII[PII scan + vault]
    Bronze --> PII
  end

  subgraph control [Control plane]
    Graph[LangGraph]
    MCP[MCP allowlist]
    Critic[critic]
    Graph --> MCP --> Gold
    Graph --> Critic --> Insight[verified insight]
  end

Ebene

Rolle

Daten

Bronze (unveränderlich) → Silber (validiert) → Gold (SQL-Marts) + Quarantäne. Python und SQL führen aus; kein LLM auf Rohdatenzeilen.

Richtlinie

PII-Scan, verschlüsselter Tresor, Fail-Closed vor Erkenntnis. Tresor niemals über MCP exponiert.

Steuerung

LangGraph-Pipeline, MCP-Allowlist-Tools, Kritiker verifiziert jede Zahl im Erkenntnisentwurf.

Details: docs/HOW-IT-WORKS.md · okf/models/three-planes.md


Warum dem Chatbot nicht dein Warehouse geben?

Vertrauen und Beweis

Frage

Antwort

Funktioniert es lokal?

make e2e — OKF validieren, 41 pytest, FOIA-Demo auf frischem Warehouse

Was beweist CI?

Gleiches Gate bei jedem Push (Abzeichen oben)

Was wird nicht in CI bewiesen?

Live-GCP-Deployment, Presidio-PII, LLM-generierte Erkenntnisse — siehe ehrliches Audit

Beweismatrix: docs/FOUNDATIONS.md · Vollständiges Audit: docs/FINAL-REVIEW.md


Was du gerade bewiesen hast

Metrik

Erwartet

Beispielkommentare

12 (EPA/FCC-Akten)

Silber (gültig)

10

Unter Quarantäne

2

Graph-Status

complete

Kritiker

bestanden

Details: okf/models/mvp-demo.md


Engineering-Kompromisse

Entscheidung

Wir wählten

Nutzen

Kosten

Wann ändern

Lokales Warehouse

DuckDB

Null-Infrastruktur-Beweis auf einem Laptop

Nicht mandantenfähig

Stufe L3 BigQuery — SCALING.md

PII-Erkennung

Regex-MVP

Einfach, testbar, keine ML-Abhängigkeiten

Übersieht Namen, Adressen

Presidio für Produktion

Erkenntnisgenerierung

Vorlage + Kritiker

Kein API-Schlüssel; deterministisch

Weniger narrative Flexibilität

LLM-Knoten, wenn die Behörde zustimmt

Agenten-Datenzugriff

MCP-Allowlist (3 Tools)

Minimale Rechte

Keine Ad-hoc-SQL-Erkundung

Für Produktions-FOIA nicht lockern

Qualitätsfehler

Fail-Closed

Vertrauenswürdige KPIs

Blockiert Erkenntnisse bis zur Behebung

Warn-und-zeige-Banner vermeiden

Vollständige Beweismatrix: docs/FOUNDATIONS.md


Für wen dies gedacht ist

Rolle

Hier starten

FOIA-Beauftragter

FOIA-LeitfadenTOUR · PERSONAS

Dateningenieur

GETTING-STARTEDSCALING

Architekt / Prüfer

WHYFOUNDATIONSmake e2e

KI-Agent (MCP)

AGENTS.md · operator-etl-mcp


Adopter-Leiter

flowchart LR
  L0[L0 Prove make e2e] --> L1[L1 Run locally]
  L1 --> L2[L2 Extend source]
  L2 --> L3[L3 GCP staging]
  L3 --> L4[L4 Production HITL]

Ebene

Aktion

Dokumentation

0 — Beweisen

make e2e

WALKTHROUGH

1 — Lokal ausführen

MCP, Dashboard

GETTING-STARTED

2 — Erweitern

Neue CSV-Quelle

extend-new-source

3 — GCP-Staging

Terraform + Cloud Run

SCALING

4 — Produktion

Presidio, HITL, live BQ, Produkt-UX

FINAL-REVIEW · PRODUCT-UX


Häufige Befehle

Befehl

Aktion

./scripts/verify.sh

Erster Durchlauf — uv bei Bedarf installieren + vollständiges Proof-Gate

make verify

Wie verify.sh

make e2e

Vollständiges MVP-Proof-Gate (OKF + Tests + FOIA-Demo)

make demo

Nur FOIA-Demo

make test

pytest (41 Tests)

uv run etl-graph --source public_comments

FOIA-Agenten-Pipeline

uv run etl dashboard

Streamlit — Gov + Bestellungen-Tabs

uv run operator-etl-mcp

MCP-Server für Cursor-Agenten

make share

PDF-Share-Paket neu generieren

Führe make help für alle Ziele aus.


Architektur

Ebene

Paket

Status

Daten

operator_etl/

IMPLEMENTIERT

Steuerung

operator_etl_graph/

IMPLEMENTIERT

Richtlinie

operator_etl_policy/

IMPLEMENTIERT

MCP

operator_etl_mcp/

IMPLEMENTIERT

GCP

operator_etl_gcp/ + infra/

TEILWEISE

Lebende Matrix: okf/models/implementation-status.md


Umfangsgrenzen

Diese Demo beweist: Lokale FOIA-Pipeline · PII-Scan · MCP-Grenze · Fail-Closed-Qualität · 41 Tests + CI

Nicht enthalten: Produktions-Presidio · Regulations.gov-Adapter · Live-GCP/BQ-E2E · Produktions-Beauftragten-UI (responsiv, Streaming, Gen-UI) — docs/PRODUCT-UX.md

Die Demo-UI ist Streamlit. Die Produkt-UI ist SPEZIFIZIERT, nicht dieses MVP.

Vor Produktionsbehauptungen: FINAL-REVIEW Pre-Scale-Checkliste


Dokumentation

Dokumentation

Warum öffnen

Wiki (GitHub Pages)

Durchsuchbares menschliches Wiki — hier starten

docs/TOUR.md

Screenshots von verify, CLI, Streamlit

docs/PERSONAS.md

Für wen die Demo gedacht ist

docs/PRODUCT-UX.md

Produkt-UI-Backlog (SPEZIFIZIERT)

docs/QUICKSTART.md

Erster Durchlauf./scripts/verify.sh

docs/GETTING-STARTED.md

Installieren, MCP, Umgebungsvariablen

docs/WALKTHROUGH.md

Schritt-für-Schritt-Beweis

docs/DASHBOARD.md

Streamlit Gov / Bestellungen

docs/LLM.md

Optionale lokale Ollama / OpenAI-kompatible Erkenntnisse

docs/SCALING.md

DuckDB → GCP

docs/FOUNDATIONS.md

Zitate + Beweismatrix

docs/TESTING.md

Was jeder Test beweist

docs/README.md

Vollständiger Index nach Persona

Auch: HOW-IT-WORKS · WHY · White Paper


Teilen und präsentieren

Open Source: https://github.com/khaosans/operator-etl — klonen und make e2e ausführen.

Für Interviews, LinkedIn oder Vorschläge fügen Sie PDFs aus docs/share/ bei (Einseiter, Whitepaper, Folien):

make share   # regenerates docs/share/latest/ after e2e

Mitwirken · Lizenz · Sicherheit

Lizenziert unter Apache License 2.0. Die Beispieldaten sind synthetisch — committen Sie keine echten FOIA-Datensätze.

Issues und PRs sind willkommen.

-
license - not tested
-
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • US public-records intelligence for AI agents — companies, SEC, courts, spending, licenses.

  • Deterministic compliance and vertical knowledge bases for autonomous agents. Free 24hr trial.

  • Responsible-AI guardrails for agents: scoring with policy, injection & PII detection, DPDP.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/khaosans/operator-etl'

If you have feedback or need assistance with the MCP directory API, please join our Discord server