Skip to main content
Glama

Universal Data Refinery


🌟 Warum Data Refinery?

Im aufkommenden Agent Internet hungern KI-Modelle und autonome Agenten (Claude, Cursor, OpenAI Agents, benutzerdefinierte Bots) nach sauberen, strukturierten, Echtzeit- und deterministischen Daten. Rohes Web-Scraping ist verrauscht, token-intensiv und anfällig für Halluzinationen.

Die Universal Data Refinery wandelt unübersichtliche, fragmentierte Webdokumentationen, Preisseiten, kommunale Vorschriften und Versionshinweise in strenges, schema-validiertes JSON mit automatischem semantischem Diffing und Sub-Sekunden-Edge-Abruf um.


🚀 Integrierte verfeinerte Domänen

1. 📦 Entwickler-Ökosystem & Breaking Changes

  • Extrahiert: Betroffene Symbole, Entfernungs- vs. Deprecation-Status, Signaturänderungen und exakte Code-Migrationsschnipsel.

  • Löst: Halluzinationen von KI-Codierungsassistenten bezüglich veralteter Syntax und Breaking-SDK-Upgrades.

2. 💰 B2B-SaaS-, Cloud- und API-Preismatrizen

  • Extrahiert: Normalisierte monatliche/jährliche Preise, enthaltene Kontingente, nutzungsbasierte Tarife, versteckte Vertragsklauseln und Übernutzungsgebühren.

  • Löst: Autonome Beschaffungs- und Kostenschätzungsberechnungen für KI-Agenten.

3. 🏛️ Lokalisierte Regulierungs- und Compliance-Intelligenz

  • Extrahiert: Kommunale Verordnungen, Genehmigungen für Kurzzeitvermietungen, Bebauungsregeln, verbindliche Fristen und Strafen.

  • Löst: Rechts- und Geschäftskonformitätsrecherche ohne manuellen menschlichen Paralegal-Aufwand.

4. 🌐 Universelle On-Demand-Web-Raffinerie

  • Extrahiert: Füge jede URL + benutzerdefinierten Prompt spontan hinzu. Workers AI extrahiert strenges JSON, validiert gegen Zod, berechnet Diffs und speichert in D1 SQL.


🏗️ Architektur

[ Raw Web Sources ] ──► [ Cloudflare Worker Pipeline ]
                              │
                              ├── 1. Ingest (Scheduled Cron / Webhooks)
                              ├── 2. HTML to Dense Markdown Sanitizer
                              ├── 3. Workers AI (Llama 3.3 / Mistral) Structured Extraction
                              ├── 4. Semantic Diffing Engine (Delta Classification)
                              └── 5. BGE Vector Embeddings (Vectorize Index)
                              │
                              ▼
                [ Cloudflare D1 SQL + Workers KV ]
                              │
             ┌────────────────┴────────────────┐
             ▼                                 ▼
   🤖 MCP Server for AI Agents        ⚡ REST / OpenAPI Endpoints
   (Claude Desktop, Cursor, etc.)     🖥️ Refinery Studio (Pages UI)

💻 Erste Schritte

Voraussetzungen

  • Node.js 20+

  • Cloudflare Wrangler CLI (npm install -g wrangler oder über npm-Skripte)

Installation

# Clone & install dependencies
npm install

# Build shared schema
npm run build --workspace=packages/schema

# Apply local D1 database migrations with demo seed data
npm run db:migrate:local

Lokal ausführen

# Start Cloudflare Worker backend (port 8787)
npm run dev:worker

# Start Refinery Studio Web Dashboard (port 5173)
npm run dev:web

# Or run both concurrently:
npm run dev:all

🤖 Verbinden von KI-Agenten über MCP (Model Context Protocol)

Fügen Sie die Raffinerie zu Ihrer claude_desktop_config.json oder .cursor/mcp.json hinzu:

{
  "mcpServers": {
    "data-refinery": {
      "url": "http://localhost:8787/mcp"
    }
  }
}

Verfügbare native Tools:

  • refinery_dev_breaking_changes({ packageOrService, targetVersion, breakingOnly })

  • refinery_b2b_pricing_matrix({ companyOrProduct, category })

  • refinery_regulatory_compliance({ jurisdiction, topic })

  • refinery_semantic_search({ query, domain, topK })

  • refinery_refine_custom_url({ url, instructionPrompt })


📜 Lizenz

MIT

-
license - not tested
Not graded
quality - not tested
C
maintenance

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • Turn the web into structured, reliable, actionable enterprise data for AI Agents

  • Web search, page extraction and structured commerce, social and business data for AI agents

  • Enable language models to perform advanced AI-powered web scraping with enterprise-grade reliabili…

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/juanquy/AI-data-refinery'

If you have feedback or need assistance with the MCP directory API, please join our Discord server