Skip to main content
Glama

Universal Data Refinery


🌟 Зачем нужен Data Refinery?

В зарождающемся Agent Internet ИИ-модели и автономные агенты (Claude, Cursor, OpenAI Agents, пользовательские боты) испытывают голод по чистым, структурированным, реальным и детерминированным данным. Сырой веб-скрапинг зашумлен, требует больших затрат токенов и подвержен галлюцинациям.

Universal Data Refinery превращает беспорядочную, фрагментированную веб-документацию, страницы с ценами, муниципальные кодексы и журналы релизов в строгий, проверяемый по схеме JSON с автоматическим семантическим сравнением и получением данных на периферии за доли секунды.


🚀 Встроенные домены переработки

1. 📦 Экосистема разработчиков и критические изменения

  • Извлекает: затронутые символы, статус удаления или устаревания, изменения сигнатур и точные фрагменты миграции кода.

  • Решает: галлюцинации ИИ-ассистентов по поводу устаревшего синтаксиса и обновлений SDK с критическими изменениями.

2. 💰 B2B SaaS, облачные и API-тарифы

  • Извлекает: нормализованные ежемесячные/годовые цены, включенные квоты, тарифы на основе использования, скрытые условия контрактов и плату за превышение.

  • Решает: автономные закупки и расчеты сметы затрат для ИИ-агентов.

3. 🏛️ Локализованная нормативная и комплаенс-аналитика

  • Извлекает: муниципальные постановления, разрешения на краткосрочную аренду, правила зонирования, обязательные сроки и штрафы.

  • Решает: юридические и деловые комплаенс-исследования без ручного труда помощника юриста.

4. 🌐 Универсальный веб-переработчик по запросу

  • Извлекает: подайте любой URL + пользовательский промпт на лету. Workers AI извлекает строгий JSON, проверяет его через Zod, вычисляет различия и сохраняет в D1 SQL.


🏗️ Архитектура

[ Raw Web Sources ] ──► [ Cloudflare Worker Pipeline ]
                              │
                              ├── 1. Ingest (Scheduled Cron / Webhooks)
                              ├── 2. HTML to Dense Markdown Sanitizer
                              ├── 3. Workers AI (Llama 3.3 / Mistral) Structured Extraction
                              ├── 4. Semantic Diffing Engine (Delta Classification)
                              └── 5. BGE Vector Embeddings (Vectorize Index)
                              │
                              ▼
                [ Cloudflare D1 SQL + Workers KV ]
                              │
             ┌────────────────┴────────────────┐
             ▼                                 ▼
   🤖 MCP Server for AI Agents        ⚡ REST / OpenAPI Endpoints
   (Claude Desktop, Cursor, etc.)     🖥️ Refinery Studio (Pages UI)

💻 Начало работы

Предварительные требования

  • Node.js 20+

  • Cloudflare Wrangler CLI (npm install -g wrangler или через npm-скрипты)

Установка

# Clone & install dependencies
npm install

# Build shared schema
npm run build --workspace=packages/schema

# Apply local D1 database migrations with demo seed data
npm run db:migrate:local

Запуск локально

# Start Cloudflare Worker backend (port 8787)
npm run dev:worker

# Start Refinery Studio Web Dashboard (port 5173)
npm run dev:web

# Or run both concurrently:
npm run dev:all

🤖 Подключение ИИ-агентов через MCP (Model Context Protocol)

Добавьте refinery в ваш claude_desktop_config.json или .cursor/mcp.json:

{
  "mcpServers": {
    "data-refinery": {
      "url": "http://localhost:8787/mcp"
    }
  }
}

Доступные нативные инструменты:

  • refinery_dev_breaking_changes({ packageOrService, targetVersion, breakingOnly })

  • refinery_b2b_pricing_matrix({ companyOrProduct, category })

  • refinery_regulatory_compliance({ jurisdiction, topic })

  • refinery_semantic_search({ query, domain, topK })

  • refinery_refine_custom_url({ url, instructionPrompt })


📜 Лицензия

MIT

-
license - not tested
Not graded
quality - not tested
C
maintenance

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • Turn the web into structured, reliable, actionable enterprise data for AI Agents

  • Web search, page extraction and structured commerce, social and business data for AI agents

  • Enable language models to perform advanced AI-powered web scraping with enterprise-grade reliabili…

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/juanquy/AI-data-refinery'

If you have feedback or need assistance with the MCP directory API, please join our Discord server