extracteur-documents
URL publique du serveur MCP
https://mcp-dernier-sofiane.onrender.com/mcp
Statut : https://mcp-dernier-sofiane.onrender.com/health
Extracteur de documents — Collecte, IA, MCP
Projet en trois parties, conformément à l'énoncé.
Partie | Fichier | Rôle |
1. Collecte sans IA |
| Récupère les articles mis en avant sur Wikipédia via l'API publique Wikimedia et les écrit en |
2. Structuration IA |
| Envoie le texte brut à OpenAI, valide la réponse avec zod, met le résultat en cache dans |
3. Serveur MCP |
| Expose les outils MCP aux clients IA (Claude Desktop, etc.) |
Source de données : https://api.wikimedia.org/feed/v1/wikipedia/en/featured/{AAAA}/{MM}/{JJ} (API publique, sans clé).
Installation
npm install
cp .env.example .env # puis renseigner OPENAI_API_KEYUtilisation
npm run collecte -- 7 # partie 1 : importe 7 jours d'articles dans data/
npm run extraction # partie 2 : structure tous les .txt et affiche le JSON
npm run extraction -- 1.txt # partie 2 : un seul fichier
npm run dev # partie 3 : serveur MCP en localVérification rapide : curl http://localhost:3000/health
Outils MCP exposés
Outil | Description |
| Liste les |
| Texte brut d'un fichier |
| Données structurées d'un fichier (via OpenAI) |
| Données structurées de tout le corpus |
| Recherche un terme dans les données structurées |
| Relance la collecte Wikimedia |
Schéma renvoyé par l'extraction :
{
"titre": "…",
"resume": "…",
"langue_source": "anglais",
"personnes": [], "lieux": [], "organisations": [],
"oeuvres": [], "dates": [], "themes": [],
"sentiment": "neutre"
}Connexion d'un client IA
Endpoint principal (Streamable HTTP) : https://<votre-domaine>/mcp
Endpoint SSE (clients plus anciens) : https://<votre-domaine>/sse
Configuration type pour un client local :
{
"mcpServers": {
"extracteur-documents": {
"command": "npx",
"args": ["-y", "mcp-remote", "https://<votre-domaine>/mcp"]
}
}
}Déploiement
Le serveur écoute sur process.env.PORT, il fonctionne tel quel sur Render, Railway ou Fly.io.
Build :
npm run buildStart :
npm startVariable d'environnement à définir :
OPENAI_API_KEY
Le système de fichiers de ces plateformes est éphémère : commitez le dossier data/
dans le dépôt git pour que le corpus soit présent au démarrage. Les extractions
générées en ligne (data/extrait/) seront perdues à chaque redéploiement, mais
seront simplement recalculées à la demande.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/YONKOYNK/mcp-dernier-sofiane'
If you have feedback or need assistance with the MCP directory API, please join our Discord server