extracteur-documents
Envoie les textes bruts à OpenAI pour en extraire des données structurées telles que titre, résumé, personnes, lieux, organisations, thèmes et sentiment.
Collecte les articles mis en avant de Wikipédia via l'API Wikimedia pour constituer un corpus de documents texte.
Click on "Deploy Server".
Wait a few minutes for the server to deploy. Once ready, it will show a "Started" state.
In the chat, type
@followed by the MCP server name and your instructions, e.g., "@extracteur-documentsListe les documents du corpus"
That's it! The server will respond to your query, and you can continue using it as needed.
Here is a step-by-step guide with screenshots.
Extracteur de documents — Collecte, IA, MCP
URL publique du serveur MCP
https://mcp-dernier-sofiane.onrender.com/mcp
Endpoint SSE (clients plus anciens) :
https://mcp-dernier-sofiane.onrender.com/sseStatut du service :
https://mcp-dernier-sofiane.onrender.com/health
Hébergé sur le plan gratuit Render : l'instance s'endort après une période d'inactivité. Le premier appel peut prendre 30 à 50 secondes, les suivants sont immédiats.
Related MCP server: Wikipedia MCP Server
Tester le serveur
Option 1 — Connecter le serveur à Claude
Dans Claude : Settings → Connectors → + → Add custom connector.
Champ | Valeur |
Name |
|
Server URL |
|
Laisser les Advanced settings vides (le serveur n'utilise pas OAuth), puis cliquer sur Add. Le connecteur s'active ensuite depuis le bouton + de l'interface de chat.
Option 2 — MCP Inspector
npx @modelcontextprotocol/inspectorTransport Streamable HTTP, URL https://mcp-dernier-sofiane.onrender.com/mcp,
puis Connect → onglet Tools → List Tools.
Questions d'exemple
Une fois le connecteur actif, ces questions déclenchent les outils du serveur. Claude choisit lui-même l'outil approprié.
Vérifier la connexion
Quels documents as-tu à disposition ?
→ appelle lister_documents et renvoie le contenu du corpus.
Voir la structuration IA (partie 2)
Extrais les données structurées du fichier
1.txtet présente-les sous forme de tableau.
→ appelle extraire_donnees_fichier : titre, résumé, personnes, lieux,
organisations, œuvres, dates, thèmes et sentiment.
Lire une source brute
Montre-moi le texte brut de
1.txtsans traitement IA.
→ appelle lire_document. Utile pour comparer l'entrée et la sortie.
Rechercher dans le corpus
Quels documents de mon corpus parlent de musique ? Résume les points communs.
→ appelle rechercher_documents sur les données déjà structurées.
Enchaîner plusieurs outils
Prends trois documents, extrais leurs données, puis dis-moi quelles personnes et quels lieux reviennent le plus souvent.
→ enchaîne lister_documents, plusieurs extraire_donnees_fichier, puis agrège.
Déclencher la collecte (partie 1)
Collecte les données des 2 derniers jours, puis liste ce qui a été ajouté.
→ appelle collecter_donnees (API Wikimedia) puis lister_documents.
Les trois parties du projet dans une seule conversation.
Note : le système de fichiers de Render est éphémère. Les documents collectés en ligne disparaissent au redéploiement suivant ; le corpus versionné dans
data/est toujours restauré au démarrage.
Projet en trois parties, conformément à l'énoncé.
Partie | Fichier | Rôle |
1. Collecte sans IA |
| Récupère les articles mis en avant sur Wikipédia via l'API publique Wikimedia et les écrit en |
2. Structuration IA |
| Envoie le texte brut à OpenAI, valide la réponse avec zod, met le résultat en cache dans |
3. Serveur MCP |
| Expose les outils MCP aux clients IA (Claude Desktop, etc.) |
Source de données : https://api.wikimedia.org/feed/v1/wikipedia/en/featured/{AAAA}/{MM}/{JJ} (API publique, sans clé).
Installation
npm install
cp .env.example .env # puis renseigner OPENAI_API_KEYUtilisation
npm run collecte -- 7 # partie 1 : importe 7 jours d'articles dans data/
npm run extraction # partie 2 : structure tous les .txt et affiche le JSON
npm run extraction -- 1.txt # partie 2 : un seul fichier
npm run dev # partie 3 : serveur MCP en localVérification rapide : curl http://localhost:3000/health
Outils MCP exposés
Outil | Description |
| Liste les |
| Texte brut d'un fichier |
| Données structurées d'un fichier (via OpenAI) |
| Données structurées de tout le corpus |
| Recherche un terme dans les données structurées |
| Relance la collecte Wikimedia |
Schéma renvoyé par l'extraction :
{
"titre": "…",
"resume": "…",
"langue_source": "anglais",
"personnes": [], "lieux": [], "organisations": [],
"oeuvres": [], "dates": [], "themes": [],
"sentiment": "neutre"
}Connexion d'un client IA
Endpoint principal (Streamable HTTP) : https://mcp-dernier-sofiane.onrender.com/mcp
Endpoint SSE (clients plus anciens) : https://mcp-dernier-sofiane.onrender.com/sse
Configuration type pour un client local :
{
"mcpServers": {
"extracteur-documents": {
"command": "npx",
"args": ["-y", "mcp-remote", "https://mcp-dernier-sofiane.onrender.com/mcp"]
}
}
}Déploiement
Le serveur écoute sur process.env.PORT, il fonctionne tel quel sur Render, Railway ou Fly.io.
Build :
npm run buildStart :
npm startVariable d'environnement à définir :
OPENAI_API_KEY
Le système de fichiers de ces plateformes est éphémère : commitez le dossier data/
dans le dépôt git pour que le corpus soit présent au démarrage. Les extractions
générées en ligne (data/extrait/) seront perdues à chaque redéploiement, mais
seront simplement recalculées à la demande.
This server cannot be deployed
Maintenance
Related MCP Connectors
Search Wikipedia, read summaries and full text, target sections, find nearby pages, list languages.
Wikipedia, Wikidata and Wiktionary as clean JSON, not HTML. 1.9M searchable. Free, no auth.
Enable Large Language Model clients to interact seamlessly with any MediaWiki wiki. Perform action…
Wikipedia MCP — wraps Wikipedia REST API (free, no auth)
Related MCP Servers
- AlicenseNot gradedqualityFmaintenanceEnables AI agents to search, read, and explore Wikipedia articles via tools like summaries, categories, and random articles, with no API keys required.1MIT
- AlicenseAqualityDmaintenanceEnables AI assistants to access Wikipedia content, search articles, retrieve historical events, and fetch images through the Wikipedia API.423 npm1MIT
- FlicenseNot gradedqualityDmaintenanceProvides comprehensive Wikipedia access for AI assistants via MCP Streamable HTTP transport, enabling search, article retrieval, summaries, section analysis, link discovery, and multi-language support.2-
- AlicenseNot gradedqualityCmaintenanceWraps the Wikipedia REST API to allow AI agents to query Wikipedia content without authentication.160 npmMIT