vaglio-mcp
Vaglio is an academic research governance server that helps you find, read, appraise, and archive scholarly works with built-in rate-limit protection across a fleet of agents.
Search (
vaglio_search): Find works across Crossref, OpenAlex, PubMed, and OpenAIRE with automatic failover — rate‑limited sources are skipped, and refusals are reported.Read (
vaglio_read): Retrieve and store full text from arXiv, Europe PMC, or Unpaywall; read depth is derived from actual stored files, not just declarations.Status (
vaglio_status): Monitor shared request budgets fleet‑wide, showing which hosts are in cooldown.Catalogue (
vaglio_sources): List available sources, their roles (FIND/OPEN/READ), and full‑text capabilities.Appraise (
vaglio_appraise): Assign an evidence tier (A–D) to a claim — Tier A requires at least an abstract, Tier D requires a recorded refusal reason.Archive (
vaglio_inscribe): Save a research run as a versioned, schema‑valid record in~/ricerche, including full‑text copies and index regeneration; refuses to recordfalsifiedclaims as durable verdicts.
Click on "Install Server".
Wait a few minutes for the server to deploy. Once ready, it will show a "Started" state.
In the chat, type
@followed by the MCP server name and your instructions, e.g., "@vaglio-mcpsearch for papers on CRISPR gene editing"
That's it! The server will respond to your query, and you can continue using it as needed.
Here is a step-by-step guide with screenshots.
Vaglio
MCP server per la ricerca accademica governata. Vagliare: separare il grano dalla pula. Trova, apre, legge — e non mente mai su quale delle tre è successa.
Nasce da un incidente misurato il 2026-07-28: nove agent di ricerca in parallelo
hanno fatto scattare il rate-limit di OpenAlex per 18 ore (Retry-After: 64902) a metà di un workflow. Ogni agent si comportava bene da solo; insieme
erano un attacco. Il backoff per-chiamata non protegge da questo, perché il
budget appartiene alla flotta, non al chiamante.
Ricerca completa: ~/ricerche/topics/metodo-ricerca-accademica/pipeline-fonti-open-access/.
Cosa fa che gli altri non fanno
Il prior art esiste ed è buono — openags/paper-search-mcp
(MIT, 20 fonti, backoff, catena OA-first) copre la meccanica delle fonti. Vaglio
non la riscrive: aggiunge i tre organi che mancano.
Organo | Cosa fa |
Governance | token bucket condiviso fra processi ( |
Evidenza |
|
Inscrizione | il run diventa un record versionato in |
Related MCP server: wikipedia-recent-changes-mcp
Il tier non si dichiara: si deriva
Europe PMC e PubMed pubblicano il tipo MeSH di ogni lavoro, e Crossref marca
i preprint come posted-content. Sono dati della fonte, non giudizi — quindi il
tetto di forza di un claim si legge, non si opina:
Il record dice | Classe | Tier massimo |
| primary-trial | A |
| synthesis | A |
| secondary | B |
| preprint (non peer-reviewed) | B |
| primary-study | nessun tetto |
niente | unknown | nessun tetto |
Su una ricerca reale (binaural beats anxiety, Europe PMC) la separazione è
netta al primo colpo: un solo RCT ammette tier A, mentre una Letter, una Review
e un Case Report si fermano a B. Chi volesse scrivere "tier A: i binaural beats
riducono l'ansia" citando la review viene fermato dal costruttore, non da un
revisore a valle.
Due precisazioni, perché il meccanismo sia onesto: il tetto non promuove mai nulla — un claim debole su un RCT resta debole; e quando la fonte non dichiara il tipo, non c'è tetto e il giudizio dell'agent vale come prima.
Le fonti, e il loro ruolo
I ruoli non sono intercambiabili — è questo che fa funzionare il failover.
Ruolo | Fonti | Nota |
FIND | Crossref → OpenAlex → PubMed → OpenAIRE | Crossref è la spina dorsale: 3 req/s, |
OPEN | Unpaywall | dal DOI alla copia open access legale |
READ | arXiv, Europe PMC, CORE | arXiv per fisica/matematica/DSP; Europe PMC dà il full text XML senza chiave, ed è dove si leggono i metodi |
Su 429 non si ritenta la stessa fonte: si cambia fonte per lo stesso scopo.
Ritentare un host che ha risposto con 18 ore di Retry-After è tempo buttato.
Fuori per scelta: Sci-Hub (esposizione legale che un portfolio commerciale non può portare) e i riassuntori mediati da LLM (Elicit, Consensus, SciSpace: mettono un secondo grado di separazione fra claim e fonte primaria).
Tool
Tool | Cosa fa |
| cerca con failover per ruolo; riporta quali fonti hanno rifiutato e perché |
| scarica e archivia il corpo, rendendo verificabile la profondità |
| vista di flotta: chi è utilizzabile, chi è in cooldown e per quante ore |
| catalogo fonti, ruoli, capacità di full text |
| assegna un tier a un claim, sotto la disciplina che lo guarda |
| scrive il record in |
Installazione
cd ~/mcp/vaglio-mcp
python3 -m venv .venv
.venv/bin/pip install -e ".[dev]"
.venv/bin/python -m pytest # i falsificatoriRegistrazione come server MCP:
claude mcp add vaglio -- ~/mcp/vaglio-mcp/.venv/bin/vaglio-mcpNessuna chiave, nessun account, nessuna dipendenza HTTP di terze parti: il
trasporto è urllib di stdlib, di proposito — questo strato non può avere una
dipendenza che decida di fare una richiesta scavalcando il throttle.
Falsificatori
I test sono i falsificatori pre-registrati nel record di ricerca, non un contorno:
F1 — il budget è condiviso: due istanze indipendenti (due processi) non ottengono
ratetoken a testa; un 429 su una è visibile all'altra senza che abbia mai chiamato; un 429 senzaRetry-Afternon vale mai zero.F2 — la profondità non mente: file vuoto ≠ full-text; tier A su soli metadata è rifiutato; tier D senza motivazione è rifiutato; un run letto perlopiù ad abstract lo dichiara.
F3 — il failover cambia fonte: l'host bloccato è provato una volta sola, mai ritentato; se cadono tutte, il risultato vuoto si spiega invece di sembrare "nessun risultato".
F4 — l'inscrizione è valida: frontmatter conforme allo schema dell'archivio, slug in kebab-case, full text copiato in
sources/.F5 — il tetto derivato regge: le etichette reali delle API mappano alla classe giusta; una review rifiuta il tier A e accetta il B; un RCT ammette A; un preprint è segnalato come non peer-reviewed e limitato; il silenzio della fonte non declassa nulla; il tetto non promuove mai un claim debole.
Con una regola in più, di governo e non di codice: vaglio_inscribe rifiuta
status: falsified. Dire in conversazione che qualcosa non regge è dovuto;
inscriverlo nel record come verdetto chiuso è una decisione di chi possiede la
ricerca, non dello strumento.
Usare i primitivi da soli
I due organi centrali sono agnostici rispetto alla ricerca accademica e si usano senza toccare l'MCP: servono a qualunque flotta di agent.
pip install "vaglio-mcp @ git+https://github.com/Alemusica/vaglio-mcp"Governance — qualunque API con rate limit, condivisa fra processi:
from vaglio_mcp.core.throttle import Throttle, HostBlocked
t = Throttle() # stato condiviso in ~/.vaglio/throttle
try:
t.acquire("api.example.com") # attende il turno, nel budget della flotta
except HostBlocked as e:
... # l'host e fuori per e.seconds_left: cambia strada
t.report_rate_limited("api.example.com", retry_after=3600) # lo dice a tuttiEvidenza — tier e profondita di lettura, per ricerca ma anche per due diligence, FTO, audit normativo:
from vaglio_mcp.core.evidence import Finding, Paper, Tier
Finding(claim="...", tier=Tier.A, paper=Paper(title="...", source="..."))
# TierDiscipline: tier A dichiarato su soli metadata viene rifiutato qui,
# non scoperto a valle.Nessuno dei due importa l'altro, e nessuno dei due sa cosa sia un paper: il throttle conosce host e secondi, l'evidenza conosce claim e artefatti.
Stato
Versione 0.2.0.
Candidati all'estrazione verso magazzino (dichiarati, non ancora promossi —
regola dei 3 consumatori): core/throttle.py come primitivo di governance
riusabile da qualunque flotta di agent, e core/evidence.py come disciplina
tier/profondità agnostica rispetto al dominio.
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- Alicense-qualityDmaintenanceA MCP server for academic literature retrieval, aggregating multiple data sources like arXiv, Crossref, OpenAlex, PubMed, and Semantic Scholar to provide search, details, citations, trends, and recommendations.Last updated4MIT
- Flicense-qualityBmaintenanceMCP server providing live Wikipedia recent changes feed, page summaries, trending pages, and Wikidata entity lookup.Last updated
- Flicense-qualityDmaintenanceThis MCP server provides LLMs with a live, curated knowledge base of AI agent research, world models, and source-code reviews, enabling personalized and context-aware responses. Users can either connect to the hosted knowledge or build and host their own vault.Last updated
- Alicense-qualityDmaintenanceAn MCP server for academic research combining local document search with Semantic Scholar API integration.Last updatedMIT
Related MCP Connectors
An MCP server for deep research or task groups
Academic research MCP server for paper search, citation checks, graphs, and deep research.
Personal MCP server for humans who create. Proof of authorship, license control.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/Alemusica/vaglio-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server