Skip to main content
Glama

BRaVa MCP

Ein MCP-Server für die Assoziationsergebnisse des Biobank Rare Variant Analysis (BRaVa)-Konsortiums: seltene kodierende Varianten, genbasierte Tests, meta-analysiert über ~1,2 Millionen Individuen aus 10 globalen Biobanken, 44 harmonisierte Merkmale, 7 Abstammungsstrata.

Nur Zusammenfassungsstatistiken. Nicht für den klinischen Gebrauch.

Es liefert die Tabelle, keinen Wrapper darum

Die Ergebnisse auf Genebene sind eine einzige flache Faktentabelle, und ein Modell schreibt bereits SQL auf Expertenniveau, daher übergibt query sie direkt: 61.791.444 Zeilen, lokal, ohne Netzwerk. Jede Frage ist eine Abfrage, auch die, die ein fester Satz von Tools nie vorhergesehen hätte.

-- what does this gene do
SELECT trait, mask, p_skato, beta FROM results
WHERE gene='PCSK9' AND ancestry='All' AND mask<>'synonymous'
ORDER BY p_skato LIMIT 20

-- most pleiotropic genes
SELECT gene, count(DISTINCT trait) traits FROM results
WHERE ancestry='All' AND p_skato < 1.39e-7 GROUP BY gene ORDER BY traits DESC

-- what a European-only study would have missed
SELECT a.gene, a.trait, a.p_skato FROM results a
WHERE a.ancestry='AFR' AND a.p_skato < 2.5e-6 AND NOT EXISTS (
  SELECT 1 FROM results e WHERE e.ancestry='EUR'
  AND e.gene_idx=a.gene_idx AND e.pheno=a.pheno AND e.p_skato < 2.5e-6)

Related MCP server: gwas-mcp

Tools

Tool

Wofür es gedacht ist

query

Schreibgeschütztes SQL über die gesamte Tabelle auf Genebene

schema

Tabellen, Spalten, ausführbare Rezepte und die Fallstricke, die eine gültige Abfrage wissenschaftlich falsch machen. Zuerst lesen

gene_phenotype_detail

Kreuz-Abstammungs-Replikation für ein Gen-Merkmal-Paar oder ein Screening über eine Trefferliste

variants

Einzelvarianten-Ergebnisse, genomweit für ein Merkmal oder innerhalb eines Gens

Die drei Nicht-Query-Tools decken ab, was SQL nicht kann.

gene_phenotype_detail, weil die Konkordanzzahl All und non_EUR ausschließen muss, die dieselben Individuen zusammenfassen wie die gezählten Strata: Das offensichtliche SQL zählt doppelt und sieht völlig plausibel aus.

variants, weil die Veröffentlichung auf Variantenebene ein separates Upstream-Format ist, eine Größenordnung größer und so oft neu aufgebaut, dass eine lokale Kopie innerhalb einer Woche veraltet wäre.

schema(), weil eine syntaktisch perfekte Abfrage hier immer noch wissenschaftlich falsch sein kann. Effektgrößen gehören zu einem anderen Test als der p-Wert daneben, eine Maske ist eine Kalibrierungskontrolle und keine biologische Kategorie, Abstammungsstrata überlappen sich, und ein p-Wert von exakt null ist das stärkste Ergebnis und kein fehlender Wert. Mehrere davon invertieren eine Antwort, anstatt sie zu verschlechtern, weshalb sie mit den Spalten reisen und nicht in einer README stehen.

Die Datenbank

873 MB, veröffentlicht als Release-Asset und bei der ersten Nutzung einmal in ~/.cache/brava-mcp/ heruntergeladen. Bewusst nicht eingecheckt: Bereitstellungen setzen den Klon bei jedem Start zurück, daher würde ein Gigabyte darin für immer neu abgerufen werden. Das Klonen dieses Repos kostet 3,9 MB.

Erstellt von etl/build_db.py aus den 280 veröffentlichten phenotype/{P}.{ANC}.json-Dateien. Diese enthalten dieselben Daten wie die 19.541 Dateien pro Gen, daher wird die Pivotierung aus Höflichkeit gewählt: 280 Anfragen gegen 19.541 für identische Abdeckung, einmal, statt eines pro Gen, das für immer konsultiert wird. Klasse-B-Operationen sind die knappe Ressource auf dem kostenlosen Upstream-Tarif; Egress ist auf R2 kostenlos.

Sortiert nach den Schlüsselspalten mit niedriger Kardinalität und ohne ART-Indizes erstellt: 2,49 GB mit Indizes, 1,75 GB ohne, 0,87 GB sortiert. Es fehlt kein Index, da dies gefilterte Scans sind und DuckDBs Zonemaps sie bereits bedienen. Jede Abfrage oben liefert in unter 70 ms zurück.

Ausführen

make sync                 # install
make db                   # download the published database (873 MB, once)
make test                 # offline suite
make test-all             # + live-data checks
make eval                 # 14 benchmark questions, answers derived independently
make serve                # HTTP daemon on :3163
uv run python server.py   # stdio

Datenbank aus Upstream neu erstellen mit uv run python etl/build_db.py (~200 s: 120 s Downloads, 76 s Laden, dann die sortierte Kompaktierung).

Variable

Standard

Zweck

MCP_TRANSPORT

stdio

http für den gemeinsamen Daemon

MCP_PORT

3163

Daemon-Port

BRAVA_DB_URL

das Release-Asset

woher die Datenbank geholt wird

BRAVA_DB_PATH

~/.cache/brava-mcp/brava.duckdb

lokale Datenbank

BRAVA_VARIANT_BASE_URL

Upstream-R2

Dateien auf Variantenebene

Die Ergebnisse lesen

  • beta > 0 erhöht das Risiko (binäre Merkmale) oder den Merkmalswert (quantitativ). beta und se stammen immer aus der invers-varianzgewichteten Burden-Meta-Analyse, auch in Zeilen, in denen Sie p_skato lesen. Es gibt keine SKAT-O-Effektgröße.

  • SKAT-O ist der primäre Omnibus-Test. Burden ist am aussagekräftigsten, wenn die Varianten eines Gens in dieselbe Richtung zeigen; SKAT, wenn sie gemischt sind.

  • Die synonymous-Maske ist eine Kalibrierungskontrolle. Ein signifikantes synonymes Ergebnis weist auf eine verbleibende Testinflation hin, nicht auf Biologie.

  • Schwellenwerte aus dem Flaggschiff-Papier: Gen × Maske Bonferroni 1,39e-7, Gen-Ebene Cauchy 2,5e-6, Varianten-Ebene 1,82e-8.

  • BRaVa führt keine Allelfrequenzen und keine GWAS für häufige Varianten. Variantenzeilen verlinken für erstere auf gnomAD.

schema() gibt all dies zurück, plus fünf weitere Fallstricke, zusammen mit den Spalten.

Evaluierung

evals/questions.json enthält vierzehn Fragen, alle vierzehn direkt aus den rohen Upstream-Dateien von evals/resolve_golds.py aufgelöst, das nichts aus brava importiert, sodass der Benchmark nicht mit einem Dekodierungsfehler übereinstimmen kann und gleichzeitig als Detektor für Upstream-Abweichungen dient.

evals/selfcheck.py führt jede Frage durch die Tools: derzeit 14/14, ein Median von einem Aufruf pro Frage und null ausgehende HTTP-Anfragen für den gesamten Satz. Es prüft die evidence jeder Frage (die Werte, die die Tools zurückgeben müssen) und nie ihre answer, da mehrere Antworten Schlussfolgerungen sind, die kein String-Abgleich verifizieren kann. Es beweist also, dass die Daten erreichbar sind und zu welchen Kosten, nicht dass ein Modell die richtige Schlussfolgerung zieht; diese Hälfte benötigt einen Runner mit Modell-in-der-Schleife und fehlt noch.

Verkehr

Fragen auf Genebene sind lokal, kosten das Upstream-Projekt also überhaupt nichts. Nur variants ruft ab, und jede Datei wird dauerhaft zwischengespeichert. Das Erstellen der Datenbank kostet 280 Anfragen, einmal. Siehe nikbaya/brava_browser#1 für das Gespräch mit dem Upstream-Autor.

Zitierung

Palmer, Hill, Hodgson, et al. Rare variant association analyses across 10 global biobanks. medRxiv (2026). doi:10.64898/2026.05.21.26353759

Die Datenbank ist von dieser Veröffentlichung über die veröffentlichten Dateien des BRaVa-Browsers abgeleitet und wird unter der MIT-Lizenz des Browsers weiterverteilt.

Lizenz

MIT.

Install Server
F
license - not found
A
quality
A
maintenance

Maintenance

Maintainers
Response time
Release cycle
1Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    C
    quality
    F
    maintenance
    Provides AI-powered access to major biological databases for GWAS and bioinformatics research. Enables natural language queries for protein, gene, variant, pathway, and drug discovery analysis.
    44
    1
    MIT
  • A
    license
    -
    quality
    D
    maintenance
    Enables real-time pharmacogenomics analysis, including variant clinical significance, drug-gene interactions, and dosing guidelines, by connecting to ClinVar, PharmGKB, gnomAD, and other databases.
    1
    MIT
  • A
    license
    -
    quality
    D
    maintenance
    Enables AI agents to query clinical genomics databases, retrieve supporting literature, analyze population genetics, and visualize biological pathways.
    22
    MIT

View all related MCP servers

Related MCP Connectors

  • GTEx — Genotype-Tissue Expression human gene-expression atlas

  • Broad Institute gnomAD genomic variant database (GraphQL)

  • Canine genomics for agents: breed allele frequencies, AI pathogenicity + OMIA clinical disease layer

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/plemio/brava-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server