Skip to main content
Glama

ppb-mcp

MCP-сервер, который предоставляет данные бенчмарков GPU-инференса Poor Paul's Benchmark — квантование × пропускная способность × VRAM × количество одновременных пользователей — в качестве инструментов для запросов для любого LLM-клиента.

CI PyPI License: MIT

Хостинг-инстанс: https://mcp.poorpaul.dev/ (транспорт streamable-http, без авторизации)

Что он делает

Подключите любой MCP-совместимый клиент (Claude Desktop, Cline, Continue и т. д.), чтобы задавать вопросы вроде:

  • «Какое квантование лучше всего подходит для GPU на 32 ГБ при запуске Qwen3.5-9B с 8 одновременными пользователями?»

  • «Покажи мне все модели, протестированные с Q4_K_M на RTX 5090.»

  • «Поместится ли Llama-13B с Q5_K_M на GPU с 24 ГБ при 4 одновременных пользователях?»

Он предоставляет четыре инструмента, основанных на более чем 30 000 реальных записей бенчмарков:

Инструмент

Что он делает

list_tested_configs

Перечисляет все протестированные GPU, модели и квантования (вызывайте первым)

query_ppb_results

Фильтрует необработанные данные бенчмарков по GPU / VRAM / модели / квантованию / пользователям / бэкенду

recommend_quantization

Трехуровневый движок рекомендаций, основанный на эмпирических данных (высокая / средняя / низкая уверенность)

get_gpu_headroom

Проверяет конфигурацию (gpu, model, quant, users) на наличие запаса VRAM

Related MCP server: atom-mcp-server

Установка

1) Использование хостинг-инстанса (без настройки)

Добавьте в конфигурацию вашего MCP-клиента (пример для Claude Desktop, ~/Library/Application Support/Claude/claude_desktop_config.json):

{
  "mcpServers": {
    "ppb": {
      "transport": { "type": "http", "url": "https://mcp.poorpaul.dev/mcp" }
    }
  }
}

2) pip install и локальный запуск (stdio)

pip install ppb-mcp
MCP_TRANSPORT=stdio ppb-mcp

Конфигурация Claude Desktop:

{
  "mcpServers": {
    "ppb": {
      "command": "ppb-mcp",
      "env": { "MCP_TRANSPORT": "stdio" }
    }
  }
}

3) Docker

docker run --rm -p 8000:8000 \
  -e MCP_TRANSPORT=streamable-http \
  -v ppb-hf-cache:/data/huggingface \
  ghcr.io/paulplee/ppb-mcp:latest

4) Из исходного кода

git clone https://github.com/paulplee/ppb-mcp
cd ppb-mcp
pip install -e ".[dev]"
ppb-mcp           # streamable-http on :8000

Пример сессии

> list_tested_configs
{ "gpus": ["Apple M4 Pro", "NVIDIA GB10", "NVIDIA GeForce RTX 5090"],
  "models": ["Qwen3.5-9B", ...], "quantizations": ["Q4_K_M", ...] }

> recommend_quantization(gpu_vram_gb=32, concurrent_users=8, model="Qwen3.5-9B", priority="balance")
{ "recommended_quantization": "Q5_K_M",
  "estimated_vram_usage_gb": 27.8,
  "estimated_tokens_per_second": 142.0,
  "headroom_gb": 4.2,
  "confidence": "high",
  "reasoning": "Q5_K_M is recommended for your NVIDIA GeForce RTX 5090 (32 GB) ...",
  "alternatives": ["Q4_K_M", "Q8_0"] }

Конфигурация

Переменная окружения

По умолчанию

Примечания

HF_DATASET

paulplee/ppb-results

ID датасета на HuggingFace

REFRESH_INTERVAL_HOURS

1

Периодичность фонового обновления

MCP_TRANSPORT

streamable-http

stdio или streamable-http

HOST

0.0.0.0

Хост для привязки HTTP

PORT

8000

Порт для привязки HTTP

LOG_LEVEL

INFO

Уровень логирования Python

Самостоятельный хостинг (Lightsail / любой VPS на Ubuntu)

git clone https://github.com/paulplee/ppb-mcp /tmp/ppb-mcp
cd /tmp/ppb-mcp
DOMAIN=mcp.example.com EMAIL=you@example.com ./deploy/deploy.sh

Это установит Docker, соберет образ, зарегистрирует systemd-юнит, настроит nginx и запустит certbot.

Разработка

pip install -e ".[dev]"
ruff check src tests
pytest -v

Интеграционные тесты с реальным датасетом HuggingFace защищены флагом PPB_RUN_INTEGRATION=1, чтобы CI оставался автономным.

Как работают рекомендации

  1. Уровень 1 — точное эмпирическое совпадение (высокая уверенность). ≥3 замеров на GPU с объемом VRAM, равным или меньшим вашего бюджета, при запрошенном количестве пользователей.

  2. Уровень 2 — эмпирическое приближение (средняя уверенность). Та же пара (model, quant), протестированная на другом GPU при том же количестве пользователей; пропускная способность берется из данных, VRAM масштабируется под вашу карту.

  3. Уровень 3 — экстраполяция по формуле (низкая уверенность). vram_per_user ≈ (params_B × bits_per_weight / 8) × 1.15; применимо, если общий объем ≤ 90% вашей VRAM.

Лицензия

MIT — см. LICENSE.

A
license - permissive license
Not graded
quality - not tested
D
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    A
    quality
    C
    maintenance
    Global price benchmarking for AI inference across 2,600+ SKUs from 47 vendors. Query live pricing, market indexes, and model specs via 8 tools. Free tier available.
    8
    121
    MIT
  • A
    license
    A
    quality
    D
    maintenance
    Exposes NVIDIA GPU metrics (info, utilization, VRAM, temperature) via MCP tools for real-time querying from AI assistants.
    5
    MIT
  • A
    license
    Not graded
    quality
    A
    maintenance
    Live, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.
    5
    MIT

View all related MCP servers

Related MCP Connectors

  • Provision private AI model endpoints on dedicated GPUs (Llama, Qwen, Mistral). Pay per minute.

  • Live, neutral benchmarks for public RPC latency, oracles, bridges, perp DEX, and prediction markets.

  • AI Reasoning Cache & Consensus Layer with 11 MCP tools via Streamable HTTP.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/paulplee/ppb-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server