ppb-mcp
ppb-mcp
MCP-сервер, который предоставляет данные бенчмарков GPU-инференса Poor Paul's Benchmark — квантование × пропускная способность × VRAM × количество одновременных пользователей — в качестве инструментов для запросов для любого LLM-клиента.
Хостинг-инстанс: https://mcp.poorpaul.dev/ (транспорт streamable-http, без авторизации)
Что он делает
Подключите любой MCP-совместимый клиент (Claude Desktop, Cline, Continue и т. д.), чтобы задавать вопросы вроде:
«Какое квантование лучше всего подходит для GPU на 32 ГБ при запуске Qwen3.5-9B с 8 одновременными пользователями?»
«Покажи мне все модели, протестированные с Q4_K_M на RTX 5090.»
«Поместится ли Llama-13B с Q5_K_M на GPU с 24 ГБ при 4 одновременных пользователях?»
Он предоставляет четыре инструмента, основанных на более чем 30 000 реальных записей бенчмарков:
Инструмент | Что он делает |
| Перечисляет все протестированные GPU, модели и квантования (вызывайте первым) |
| Фильтрует необработанные данные бенчмарков по GPU / VRAM / модели / квантованию / пользователям / бэкенду |
| Трехуровневый движок рекомендаций, основанный на эмпирических данных (высокая / средняя / низкая уверенность) |
| Проверяет конфигурацию (gpu, model, quant, users) на наличие запаса VRAM |
Related MCP server: atom-mcp-server
Установка
1) Использование хостинг-инстанса (без настройки)
Добавьте в конфигурацию вашего MCP-клиента (пример для Claude Desktop, ~/Library/Application Support/Claude/claude_desktop_config.json):
{
"mcpServers": {
"ppb": {
"transport": { "type": "http", "url": "https://mcp.poorpaul.dev/mcp" }
}
}
}2) pip install и локальный запуск (stdio)
pip install ppb-mcp
MCP_TRANSPORT=stdio ppb-mcpКонфигурация Claude Desktop:
{
"mcpServers": {
"ppb": {
"command": "ppb-mcp",
"env": { "MCP_TRANSPORT": "stdio" }
}
}
}3) Docker
docker run --rm -p 8000:8000 \
-e MCP_TRANSPORT=streamable-http \
-v ppb-hf-cache:/data/huggingface \
ghcr.io/paulplee/ppb-mcp:latest4) Из исходного кода
git clone https://github.com/paulplee/ppb-mcp
cd ppb-mcp
pip install -e ".[dev]"
ppb-mcp # streamable-http on :8000Пример сессии
> list_tested_configs
{ "gpus": ["Apple M4 Pro", "NVIDIA GB10", "NVIDIA GeForce RTX 5090"],
"models": ["Qwen3.5-9B", ...], "quantizations": ["Q4_K_M", ...] }
> recommend_quantization(gpu_vram_gb=32, concurrent_users=8, model="Qwen3.5-9B", priority="balance")
{ "recommended_quantization": "Q5_K_M",
"estimated_vram_usage_gb": 27.8,
"estimated_tokens_per_second": 142.0,
"headroom_gb": 4.2,
"confidence": "high",
"reasoning": "Q5_K_M is recommended for your NVIDIA GeForce RTX 5090 (32 GB) ...",
"alternatives": ["Q4_K_M", "Q8_0"] }Конфигурация
Переменная окружения | По умолчанию | Примечания |
|
| ID датасета на HuggingFace |
|
| Периодичность фонового обновления |
|
|
|
|
| Хост для привязки HTTP |
|
| Порт для привязки HTTP |
|
| Уровень логирования Python |
Самостоятельный хостинг (Lightsail / любой VPS на Ubuntu)
git clone https://github.com/paulplee/ppb-mcp /tmp/ppb-mcp
cd /tmp/ppb-mcp
DOMAIN=mcp.example.com EMAIL=you@example.com ./deploy/deploy.shЭто установит Docker, соберет образ, зарегистрирует systemd-юнит, настроит nginx и запустит certbot.
Разработка
pip install -e ".[dev]"
ruff check src tests
pytest -vИнтеграционные тесты с реальным датасетом HuggingFace защищены флагом PPB_RUN_INTEGRATION=1, чтобы CI оставался автономным.
Как работают рекомендации
Уровень 1 — точное эмпирическое совпадение (высокая уверенность). ≥3 замеров на GPU с объемом VRAM, равным или меньшим вашего бюджета, при запрошенном количестве пользователей.
Уровень 2 — эмпирическое приближение (средняя уверенность). Та же пара
(model, quant), протестированная на другом GPU при том же количестве пользователей; пропускная способность берется из данных, VRAM масштабируется под вашу карту.Уровень 3 — экстраполяция по формуле (низкая уверенность).
vram_per_user ≈ (params_B × bits_per_weight / 8) × 1.15; применимо, если общий объем ≤ 90% вашей VRAM.
Лицензия
MIT — см. LICENSE.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityNot gradedmaintenanceEnables benchmarking of Large Language Model APIs by measuring performance metrics such as generation throughput, prompt throughput, and Time To First Token (TTFT) with configurable concurrency levels and parameters.1
- AlicenseAqualityCmaintenanceGlobal price benchmarking for AI inference across 2,600+ SKUs from 47 vendors. Query live pricing, market indexes, and model specs via 8 tools. Free tier available.8121MIT
- AlicenseAqualityDmaintenanceExposes NVIDIA GPU metrics (info, utilization, VRAM, temperature) via MCP tools for real-time querying from AI assistants.5MIT

Openchainbenchofficial
AlicenseNot gradedqualityAmaintenanceLive, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.5MIT
Related MCP Connectors
Provision private AI model endpoints on dedicated GPUs (Llama, Qwen, Mistral). Pay per minute.
Live, neutral benchmarks for public RPC latency, oracles, bridges, perp DEX, and prediction markets.
AI Reasoning Cache & Consensus Layer with 11 MCP tools via Streamable HTTP.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/paulplee/ppb-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server