ypollak2/llm-router
pip install llm-routing # PyPI name is llm-routing; the CLI command is llm-routerWarum Leute das installieren
KI-Coding-Tools senden standardmäßig zu viele Prompts an Premium-Modelle.
Das bedeutet:
Sie verschwenden bezahlte Tokens für einfache Fragen
Sie verbrauchen Ihr Claude-, Gemini- oder OpenAI-Kontingent schneller als nötig
Sie können nicht weiterarbeiten, wenn ein Anbieter rate-limitiert ist oder ausfällt
llm-router sitzt zwischen Ihrem Coding-Tool und Ihren Modellanbietern. Es klassifiziert jeden Prompt, versucht zuerst das günstigste fähige Modell und greift bei Bedarf automatisch auf Alternativen zurück.
Sie behalten Ihren gewohnten Workflow. Der Router ändert nur die Modellwahl im Hintergrund.
Related MCP server: MCP AI Router
Platz 8 auf RouterArena
llm-router wurde unabhängig benchmarkt und auf RouterArena auf Platz 8 eingestuft – einer Community-Rangliste, die Modell-Router nach Routing-Genauigkeit, Latenz, Kosteneffizienz und Fallback-Zuverlässigkeit bewertet.
Schnellstart
1. Installieren
pip install llm-routing
llm-router installPaketname:
llm-routingauf PyPI. CLI-Befehl:llm-router.
2. Anbieter hinzufügen (optional)
export OPENAI_API_KEY="sk-..." # GPT-4o, o3
export GEMINI_API_KEY="AIza..." # Gemini Flash/Pro (free tier available)
export OLLAMA_BASE_URL="http://localhost:11434" # Local models (free)
export OPENROUTER_API_KEY="sk-or-v1-…" # 343 OpenRouter models (qwen, deepseek, grok, …)Funktioniert mit null API-Schlüsseln bei Claude Code Pro/Max-Abonnements – das Routing nutzt MCP-Tools, die externe Modelle nur dann aufrufen, wenn es sinnvoll ist. Fügen Sie OPENROUTER_API_KEY hinzu, um den Pool leistungsstarker Open-Weight-Modelle freizuschalten, der von der cost_aggressive-Richtlinie verwendet wird.
3. Überprüfen
llm-router health # Check provider connectivityWenn Sie bereits Claude Code, Codex oder Gemini CLI verwenden, behalten Sie Ihren bestehenden Workflow und lassen Sie llm-router die Modelle im Hintergrund auswählen.
Beispiel-Routing
Prompt | Weitergeleitet an |
„Was bedeutet dieser Python-Fehler?" | Ollama / Gemini Flash / Codex |
„Refactoriere diesen Endpoint" | GPT-4o / Gemini Pro |
„Entwirf eine Strategie für verteiltes Tracing" | o3 / Claude Opus |
Die genaue Kette hängt von Ihren konfigurierten Anbietern, Ihrem Budgetprofil und Ihrer Routing-Richtlinie ab.
Funktioniert mit
Tool | Modus | Ersparnis (dieser Host) |
Claude Code | Vollautomatisches Routing über Hooks | 60–80 % |
Codex CLI | Vollautomatisches Routing über Hooks | 60–80 % |
Gemini CLI | Vollautomatisches Routing über Hooks | 50–70 % |
VS Code / Cursor | Manuelle MCP-Tools | 30–50 % |
Beliebiger MCP-Client | Manuelle MCP-Tools | Variiert |
Vollautomatisches Routing bedeutet, dass Hooks Prompts abfangen und automatisch weiterleiten – ohne Workflow-Änderung.
Manuelle MCP-Tools bedeutet, dass Routing bei Bedarf über Tools wie
llm_queryverfügbar ist.
llm-router install # Claude Code (default)
llm-router install --host codex # Codex CLI
llm-router install --host gemini-cli # Gemini CLI
llm-router install --host vscode # VS Code
llm-router install --host cursor # CursorVollständige Details zu jedem Host finden Sie in guide/HOST_SUPPORT_MATRIX.md.
Schützen Sie Ihr Claude-Code-5-Stunden-Kontingent
enforce: smart + mode: zero_claude sorgt dafür, dass Prompts entweder extern abgeschlossen werden oder stoppen,
bevor natives Claude läuft – siehe
guide/GETTING_STARTED.md.
So funktioniert es
User prompt
│
▼
┌──────────────────────┐
│ Complexity Classifier │ ← Heuristic (free, instant) or Ollama/Flash ($0.0001)
└──────────┬───────────┘
│
▼
┌──────────────────────┐
│ Free-First Router │ ← Tries cheapest model first, walks up the chain
│ │
│ Ollama (free) │
│ → Codex (prepaid) │
│ → Gemini Flash │
│ → GPT-4o / Claude │
└──────────┬───────────┘
│
▼
┌──────────────────────┐
│ Guards (parallel) │ ← Circuit breaker, budget pressure, quality check
└──────────┬───────────┘
│
▼
Response + cost logged to local SQLiteDie Klassifizierung ist für viele Aufgaben kostenlos (Regex-Heuristiken erfassen ~70 %) oder nahezu kostenlos für mehrdeutige Prompts bei Verwendung von lokalem Ollama oder Gemini Flash.
Funktionen
Über „günstige Prompts an günstige Modelle" hinaus:
Geheimnisse verlassen niemals Ihren Rechner. Ein Prompt mit einem API-Schlüssel, Token oder privatem Schlüssel wird nur an lokale Modelle weitergeleitet – fail-closed, sodass er keinen externen Anbieter erreichen kann.
Kosteninvertiertes Abonnement-Routing. Kostenlos/lokal zuerst für einfache und mittlere Prompts, Ihr bezahlter Sitz zuerst für komplexe, und der Sitz wird herabgestuft, wenn sein Kontingent belastet ist. Opt-in mit
LLM_ROUTER_SUBSCRIPTION_PROVIDER.Automatischer Fallback mit Circuit Breakern. Ein Anbieter, der ausfällt oder rate-limitiert, wird übersprungen, nicht in den Boden geretried.
Sie können es in Aktion sehen. Eine Statuszeile, der Terminaltitel und eine OS-Benachrichtigung zeigen das zuletzt weitergeleitete Modell, Ersparnis und Gesundheit – für Hosts ohne native Statuszeile.
Zusammenfassung am Sitzungsende. Ersparnis vs. Baseline, Stufenmix, Kosten pro Anbieter, Latenz p50/p95/p99 und Top-Routen.
Auch Medien und Pipelines.
llm_image/llm_video/llm_audioundllm_orchestratefür mehrstufige Recherche.
CLI
llm-router install # wire up your host (Claude Code by default)
llm-router health # provider connectivity
llm-router status # savings + quota at a glance
llm-router doctor # diagnose a broken setupVollständige Befehlsreferenz: guide/GETTING_STARTED.md
Anbieter
20+ Anbieter, kostenlos zuerst. Ollama (lokal, kostenlos) führt die Kette an; OpenRouter (343 Modelle hinter einem Schlüssel) ist die größte einzelne Freischaltung; Gemini und Groq haben nutzbare kostenlose Stufen. Anthropic funktioniert über Ihr bestehendes Claude-Abonnement – kein API-Schlüssel erforderlich.
Jeder Anbieter, seine Modelle, Kostenstufe und Umgebungsvariable: guide/PROVIDERS.md
Routing-Richtlinien
Eine Richtlinie legt fest, wie eifrig der Router von Ihrem Premium-Modell weg routet –
conservative (10–15 % Ersparnis) über balanced (Standard, 35–45 %) bis
cost_aggressive (70–85 %, benötigt OPENROUTER_API_KEY).
llm-router policy set cost_aggressiveAlle sechs Richtlinien, Schwellenwerte und das YAML-Schema: guide/POLICIES.md
MCP-Tools
60 Tools für Routing, Analyse, Code, Medien, Budget und Diagnose – verfügbar für jeden
MCP-Host. Die Standard-Oberfläche consolidated zeigt 11 Frontdoor-Tools; setzen Sie
LLM_ROUTER_SLIM=full für alle 60.
Jedes Tool mit seiner Signatur: guide/TOOLS.md
Ersparnis: So funktioniert es
Die Ersparnis wird berechnet, indem die tatsächlichen Ausgaben mit einer Baseline verglichen werden, bei der jede Aufgabe an Claude Sonnet/Opus weitergeleitet wird.
Methodik:
Jede weitergeleitete Aufgabe protokolliert: verwendetes Modell, verbrauchte Tokens, geschätzte Kosten
Eine Baseline-Kosten werden berechnet, als ob dieselben Tokens vom teuersten Modell in der Kette verarbeitet würden
Ersparnis =
(Baseline - tatsächlich) / Baseline
Annahmen und Einschränkungen:
Die Baseline geht davon aus, dass Sie Opus/Sonnet für alles verwendet hätten (Worst Case)
Tokenschätzungen verwenden die Näherung
len(text) / 4, keine exakten Tokenizer-ZählungenKostendaten stammen aus LiteLLMs Preistabellen (können hinter Preisänderungen der Anbieter zurückbleiben)
Die Ersparnis variiert stark je nach Arbeitslast – code-lastige Sitzungen routen mehr an günstige Modelle
Der Router selbst verursacht geringen Overhead (Klassifizierung kostet ~$0,0001 pro mehrdeutiger Aufgabe)
Beobachteter Bereich: 35–80 % Ersparnis je nach Richtlinie und Aufgabenmix. Die „87 %"-Angabe in einigen Dokumenten stellt einen Einzelbenutzer-Spitzenwert über einen bestimmten Entwicklungszeitraum dar, kein garantiertes Ergebnis.
Vertrauen, Datenschutz und lokales Design
llm-router läuft vollständig auf Ihrem Rechner. Es gibt keinen gehosteten Proxy, keine Telemetrie, kein Konto erforderlich.
Was | Wo | Details |
Ihre Prompts | An konfigurierte Anbieter gesendet | Genau wie bei direkter Nutzung dieser Anbieter |
API-Schlüssel |
| Lokale Dateien, werden nie übertragen |
Nutzungsprotokolle |
| Unverschlüsselte SQLite (Dateisystemberechtigungen) |
Klassifizierungs-Cache | Im Arbeitsspeicher | Wird beim Neustart des Prozesses geleert |
Hook-Skripte |
| Lokale Shell-Skripte, einsehbar |
Was wir tun:
API-Schlüssel aus strukturierten Protokollen entfernen
Hook-Deadlocks vor der Installation erkennen
Alle Daten lokal in
~/.llm-router/speichernAnbieter-Ratenlimits und AGB respektieren
Was Sie wissen sollten:
Prompts werden an den Anbieter gesendet, den der Router auswählt — prüfen Sie die Datenschutzrichtlinie Ihres Anbieters
Nutzungsprotokolle (SQLite) sind im Ruhezustand nicht verschlüsselt — verwenden Sie bei Bedarf eine vollständige Festplattenverschlüsselung
Der Router kann Jailbreaks oder Prompt-Injection auf Anbieterebene nicht verhindern
Siehe SECURITY.md für die Richtlinie zur verantwortungsvollen Offenlegung.
Konfiguration
Alles sind Umgebungsvariablen — keine Konfigurationsdatei zum Starten erforderlich:
export OPENROUTER_API_KEY="sk-or-v1-..." # biggest single unlock
export OLLAMA_BASE_URL="http://localhost:11434" # local, free
export LLM_ROUTER_POLICY="cost_aggressive" # routing policy
export LLM_ROUTER_ENFORCE="smart" # off | advise | smart | hardVollständige Referenz, Konfigurationsdatei-Schema und Host-spezifische Überschreibungen: guide/GETTING_STARTED.md
Dokumentation
Vollständiger Index: guide/README.md
Dokument | Zweck |
Schnellster Weg zu funktionierendem Routing | |
Vollständige Einrichtungsanleitung | |
Funktionsvergleich pro Host | |
Anbieter-Einrichtung und Modell-Empfehlungen | |
| |
Alle 60 MCP-Tools mit Beispielen | |
Internes Design und Modulstruktur | |
Häufige Probleme und Lösungen | |
Isolationssuite zur Überprüfung der Routing-Gesundheit | |
Tabelle zu Modellkosten/-latenz/-qualität, von CI neu generiert | |
Versionshinweise (Archiv) |
Enterprise
llm-router wurde für einzelne Entwickler und kleine Teams entwickelt: lokale Kosteneinsparungen, kein Betriebsaufwand, nichts Gehostetes. Wenn Sie teamweite Richtliniendurchsetzung, Audit-Export, SSO oder Budgets pro Organisation benötigen, dafür ist Chuzom da.
Mitwirken
Beiträge sind willkommen. Siehe CONTRIBUTING.md für die vollständigen Richtlinien.
git clone https://github.com/ypollak2/llm-router.git
cd llm-router
uv sync --extra dev
uv run pytest tests/ -q # Run tests (1900+)
uv run ruff check src/ tests/ # Lint-|-----------|
| llm-routing | Aktuelles PyPI-Paket (pip install llm-routing) |
| llm-router | CLI-Befehl und GitHub-Repository-Name |
| claude-code-llm-router | Veraltetes Legacy-Paket (leitet zu llm-routing) |
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseCqualityFmaintenanceAn AI router that connects applications to multiple LLM providers (OpenAI, Anthropic, Google, DeepSeek, Ollama, etc.) with smart model orchestration capabilities, enabling dynamic switching between models for different reasoning tasks.32537MIT
- -licenseNot gradedqualityNot gradedmaintenanceIntelligent routing service that selects optimal AI models based on capability requirements and normalizes input/output formats across multiple providers like OpenAI, Anthropic, Google, and others.
- FlicenseNot gradedqualityDmaintenanceAutomatically routes queries to the most suitable AI model based on task type, cost constraints, and performance needs, supporting multiple providers and customizable priorities.
- AlicenseBqualityDmaintenanceRoute prompts intelligently across Claude, Gemini, and GPT-4o, automatically picking the best model for every task while minimizing token cost.57MIT
Related MCP Connectors
Enterprise AI Control Plane: governance, guardrails, spend tracking, compliance & smart routing.
Image, video, audio, face-swap, talking avatars and chat across 300+ AI models, one balance.
Run 100+ AI models — image, video, audio, 3D — through one API with pay-per-use billing.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/ypollak2/llm-router'
If you have feedback or need assistance with the MCP directory API, please join our Discord server