Skip to main content
Glama

mcp-ollama

Glama score

MCP-Server, der lokale Ollama-Modelle für das Offloading von API-preisbasierten Orchestratoren kapselt.

License: Apache-2.0 Node MCP

Stellt neun Tools bereit, die Aufgaben an ein lokales Modell weiterleiten (Textgenerierung, Zusammenfassung, Code-Aufgaben, mechanische Transformationen, Entwurf von Commits/PRs/Changelogs). Der Orchestrator entscheidet, was lokal geroutet wird; dieser Server übernimmt das Routing.

  • Transport: stdio

  • Laufzeit: Node 18+

  • Standardmodell: hermes3:8b (überschreibbar via OLLAMA_MODEL)

  • Ollama-Host: http://localhost:11434 (überschreibbar via OLLAMA_HOST)

  • Enthält keine Modellgewichte, keine Cloud-Aufrufe, keine Telemetrie. Jede Anfrage bleibt auf dem Host, auf dem Ollama läuft.

  • Lizenz: Apache-2.0

Warum

Orchestratoren, die nach Token abgerechnet werden (Claude Code, Cursor, die Anthropic API, Cline, Aider), bezahlen für jede Klassifizierung, jeden Docstring, jede Commit-Nachricht. Die meisten dieser Aufgaben benötigen kein Frontier-Modell. Wenn sie auf derselben Maschine an Ollama weitergeleitet werden, ist dieselbe Arbeit kostenlos und schneller. mcp-ollama ist die Routing-Schnittstelle.

Das orchestrierende Modell entscheidet, was wohin geroutet wird. Dieser Server ist die Infrastruktur – er versucht nicht, bei der Aufgabenklassifizierung intelligent zu sein. Wählen Sie das richtige Tool, übergeben Sie den Text und erhalten Sie ein Ergebnis zurück.

Related MCP server: ProjectBrain

Installation

Aus dem Quellcode

git clone https://github.com/true-alter/mcp-ollama.git
cd mcp-ollama
npm install
npm run build

Sie benötigen außerdem eine laufende Ollama-Instanz, bei der mindestens ein Modell geladen ist:

# Default — 8B, fast, good for classifications and short generations
ollama pull hermes3:8b

# Optional — code-specialised, heavier, better for local_code tasks
ollama pull qwen2.5-coder:32b

Docker

docker build -t mcp-ollama .
docker run -i --rm \
  -e OLLAMA_HOST=http://host.docker.internal:11434 \
  -e OLLAMA_MODEL=hermes3:8b \
  mcp-ollama

Das bereitgestellte Dockerfile verweist auf host.docker.internal:11434, damit der Container Ollama auf dem Host erreichen kann.

Ausführen (stdio)

node dist/index.js

Stdio-Server werden vom MCP-Client (Claude Code, Cursor usw.) gestartet – das direkte Ausführen ist nur zum Debuggen nützlich.

Claude Code konfigurieren

claude mcp add --transport stdio ollama -- node /absolute/path/to/mcp-ollama/dist/index.js

Oder in ~/.claude/settings.json:

{
  "mcpServers": {
    "ollama": {
      "transport": "stdio",
      "command": "node",
      "args": ["/absolute/path/to/mcp-ollama/dist/index.js"],
      "env": {
        "OLLAMA_HOST": "http://localhost:11434",
        "OLLAMA_MODEL": "hermes3:8b"
      }
    }
  }
}

Tools

Tool

Zweck

local_generate

Allzweck-Generierung mit System- + Benutzer-Prompt

local_summarize

Zusammenfassung eines Textblocks

local_analyze

Analyse von Text anhand einer spezifischen Frage

local_draft

Entwurf von Inhalten in einem bestimmten Stil

local_code

Code-Aufgaben: Docstring / Test / Erklärung / Review / Typen / Refactor-Vorschlag

local_diff

Diff-basierte Aufgaben: Commit-Nachricht / PR-Beschreibung / Changelog / Zusammenfassung / Auswirkung

local_transform

Mechanische Code-Transformationen

local_models

Auflisten der auf dem lokalen Ollama-Host verfügbaren Modelle

local_pull

Abrufen eines Modells auf den lokalen Ollama-Host

Die vollständigen Tool-Schemas werden über MCP-Introspektion bereitgestellt – jeder MCP-fähige Client listet sie automatisch auf.

Umgebungsvariablen

Variable

Standard

Zweck

OLLAMA_HOST

http://localhost:11434

Ollama HTTP-Endpunkt

OLLAMA_MODEL

hermes3:8b

Standardmodell, wenn ein Tool-Aufruf model auslässt

Jeder Tool-Aufruf kann model explizit überschreiben – der Standardwert der Umgebungsvariablen gilt nur, wenn nichts gesetzt ist. local_code funktioniert tendenziell besser mit einem Code-spezialisierten Modell, das pro Aufruf übergeben wird, während local_summarize und local_draft mit dem Standardmodell gut funktionieren.

Anleitung zur Modellauswahl

Arbeitslast

Empfohlenes Modell

Begründung

Klassifizierung, Einzeiler, Tags

hermes3:8b

Schnellster Round-Trip, kostengünstig

Commit-Nachrichten, Changelogs, Zusammenfassungen

qwen2.5-14b-instruct

Höhere Qualität, läuft noch gut auf 16GB GPU

Code-Review, Docstrings, Tests

qwen2.5-coder:32b

Code-spezialisiert

Fallback / unbekanntes Modell

was auch immer local_models zurückgibt

Erst prüfen, dann routen

Verwenden Sie local_models zu Beginn der Sitzung, wenn Sie sich nicht sicher sind, was auf einem Host verfügbar ist.

Fehlerbehebung

Ollama error 404 beim Aufruf eines Tools. Das Modell wurde nicht geladen. Führen Sie ollama pull <name> aus oder rufen Sie local_pull vom Client aus auf.

fetch failed / Verbindung verweigert. Ollama läuft nicht oder OLLAMA_HOST zeigt auf einen falschen Ort. Überprüfen Sie dies mit curl $OLLAMA_HOST/api/tags. Innerhalb eines Containers ist localhost der Container selbst – verwenden Sie host.docker.internal unter macOS/Windows oder eine Bridge-IP unter Linux.

Tool-Aufrufe fühlen sich langsam an. Der erste Aufruf eines kalten Modells verursacht eine Ladezeit. Nachfolgende Aufrufe innerhalb desselben Ollama-Prozesses sind viel schneller. Wenn das Modell größer als der verfügbare VRAM ist, greift Ollama auf die CPU zurück – beobachten Sie ollama ps zur Bestätigung.

Leere oder abgeschnittene Ausgabe. max_tokens ist standardmäßig auf 2048 pro Tool eingestellt. Übergeben Sie bei langen Generierungen max_tokens explizit im Tool-Aufruf.

Sicherheitsaspekte

mcp-ollama führt keine eigenen Netzwerkaufrufe außerhalb des konfigurierten OLLAMA_HOST durch. Es versendet keine Telemetrie, keine Analysen und keinen Auto-Update-Pinger. Tool-Eingaben werden unverändert an die HTTP-API von Ollama weitergeleitet und die Antwort wird zurückgegeben; der Server selbst ist zwischen den Aufrufen zustandslos.

Wenn Sie Ollama auf localhost (Standard) ausführen, bleibt die gesamte Schleife auf dem Host. Wenn Sie OLLAMA_HOST auf einen Remote-Endpunkt richten, behandeln Sie die Sicherheitslage dieses Endpunkts als maßgeblich – ein Tippfehler, der Prompts an einen Drittanbieter-Host sendet, ist leicht möglich.

Um ein Sicherheitsproblem zu melden, siehe SECURITY.md.

Mitwirken

Fehlerberichte und kleine Patches sind willkommen – siehe CONTRIBUTING.md. Größere Designänderungen: Bitte eröffnen Sie zuerst ein Issue, damit wir über den Umfang sprechen können, bevor Sie Zeit investieren.

Teil von ALTER

mcp-ollama wird von ALTER als Teil der Identitätsinfrastruktur für die KI-Wirtschaft gepflegt. Der ALTER-Identitäts-MCP-Server wird unter mcp.truealter.com gehostet – siehe @truealter/sdk für den TypeScript-Client.

Lizenz

Apache License 2.0. Siehe LICENSE für den vollständigen Text. Copyright 2026 Alter Meridian Pty Ltd (ABN 54 696 662 049).

Tool Schema Changelog

Recent tool additions, removals, and schema changes observed during successful MCP inspections. Dates show when Glama detected each change.

No tool schema history has been recorded yet.

Related MCP Connectors

Related MCP Servers

  • A
    license
    C
    quality
    D
    maintenance
    A privacy-first MCP server that provides local LLM-enhanced tools for code analysis, security scanning, and automated task execution using backends like Ollama and LM Studio. It enables symbol-aware code reviews and workspace exploration while ensuring that all code and analysis remain strictly on your local machine.
    36
    ISC
  • A
    license
    B
    quality
    B
    maintenance
    Local MCP server providing project cognition capabilities for AI coding agents, including context packs, impact analysis, and git diff review through stdio communication.
    10
    3
    MIT

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/true-alter/mcp-ollama'

If you have feedback or need assistance with the MCP directory API, please join our Discord server