Skip to main content
Glama

speak

Bitte Claude, seine Antwort laut vorzulesen.

Kein Text-to-Speech-Dump der rohen Antwort. Du sagst „read that back to me simply“ und Claude schreibt das Gesagte als kurzes gesprochenes Skript um und spielt es dann ab. Das Skript erscheint nie im Chat. Es ist ein Gespräch zwischen dir und dem Modell, wobei der Text aus dem Weg bleibt.

Funktioniert heute in Claude Code. Die Wiedergabeseite ist ein einfacher MCP-Server, sodass er auch in Claude Desktop, Cursor oder jeden MCP-Client eingebunden werden kann.

Was du bekommst

  • speak-MCP-Server mit den Tools speak, stop, pause, resume, back, skip, add_pronunciation, list_pronunciations, list_voices, set_default

  • Schwebende Überlagerung auf macOS, während Claude spricht: eine kleine Pille über jedem Fenster mit einer Live-Wellenform, einen Satz zurück, einen Satz überspringen, an genau dieser Stelle pausieren und fortsetzen, stoppen

  • /speak-Skill für Claude Code, mit Stilen: simple (Standard), brief, decisions, full, eli5

  • Auto-Sprechen: ein Stop-Hook, der nach jeder Antwort ein brief-Skript liest, standardmäßig deaktiviert

  • speak-CLI: echo "hello" | speak

  • Raycast-Skriptbefehle: Speak liest den ausgewählten Text wie geschrieben, Speak Simply schreibt ihn zuerst mit claude -p als kurze gesprochene Zusammenfassung um, Speak Translated übersetzt ihn zuerst (standardmäßig Englisch; gib eine andere Sprache als Argument des Befehls ein oder setze SPEAK_TRANSLATE_LANGUAGE, um den Standard zu ändern). Eine nicht-englische Übersetzung wird mit einer passenden installierten macOS-Stimme gelesen, zuerst die beste verfügbare (Premium, dann Enhanced, dann kompakt); Englisch lässt deine normale Stimme unberührt. Lade die Premium-Stimme für eine Sprache in Systemeinstellungen > Bedienungshilfen > Vorlesen & Sprechen > Systemstimme > Stimmen verwalten herunter, um die gute zu bekommen. Speak Stop stoppt. Sie kopieren die Auswahl mit einem simulierten Cmd+C, daher benötigt Raycast die Bedienungshilfen-Berechtigung.

Related MCP server: MCP Audio Server

Engines

Engine

Kosten

Benötigt

Hinweise

say

kostenlos

macOS

Standard. Lade eine Premium- oder Enhanced-Stimme in Systemeinstellungen > Bedienungshilfen > Gesprochene Inhalte herunter, um gute Qualität zu erhalten. Setze eine Siri-Stimme als Systemstandard und das nackte say verwendet sie.

edge

kostenlos

Netzwerk

Microsoft-Neuralstimmen über edge-tts-universal. Sehr gute Qualität. Inoffizielle API.

kokoro

kostenlos

npm i kokoro-js, ~300MB Modell beim ersten Start

Lokales neuronales TTS, läuft auf der CPU.

openai

kostenpflichtig

OPENAI_API_KEY

gpt-4o-mini-tts.

elevenlabs

kostenlose Stufe

ELEVENLABS_API_KEY

eleven_flash_v2_5.

Eine Stimme auf macOS auswählen

Die Standard-say-Engine verwendet die Systemstimme deines Macs. Richte sie also einmal in macOS ein, und jedes Vorlesen verwendet sie:

  1. Öffne Systemeinstellungen > Bedienungshilfen > Vorlesen & Sprechen (auf älteren Versionen „Gesprochene Inhalte“).

  2. Wähle unter Systemstimme eine Stimme aus. Apple liefert eine große Bibliothek pro Sprache; die Premium- und Enhanced-Stimmen werden bei Bedarf heruntergeladen und klingen viel besser als die kompakten Standardstimmen. Siri-Stimmen können hier ebenfalls ausgewählt werden.

  3. Stelle die Sprechgeschwindigkeit nach Geschmack ein.

Aussprachen

Sag Claude im Chat:

  • „pronounce fancyapp as fan-see-app from now on“

  • „what pronunciations have you saved“

Sie liegen in ~/.config/speak/pronunciations.json (überschreibe den Ordner mit SPEAK_CONFIG_DIR), werden ganzwortig und ohne Beachtung der Groß-/Kleinschreibung abgeglichen und auf jedes Vorlesen angewendet:

{
  "fancyapp": "fan-see-app",
  "OAuth": "oh auth"
}

Links und E-Mails werden gesprochen gelesen: https://example.com/login wird zu „example dot com slash login“, jane@example.de wird zu „jane at example dot d e“. Kurze Endungen wie de, io, co.uk werden Buchstabe für Buchstabe buchstabiert, da „de“ als Wort gelesen wie „duh“ klingt.

Wörter mit zwei Lesarten („live“, „read“, „lead“) können nicht durch eine Wortliste behoben werden. Der Skill weist Claude an, sie im Skript neu zu buchstabieren, damit die Stimme nicht falsch raten kann: „lyive“ für live wie in lebendig, „red“ für read in der Vergangenheitsform, „led“ für das Metall. Der Skill führt eine Tabelle der üblichen Übeltäter und prüft das Skript vor dem Sprechen dagegen.

Lasse SPEAK_VOICE ungesetzt, um der Systemstimme zu folgen, oder setze es auf einen Stimmenamen aus say -v ?, um nur für Claude zu überschreiben.

Die erste verfügbare Engine gewinnt, sofern du nicht SPEAK_ENGINE setzt. SPEAK_VOICE legt die Stimme fest. Beide können pro Sitzung mit dem set_default-Tool geändert werden („switch to the edge engine“).

Installation

Setze RAYCAST_SCRIPTS_DIR auf ein Verzeichnis, das bereits in Raycast hinzugefügt wurde (Einstellungen > Erweiterungen > Skriptbefehle), und die Befehle werden darin verlinkt. Ohne dies füge raycast/ aus diesem Repository einmal manuell dort hinzu.

RAYCAST_SCRIPTS_DIR=~/raycast-scripts ./install.sh

Benötigt Node 20+, jq und Claude Code.

git clone https://github.com/CareyScott/speak
cd speak
./install.sh

Dies baut den Server und den macOS-Overlay-Helfer (benötigt swiftc aus den Xcode-Kommandozeilenwerkzeugen), registriert den MCP-Server im Benutzerbereich, verlinkt den Skill in ~/.claude/skills, fügt den Stop-Hook zu ~/.claude/settings.json hinzu und verlinkt speak und speak-auto in ~/.local/bin.

Starte Claude Code neu.

Verwendung

Sprich mit Claude:

  • „read that back to me“

  • „say it simply“

  • „what do you need from me, out loud“

  • „/speak decisions“

  • „stop“

Auto-Sprechen nach jeder Antwort:

speak-auto on            # brief style
speak-auto on decisions  # only the questions for you
speak-auto off

Während es spricht, verwende die Überlagerung oder sag es einfach:

  • „pause“, „resume“, „go back a sentence“, „skip that“, „stop“

Pause hält die genaue Position. Resume setzt von dort fort. Back spielt den vorherigen Satz erneut. Skip springt zum nächsten. Über Pause oder Fortsetzen wird nichts gesprochen; es passiert einfach.

Wähle eine Engine oder Stimme:

export SPEAK_ENGINE=edge
export SPEAK_VOICE=en-IE-ConnorNeural

Oder im Chat: „list the say voices“, „use Jamie from now on“.

So funktioniert es

Der Skill erklärt Claude, wie man für das Ohr schreibt: kurze Sätze, mit dem Punkt beginnen, Code beschreiben statt vorzulesen, mit der Entscheidung enden, die es von dir braucht. Claude ruft das speak-Tool mit diesem Skript auf.

Der Server entfernt übrig gebliebenes Markdown, teilt das Skript in Sätze auf und synthetisiert den nächsten Satz, während der aktuelle abgespielt wird.

Auf macOS übernimmt ein kleiner Swift-Helfer (overlay/main.swift) die Wiedergabe mit AVAudioPlayer und zeichnet die Überlagerung: ein immer im Vordergrund liegendes, nicht aktivierendes Panel, das nie den Fokus stiehlt. Node sendet ihm jeweils eine Satzdatei über JSON-Zeilen auf stdin, und es meldet finished, back oder stop auf stdout. Pause und Fortsetzen passieren im Helfer, sodass die Position exakt ist. Back und Skip teilen dem Server mit, welcher Satz als Nächstes abgespielt werden soll. Andernorts fällt der Server auf afplay oder ffplay ohne Überlagerung zurück.

Auto-Sprechen ist ein Stop-Hook von Claude Code. Wenn die Flagdatei ~/.config/speak/auto existiert, blockiert der Hook den Stopp einmal und bittet Claude, ein Skript im im File genannten Stil zu sprechen. Der stop_hook_active-Schutz verhindert eine Schleife.

Entwicklung

npm run dev        # run the server with tsx
npm test           # vitest
npm run typecheck

MIT.

A
license - permissive license
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

View all related MCP servers

Related MCP Connectors

  • Generate AI images, video, speech, music and presentations from Claude, ChatGPT and Cursor.

  • Connect Claude to Fathom meeting recordings, transcripts, and summaries

  • Persistent context for Claude. Your AI always knows your projects and next actions across sessions.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/CareyScott/speak'

If you have feedback or need assistance with the MCP directory API, please join our Discord server