speak
speak
Bitte Claude, seine Antwort laut vorzulesen.
Kein Text-to-Speech-Dump der rohen Antwort. Du sagst „read that back to me simply“ und Claude schreibt das Gesagte als kurzes gesprochenes Skript um und spielt es dann ab. Das Skript erscheint nie im Chat. Es ist ein Gespräch zwischen dir und dem Modell, wobei der Text aus dem Weg bleibt.
Funktioniert heute in Claude Code. Die Wiedergabeseite ist ein einfacher MCP-Server, sodass er auch in Claude Desktop, Cursor oder jeden MCP-Client eingebunden werden kann.
Was du bekommst
speak-MCP-Server mit den Toolsspeak,stop,pause,resume,back,skip,add_pronunciation,list_pronunciations,list_voices,set_defaultSchwebende Überlagerung auf macOS, während Claude spricht: eine kleine Pille über jedem Fenster mit einer Live-Wellenform, einen Satz zurück, einen Satz überspringen, an genau dieser Stelle pausieren und fortsetzen, stoppen
/speak-Skill für Claude Code, mit Stilen:simple(Standard),brief,decisions,full,eli5Auto-Sprechen: ein
Stop-Hook, der nach jeder Antwort einbrief-Skript liest, standardmäßig deaktiviertspeak-CLI:echo "hello" | speakRaycast-Skriptbefehle:
Speakliest den ausgewählten Text wie geschrieben,Speak Simplyschreibt ihn zuerst mitclaude -pals kurze gesprochene Zusammenfassung um,Speak Translatedübersetzt ihn zuerst (standardmäßig Englisch; gib eine andere Sprache als Argument des Befehls ein oder setzeSPEAK_TRANSLATE_LANGUAGE, um den Standard zu ändern). Eine nicht-englische Übersetzung wird mit einer passenden installierten macOS-Stimme gelesen, zuerst die beste verfügbare (Premium, dann Enhanced, dann kompakt); Englisch lässt deine normale Stimme unberührt. Lade die Premium-Stimme für eine Sprache in Systemeinstellungen > Bedienungshilfen > Vorlesen & Sprechen > Systemstimme > Stimmen verwalten herunter, um die gute zu bekommen.Speak Stopstoppt. Sie kopieren die Auswahl mit einem simulierten Cmd+C, daher benötigt Raycast die Bedienungshilfen-Berechtigung.
Related MCP server: MCP Audio Server
Engines
Engine | Kosten | Benötigt | Hinweise |
| kostenlos | macOS | Standard. Lade eine Premium- oder Enhanced-Stimme in Systemeinstellungen > Bedienungshilfen > Gesprochene Inhalte herunter, um gute Qualität zu erhalten. Setze eine Siri-Stimme als Systemstandard und das nackte |
| kostenlos | Netzwerk | Microsoft-Neuralstimmen über |
| kostenlos |
| Lokales neuronales TTS, läuft auf der CPU. |
| kostenpflichtig |
|
|
| kostenlose Stufe |
|
|
Eine Stimme auf macOS auswählen
Die Standard-say-Engine verwendet die Systemstimme deines Macs. Richte sie also einmal in macOS ein, und jedes Vorlesen verwendet sie:
Öffne Systemeinstellungen > Bedienungshilfen > Vorlesen & Sprechen (auf älteren Versionen „Gesprochene Inhalte“).
Wähle unter Systemstimme eine Stimme aus. Apple liefert eine große Bibliothek pro Sprache; die Premium- und Enhanced-Stimmen werden bei Bedarf heruntergeladen und klingen viel besser als die kompakten Standardstimmen. Siri-Stimmen können hier ebenfalls ausgewählt werden.
Stelle die Sprechgeschwindigkeit nach Geschmack ein.
Aussprachen
Sag Claude im Chat:
„pronounce fancyapp as fan-see-app from now on“
„what pronunciations have you saved“
Sie liegen in ~/.config/speak/pronunciations.json (überschreibe den Ordner mit SPEAK_CONFIG_DIR), werden ganzwortig und ohne Beachtung der Groß-/Kleinschreibung abgeglichen und auf jedes Vorlesen angewendet:
{
"fancyapp": "fan-see-app",
"OAuth": "oh auth"
}Links und E-Mails werden gesprochen gelesen: https://example.com/login wird zu „example dot com slash login“, jane@example.de wird zu „jane at example dot d e“. Kurze Endungen wie de, io, co.uk werden Buchstabe für Buchstabe buchstabiert, da „de“ als Wort gelesen wie „duh“ klingt.
Wörter mit zwei Lesarten („live“, „read“, „lead“) können nicht durch eine Wortliste behoben werden. Der Skill weist Claude an, sie im Skript neu zu buchstabieren, damit die Stimme nicht falsch raten kann: „lyive“ für live wie in lebendig, „red“ für read in der Vergangenheitsform, „led“ für das Metall. Der Skill führt eine Tabelle der üblichen Übeltäter und prüft das Skript vor dem Sprechen dagegen.
Lasse SPEAK_VOICE ungesetzt, um der Systemstimme zu folgen, oder setze es auf einen Stimmenamen aus say -v ?, um nur für Claude zu überschreiben.
Die erste verfügbare Engine gewinnt, sofern du nicht SPEAK_ENGINE setzt. SPEAK_VOICE legt die Stimme fest. Beide können pro Sitzung mit dem set_default-Tool geändert werden („switch to the edge engine“).
Installation
Setze RAYCAST_SCRIPTS_DIR auf ein Verzeichnis, das bereits in Raycast hinzugefügt wurde (Einstellungen > Erweiterungen > Skriptbefehle), und die Befehle werden darin verlinkt. Ohne dies füge raycast/ aus diesem Repository einmal manuell dort hinzu.
RAYCAST_SCRIPTS_DIR=~/raycast-scripts ./install.shBenötigt Node 20+, jq und Claude Code.
git clone https://github.com/CareyScott/speak
cd speak
./install.shDies baut den Server und den macOS-Overlay-Helfer (benötigt swiftc aus den Xcode-Kommandozeilenwerkzeugen), registriert den MCP-Server im Benutzerbereich, verlinkt den Skill in ~/.claude/skills, fügt den Stop-Hook zu ~/.claude/settings.json hinzu und verlinkt speak und speak-auto in ~/.local/bin.
Starte Claude Code neu.
Verwendung
Sprich mit Claude:
„read that back to me“
„say it simply“
„what do you need from me, out loud“
„/speak decisions“
„stop“
Auto-Sprechen nach jeder Antwort:
speak-auto on # brief style
speak-auto on decisions # only the questions for you
speak-auto offWährend es spricht, verwende die Überlagerung oder sag es einfach:
„pause“, „resume“, „go back a sentence“, „skip that“, „stop“
Pause hält die genaue Position. Resume setzt von dort fort. Back spielt den vorherigen Satz erneut. Skip springt zum nächsten. Über Pause oder Fortsetzen wird nichts gesprochen; es passiert einfach.
Wähle eine Engine oder Stimme:
export SPEAK_ENGINE=edge
export SPEAK_VOICE=en-IE-ConnorNeuralOder im Chat: „list the say voices“, „use Jamie from now on“.
So funktioniert es
Der Skill erklärt Claude, wie man für das Ohr schreibt: kurze Sätze, mit dem Punkt beginnen, Code beschreiben statt vorzulesen, mit der Entscheidung enden, die es von dir braucht. Claude ruft das speak-Tool mit diesem Skript auf.
Der Server entfernt übrig gebliebenes Markdown, teilt das Skript in Sätze auf und synthetisiert den nächsten Satz, während der aktuelle abgespielt wird.
Auf macOS übernimmt ein kleiner Swift-Helfer (overlay/main.swift) die Wiedergabe mit AVAudioPlayer und zeichnet die Überlagerung: ein immer im Vordergrund liegendes, nicht aktivierendes Panel, das nie den Fokus stiehlt. Node sendet ihm jeweils eine Satzdatei über JSON-Zeilen auf stdin, und es meldet finished, back oder stop auf stdout. Pause und Fortsetzen passieren im Helfer, sodass die Position exakt ist. Back und Skip teilen dem Server mit, welcher Satz als Nächstes abgespielt werden soll. Andernorts fällt der Server auf afplay oder ffplay ohne Überlagerung zurück.
Auto-Sprechen ist ein Stop-Hook von Claude Code. Wenn die Flagdatei ~/.config/speak/auto existiert, blockiert der Hook den Stopp einmal und bittet Claude, ein Skript im im File genannten Stil zu sprechen. Der stop_hook_active-Schutz verhindert eine Schleife.
Entwicklung
npm run dev # run the server with tsx
npm test # vitest
npm run typecheckMIT.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityFmaintenanceEnables Claude and other AI assistants to interact with your computer's audio system, allowing for recording from microphones and playing audio through speakers.9MIT
- AlicenseNot gradedqualityDmaintenanceEnables text-to-speech conversion with smart language detection (using Google TTS for Chinese) and audio file playback with playback controls for Claude Desktop.3MIT
- AlicenseNot gradedqualityBmaintenanceEnables text-to-speech conversion using OpenAI's TTS API, with inline audio playback and history within MCP hosts like Claude.4BSD 2-Clause "Simplified"
- FlicenseAqualityCmaintenanceEnables Claude to speak responses out loud using ElevenLabs text-to-speech API, with tools to list voices and convert text to speech.2
Related MCP Connectors
Generate AI images, video, speech, music and presentations from Claude, ChatGPT and Cursor.
Connect Claude to Fathom meeting recordings, transcripts, and summaries
Persistent context for Claude. Your AI always knows your projects and next actions across sessions.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/CareyScott/speak'
If you have feedback or need assistance with the MCP directory API, please join our Discord server