embodied-mcp
embodied-nav-mcp
Ein Sprachmodell, das sich in einem Raum umsehen, zu dem gehen kann, was es benennt, zählen kann, was es sieht, und anhalten kann, wenn es fertig ist.
Das Modell entscheidet, was zu tun ist. Die Sensoren entscheiden, wo die Dinge sind.
Werkzeuge
Werkzeug | Funktion |
| Vier perspektivische Ansichten der 360°-Kamera, plus Pose |
| Referenzausdruck → Pixelbox → Lidar-Meter → vom Konverter eingerasteter Wegpunkt |
| Einen |
| Parken, damit der Planer aufhört, dem letzten Wegpunkt zu folgen |
| Eine Zählfrage in Ziel / Anker aufteilen |
| Nur diese Perspektive zählen; jede Instanz wird per Lidar positioniert |
| Blicke nach Position gruppieren; die Ganzzahl veröffentlichen |
| Lidar-AABB des letzten |
commit_count übernimmt keine Zahl vom Modell. Zwei Ansichten von vier Kissen ergeben 4, nicht 8.
Die Geometrie ist der Type-3-Stack von Team Xiao Heis feat/xiao-hei-instruction-merge: Größen-Gate, Blindkegel-Behandlung, Konverter-Settle-Pose, Parken beim Verlassen.
Installation
uv sync --extra dev
export ANTHROPIC_API_KEY=...
uv run pytestPython 3.11+. Live-Roboter/Simulation benötigt ROS Jazzy und den Autonomie-Stack. Tests verwenden einen simulierten Roboter und benötigen keines von beiden.
Ausprobieren
# Dry run, no ROS
uv run embodied-mcp-agent --fake "How many blue chairs are between the table and the wall?"
uv run embodied-mcp-agent --fake "Find the potted plant on the kitchen island closest to the fridge."
uv run embodied-mcp-agent --fake "Take the path near the window to the fridge."Auf einem Roboter (oder im Challenge-Container) mit laufendem Stack:
uv run embodied-mcp-challenge
# evaluators still run: ros2 launch dummy_vlm dummy_vlm.launchembodied-mcp --attach-ros sind dieselben Werkzeuge über stdio MCP. Der Challenge-Knoten ruft sie prozessintern auf: Ein Robotercontainer hat keine öffentliche URL für einen entfernten MCP-Connector.
CMU-VLN-Challenge
Drop-in-Adapter: examples/cmu_vln/. Der Paketname dummy_vlm ist unverändert.
Typ | Werkzeuge | ROS-Ausgabe |
Numerisch |
|
|
Objektreferenz |
|
|
Anweisungsbefolgung |
|
|
Zulässige Sensoren: /camera/image, /registered_scan, /terrain_map, /terrain_map_ext, /state_estimation. Die Ankunft wird über /state_estimation gemeldet, nicht über /way_point_reached. Eine Frage pro Prozess.
Konfiguration
Variable | Standard | |
| — | erforderlich |
|
| Host- und Pixel-Grounding-/Zählmodell |
|
| Sekunden ab Prozessstart |
|
| Kamera-Topic |
Lizenz
MIT. Eingebettete Geometrie und ROS-I/O von Team Xiao Hei; siehe NOTICE.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Connectors
Video scene understanding for AI agents via the Primate Vision API.
E2LLM gives your AI eyes and hands in a real browser: structured perception (SiFR) plus action.
Codebase intelligence for agents: 152 structured artifacts across 21 programs, one call.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/aryanmangal769/embodied-nav-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server