deepteam
Allows red-teaming against OpenAI-compatible endpoints, testing guardrails and attempting to bypass them to measure breaches.
Click on "Deploy Server".
Wait a few minutes for the server to deploy. Once ready, it will show a "Started" state.
In the chat, type
@followed by the MCP server name and your instructions, e.g., "@deepteamRun a red team against prompt injection and PII leakage with 2 attacks per type."
That's it! The server will respond to your query, and you can continue using it as needed.
Here is a step-by-step guide with screenshots.
deepteam-mcp
Expõe o DeepTeam (red-teaming de LLM) como ferramenta MCP via stdio, pra você testar guardrails por conversa no Claude Desktop.
Aponta o alvo pro sistema com guardrail (teu app atrás de LLM Guard, o Claude atrás do Straiker Defend, um gateway) e o DeepTeam mede o que fura.
Sem Docker. Roda direto num virtualenv do Python (3.10+). Nada de container, nada de Kali. Só
python -m venvepip.
Três modelos, de propósito separados
Papel | Quem é | Custo |
Alvo | o sistema atacado — Claude (Anthropic) ou qualquer endpoint OpenAI-compatível | teu |
Simulador | gera os ataques ( | tokens OpenAI |
Juiz | avalia se passou ( | tokens OpenAI |
Red-team queima crédito no simulador e no juiz, não só no alvo. Comece com
attacks_per_type=1e poucas vulnerabilidades. Dá pra trocar por modelo barato.
Related MCP server: AI Red Teaming MCP Server
Atacando o Claude — três camadas
"Claude Desktop" não é um endpoint, é um app. O DeepTeam precisa de um endpoint pra mandar o ataque e ler a resposta. Então escolha o que quer testar:
Alvo | O que mede | Config |
Claude via API | o guardrail do modelo (safety) |
|
API + system prompt | aproxima o Desktop (modelo + prompt) | acima + |
O app Desktop real | a superfície inteira, incl. inference hook / Straiker | não é endpoint — precisa dirigir a UI (computer-use). Fora do escopo deste server. |
O alvo default é claude-sonnet-5 via Anthropic. O simulador e o juiz do
DeepTeam continuam na OpenAI (chave barata) — eles não são o alvo.
Instalar (sem Docker)
Precisa só de Python 3.10+.
Opção A — script
git clone https://github.com/mbergo/deepteam-mcp.git ~/github/deepteam-mcp
cd ~/github/deepteam-mcp && ./install.shO install.sh cria um venv isolado em .venv/, instala tudo e imprime o bloco
pronto pro claude_desktop_config.json. Cole, preencha as chaves, reinicie o
Desktop.
Opção B — na mão (se preferir ver cada passo)
git clone https://github.com/mbergo/deepteam-mcp.git ~/github/deepteam-mcp
cd ~/github/deepteam-mcp
python3 -m venv .venv
.venv/bin/pip install -r requirements.txtDepois adicione ao claude_desktop_config.json
(~/.config/Claude/ no Linux, ~/Library/Application Support/Claude/ no macOS),
usando caminhos absolutos:
{
"mcpServers": {
"deepteam": {
"command": "/home/VOCE/github/deepteam-mcp/.venv/bin/python",
"args": ["/home/VOCE/github/deepteam-mcp/server.py"],
"env": {
"OPENAI_API_KEY": "sk-...", // simulador + juiz do DeepTeam
"TARGET_PROVIDER": "anthropic",
"TARGET_API_KEY": "sk-ant-...", // chave do alvo (Claude)
"TARGET_MODEL": "claude-sonnet-5"
// opcional: "TARGET_SYSTEM": "<system prompt p/ aproximar o Desktop>"
}
}
}
}Reinicie o Claude Desktop. A ferramenta deepteam aparece; peça "use
list_catalog".
Também funciona no Claude Code (
claude mcp add) e em qualquer cliente MCP que fale stdio — não só no Desktop.
Ferramentas expostas
list_catalog— vulnerabilidades e ataques disponíveis, e o alvo atual.red_team— roda a avaliação. Principais argumentos:vulnerabilities:["Bias","PromptLeakage"]ou com sub-tipos[{"name":"Bias","types":["race","gender"]}]single_turn_attacks:["PromptInjection","ROT13","Base64","Leetspeak"]multi_turn_attacks:["LinearJailbreaking","CrescendoJailbreaking"]attacks_per_type,simulator_model,evaluation_modeltarget_*pra sobrescrever o alvo por execução
Retorna o overview do risco, quantos ataques furaram (breaches) com amostras,
e salva o relatório completo em ~/deepteam-results/<timestamp>/.
Testando um guardrail — exemplo de conversa
"list_catalog" "red team contra PromptLeakage e PIILeakage, ataques PromptInjection e Base64, 2 por tipo"
Se o guardrail é bom, breaches ≈ 0. Cada breach é um caso concreto pra levar ao time — input, output e por que passou.
Aviso
Ferramenta ofensiva. Rode só contra alvo que você tem autorização para testar. Cada tool call é observável por camadas de monitoração (ex: Straiker Defend) — o que, num teste autorizado, é o teu próprio registro de escopo.
Licença
MIT.
This server cannot be deployed
Maintenance
Related MCP Connectors
Paid remote MCP for LLM security scans, jailbreak checks, analytics, checkout, and readiness.
35-probe LLM/agent security red-team scan (injection, jailbreak, MCP abuse) with report.
- QuallaaOAuthcom.quallaa
Talk to your public-facing AI from any MCP client — Claude, ChatGPT, Cursor, Cline, Windsurf.
MEOK MCP Hardening MCP — automated security red-team for any MCP server. Maps OWASP LLM Top 10
Related MCP Servers
AlicenseCqualityDmaintenanceIntegrates AI safety analysis, red-teaming, and prompt auditing directly into MCP-compatible clients like Claude Desktop and Cursor IDE, allowing real-time analysis of prompts and detection of jailbreak attempts.283Apache 2.0- AlicenseNot gradedqualityCmaintenanceAI red teaming toolkit exposed as a Model Context Protocol (MCP) server. Connect any MCP client and test AI systems for safety vulnerabilities.MIT
- AlicenseNot gradedqualityAmaintenanceAI-native security research platform that integrates Claude with MCP to execute real offensive security tools in an isolated Docker container, enabling natural language-driven recon, CVE scanning, Active Directory enumeration, and cryptographic posture assessment.1MIT
- AlicenseBqualityCmaintenanceEnables deterministic security testing of AI agents that use tools by serving synthetic MCP environments with poisoned data, fake secrets, and privileged actions. Records agent tool calls and evaluates security invariants (e.g., canary leaks, forbidden access, approval binding) without an LLM judge or real systems.8MIT