llm-eval-mcp
Server Configuration
Describes the environment variables required to run the server.
| Name | Required | Description | Default |
|---|---|---|---|
| DATABASE_URL | No | Database URL. Defaults to a local SQLite file (eval_runs.db) if not set. Use a PostgreSQL URL in production. | |
| GROQ_API_KEY | Yes | Groq API key for the judge. Required. Get one at https://console.groq.com |
Capabilities
Features and capabilities supported by this server
| Capability | Details |
|---|---|
| tools | {
"listChanged": false
} |
| prompts | {
"listChanged": false
} |
| resources | {
"subscribe": false,
"listChanged": false
} |
| experimental | {} |
Tools
Functions exposed to the LLM to take actions
| Name | Description |
|---|---|
| generate_adversarial_tasksA | Génère des tâches de test adversariales pour éprouver un agent LLM. Appelle cet outil quand tu veux construire un jeu de tests ciblant un mode de défaillance précis (hallucination, injection de prompt, non-respect des consignes, sortie dangereuse, erreur de raisonnement, mauvais usage d'outil). Chaque tâche inclut le comportement attendu, qui sert de référence au juge. Args: category: La famille de défaillance à cibler. count: Nombre de tâches à générer (entre 1 et 50). Par défaut 5. Returns: La liste des tâches adversariales annotées. |
| run_llm_as_judgeA | Évalue la réponse d'un agent à une consigne, via un juge LLM. Compare Args: prompt: La consigne qui avait été soumise à l'agent. expected_behavior: Le comportement attendu d'un bon agent (référence). answer: La réponse produite par l'agent, à évaluer. Returns: Le verdict structuré du juge. |
| get_eval_statsA | Renvoie des statistiques agrégées sur toutes les évaluations enregistrées. Fournit le nombre total d'évaluations, le nombre de réussites, le taux de réussite (0 à 1) et le score moyen. Ne nécessite pas de clé API. Returns: Les statistiques agrégées. |
Prompts
Interactive templates invoked by user choice
| Name | Description |
|---|---|
No prompts | |
Resources
Contextual data attached and managed by the client
| Name | Description |
|---|---|
No resources | |
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/cdywolf/llm-eval-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server