Skip to main content
Glama

Server Configuration

Describes the environment variables required to run the server.

NameRequiredDescriptionDefault
DATABASE_URLNoDatabase URL. Defaults to a local SQLite file (eval_runs.db) if not set. Use a PostgreSQL URL in production.
GROQ_API_KEYYesGroq API key for the judge. Required. Get one at https://console.groq.com

Capabilities

Features and capabilities supported by this server

CapabilityDetails
tools
{
  "listChanged": false
}
prompts
{
  "listChanged": false
}
resources
{
  "subscribe": false,
  "listChanged": false
}
experimental
{}

Tools

Functions exposed to the LLM to take actions

NameDescription
generate_adversarial_tasksA

Génère des tâches de test adversariales pour éprouver un agent LLM.

Appelle cet outil quand tu veux construire un jeu de tests ciblant un mode de défaillance précis (hallucination, injection de prompt, non-respect des consignes, sortie dangereuse, erreur de raisonnement, mauvais usage d'outil). Chaque tâche inclut le comportement attendu, qui sert de référence au juge.

Args: category: La famille de défaillance à cibler. count: Nombre de tâches à générer (entre 1 et 50). Par défaut 5.

Returns: La liste des tâches adversariales annotées.

run_llm_as_judgeA

Évalue la réponse d'un agent à une consigne, via un juge LLM.

Compare answer au expected_behavior attendu pour la prompt donnée, et renvoie un verdict structuré : réussite (booléen), score de 1 à 5, et une courte justification. Utile pour noter automatiquement les réponses d'un agent testé sur des tâches adversariales.

Args: prompt: La consigne qui avait été soumise à l'agent. expected_behavior: Le comportement attendu d'un bon agent (référence). answer: La réponse produite par l'agent, à évaluer.

Returns: Le verdict structuré du juge.

get_eval_statsA

Renvoie des statistiques agrégées sur toutes les évaluations enregistrées.

Fournit le nombre total d'évaluations, le nombre de réussites, le taux de réussite (0 à 1) et le score moyen. Ne nécessite pas de clé API.

Returns: Les statistiques agrégées.

Prompts

Interactive templates invoked by user choice

NameDescription

No prompts

Resources

Contextual data attached and managed by the client

NameDescription

No resources

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/cdywolf/llm-eval-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server